en
Feedback
Сегодня родился Бенедикт Киберксюш

Сегодня родился Бенедикт Киберксюш

Open in Telegram

не читал, но обсуждаю @susie_ku

Show more
254
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Repost from Just links
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model https://arxiv.org/abs/2310.17653

Позвольте немного бесстыжего самопродвижения: мы с коллегами из град скула (Berlin School of Mind & Brain) сделали подкаст про ментальное здоровье в академии, нацеленный на град студентов и early career researchers: https://smartandwell.buzzsprout.com (иконки под описанием ведут на популярные подкаст-платформ). Я там выступаю в роли ведущей, и это был мой первый такой опыт – так что не судите строго, но вообще там главное что говорят гости подкаста. Мои любимые выпуски про СДВГ и про тревожность (который был очень подходяще записан за день до сдачи моей докторской, хаха). Фил фри поделиться им со всеми, кому это может быть интересно и актуально (на мой взгляд, не только людям в академии).

LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment https://arxiv.org/abs/2310.01852

Repost from Hacker News
Causal inference as a blind spot of data scientists (Score: 151+ in 8 hours) Link: https://readhacker.news/s/5RLvp Comments: https://readhacker.news/c/5RLvp

It's an Alignment, Not a Trade-off: Revisiting Bias and Variance in Deep Models https://arxiv.org/abs/2310.09250

Repost from Hacker News
Inverted Transformers Are Effective for Time Series Forecasting (Score: 150+ in 14 hours) Link: https://readhacker.news/s/5RwYT Comments: https://readhacker.news/c/5RwYT

LCMs can be distilled from any pre-trained Stable Diffusion (SD) in only 4,000 training steps (~32 A100 GPU Hours) for generating high quality 768 x 768 resolution images in 2~4 steps or even one step, significantly accelerating text-to-image generation. https://latent-consistency-models.github.io/

Repost from Just links
SWE-bench Can Language Models Resolve Real-World GitHub Issues? http://www.swebench.com/

Repost from epsilon correct
На HackerNews завирусилось, что мы релизнули кусок библиотеки для анализа графов. Поскольку документации в релизе особо нет (🤦‍♂️), хочу быстренько рассказать, что там вообще сейчас есть и что будет. Во-первых, этот кусок библиотеки – только для анализа графов, которые влезают в оперативную память. Не надо пугаться – с нужным сжатием в память влезают графы с парой миллиардов вершин – хватит, чтобы проанализировать фейсбук. 🤓 Во-вторых, основной кусок, который заопенсоршен – про кластеризацию. У нас довольно хорошо работает иерархическая кластеризация, есть статьи на ICML/NeurIPS [1, 2, 3]. Вот её и постарались опенсорсить в первую очередь – в sklearn дай боже получится кластеризовать датасет на 20к вершин (😮‍💨) а у нас получается миллиард. 📈 До конца года хочу выпустить наш код для in-memory эмбеддингов туда же. Будет быстро, обещаю. ✨

Repost from Concise Research
Demystifying CLIP Data Мультимодальные (картинка/текст) модели, полученные с помощью self-supervised learning (SSL) такие как
Demystifying CLIP Data Мультимодальные (картинка/текст) модели, полученные с помощью self-supervised learning (SSL) такие как CoCa, DINO (v1, v2), CLIP и др. используются для задач фильтрации данных, поиска, zero-shot классификации/сегментации. В недавней работе DataComp было показано, что ключевым фактором фактором получения качественных SSL моделей является правильная подготовка данных, преимущественно за счет фильтрации “грязных” данных, распаршенных из интернета. В этой работе авторы продолжают изучение данных и ставят своей целью воспроизвести закрытый пайплайн подготовки датасета для обучения CLIP. Нужно это для лучшего понимания влияния различных факторов на качество и для его последующей максимизации. Пайплайн состоит из нескольких стадий: 1. Подготовка metadata - набора концептов, определяющего состав датасета. Получается парсингом часто встречающихся в Википедии слов. 2. Substring matching: первая стадия фильтрации смеси открытых датасетов, наибольший из которых - Common Crawl. Пара текст-картинка проходит фильтр если текст содержит концепт в качестве подстроки. 3. Inverted indexing - каждому концепту ставится в соответствие список найденых текстов. Интересно, что для многих концептов (114к/500к) не находится ни одного текста, а основу (94%) составляют тесты для всего 16к основных концептов. Такой дисбаланс - мотивация для следующего шага. 4. Перебалансировка: для распространенных концептов (>20к текстов) семлируют 20к пар. 5. Семплирование: концепты семлпируются равновероятно, при этом каждая пара семплируется с верояностью, обратно пропорциональной размеру подвыборке концепта. Это позволяет сохранить баланс при использовании разнообразия внутри больших концептных групп. В итоге, авторы чуть перестарались и не просто повторили, но и превзошли исходный CLIP на 0.7-2.1% в терминах zero-shot на ImageNet в зависимости от размера модели. В аблейшене показали оптимальность магического размера группы концептов (20к пар). Код, веса, метадата выложены.

Дорогие читатели! Сегодня я сделала шпаргалку по самым известным научным конференциям уровня A* (по CORE2023), связанным с ма
Дорогие читатели! Сегодня я сделала шпаргалку по самым известным научным конференциям уровня A* (по CORE2023), связанным с машинным обучением. Большими сойджеками выделены конференции с более высоким h5-индексом в Google Scholar, а маленькими - с h5-индексом поменьше. Забирайте на стену, чтобы не забыть, куда подавать статьи, чтобы потом делать самое сойджековское лицо в своем офисе! #ML_в_мемах

Repost from Hacker News
Modular forms, the ‘fifth fundamental operation’ of math (Score: 150+ in 23 hours) Link: https://readhacker.news/s/5Qanx Comments: https://readhacker.news/c/5Qanx