Сегодня родился Бенедикт Киберксюш
Open in Telegram
254
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Repost from Just links
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model https://arxiv.org/abs/2310.17653
Позвольте немного бесстыжего самопродвижения: мы с коллегами из град скула (Berlin School of Mind & Brain) сделали подкаст про ментальное здоровье в академии, нацеленный на град студентов и early career researchers:
https://smartandwell.buzzsprout.com (иконки под описанием ведут на популярные подкаст-платформ). Я там выступаю в роли ведущей, и это был мой первый такой опыт – так что не судите строго, но вообще там главное что говорят гости подкаста. Мои любимые выпуски про СДВГ и про тревожность (который был очень подходяще записан за день до сдачи моей докторской, хаха). Фил фри поделиться им со всеми, кому это может быть интересно и актуально (на мой взгляд, не только людям в академии).
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
https://arxiv.org/abs/2310.01852
Repost from Hacker News
Causal inference as a blind spot of data scientists (Score: 151+ in 8 hours)
Link: https://readhacker.news/s/5RLvp
Comments: https://readhacker.news/c/5RLvp
Learning to Taste: A Multimodal Wine Dataset
https://arxiv.org/abs/2308.16900
It's an Alignment, Not a Trade-off: Revisiting Bias and Variance in Deep Models
https://arxiv.org/abs/2310.09250
Repost from Hacker News
Inverted Transformers Are Effective for Time Series Forecasting (Score: 150+ in 14 hours)
Link: https://readhacker.news/s/5RwYT
Comments: https://readhacker.news/c/5RwYT
LCMs can be distilled from any pre-trained Stable Diffusion (SD) in only 4,000 training steps (~32 A100 GPU Hours) for generating high quality 768 x 768 resolution images in 2~4 steps or even one step, significantly accelerating text-to-image generation.
https://latent-consistency-models.github.io/
Repost from Just links
SWE-bench Can Language Models Resolve Real-World GitHub Issues? http://www.swebench.com/
Repost from epsilon correct
На HackerNews завирусилось, что мы релизнули кусок библиотеки для анализа графов. Поскольку документации в релизе особо нет (🤦♂️), хочу быстренько рассказать, что там вообще сейчас есть и что будет.
Во-первых, этот кусок библиотеки – только для анализа графов, которые влезают в оперативную память. Не надо пугаться – с нужным сжатием в память влезают графы с парой миллиардов вершин – хватит, чтобы проанализировать фейсбук. 🤓
Во-вторых, основной кусок, который заопенсоршен – про кластеризацию. У нас довольно хорошо работает иерархическая кластеризация, есть статьи на ICML/NeurIPS [1, 2, 3]. Вот её и постарались опенсорсить в первую очередь – в sklearn дай боже получится кластеризовать датасет на 20к вершин (😮💨) а у нас получается миллиард. 📈
До конца года хочу выпустить наш код для in-memory эмбеддингов туда же. Будет быстро, обещаю. ✨
Repost from Concise Research
Demystifying CLIP Data
Мультимодальные (картинка/текст) модели, полученные с помощью self-supervised learning (SSL) такие как CoCa, DINO (v1, v2), CLIP и др. используются для задач фильтрации данных, поиска, zero-shot классификации/сегментации. В недавней работе DataComp было показано, что ключевым фактором фактором получения качественных SSL моделей является правильная подготовка данных, преимущественно за счет фильтрации “грязных” данных, распаршенных из интернета.
В этой работе авторы продолжают изучение данных и ставят своей целью воспроизвести закрытый пайплайн подготовки датасета для обучения CLIP. Нужно это для лучшего понимания влияния различных факторов на качество и для его последующей максимизации.
Пайплайн состоит из нескольких стадий:
1. Подготовка metadata - набора концептов, определяющего состав датасета. Получается парсингом часто встречающихся в Википедии слов.
2. Substring matching: первая стадия фильтрации смеси открытых датасетов, наибольший из которых - Common Crawl. Пара текст-картинка проходит фильтр если текст содержит концепт в качестве подстроки.
3. Inverted indexing - каждому концепту ставится в соответствие список найденых текстов. Интересно, что для многих концептов (114к/500к) не находится ни одного текста, а основу (94%) составляют тесты для всего 16к основных концептов. Такой дисбаланс - мотивация для следующего шага.
4. Перебалансировка: для распространенных концептов (>20к текстов) семлируют 20к пар.
5. Семплирование: концепты семлпируются равновероятно, при этом каждая пара семплируется с верояностью, обратно пропорциональной размеру подвыборке концепта. Это позволяет сохранить баланс при использовании разнообразия внутри больших концептных групп.
В итоге, авторы чуть перестарались и не просто повторили, но и превзошли исходный CLIP на 0.7-2.1% в терминах zero-shot на ImageNet в зависимости от размера модели. В аблейшене показали оптимальность магического размера группы концептов (20к пар). Код, веса, метадата выложены.
Repost from Техножрица 👩💻👩🏫👩🔧
Дорогие читатели!
Сегодня я сделала шпаргалку по самым известным научным конференциям уровня A* (по CORE2023), связанным с машинным обучением. Большими сойджеками выделены конференции с более высоким h5-индексом в Google Scholar, а маленькими - с h5-индексом поменьше. Забирайте на стену, чтобы не забыть, куда подавать статьи, чтобы потом делать самое сойджековское лицо в своем офисе!
#ML_в_мемах
Repost from Hacker News
Modular forms, the ‘fifth fundamental operation’ of math (Score: 150+ in 23 hours)
Link: https://readhacker.news/s/5Qanx
Comments: https://readhacker.news/c/5Qanx
