en
Feedback
🍳 Датазавтраки ☕️ НСК (Академ)

🍳 Датазавтраки ☕️ НСК (Академ)

Open in Telegram

Каждый вторник с 8:30 до 10:00 в "Shurubor coffeeshop" у фонтана ТЦ https://go.2gis.com/wlkqi

Show more
266
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Про статью Topological Data analysis: Для трансформерной модели мы можем дополнительно найти алгебраические и топологические features. Авторы используют эти фичи для задачи распознавания звука. Топологические выглядят так: 1. Для каждого self-attention слоя смотрим на выход софтмакса (то есть, на attention map). 2. Представляем этот выход в виде графа, где строки и столбцы показывают узлы графа, а значение софтмакса - вес рёбра между этими узлами. 3. Бинаризируем значения рёбер по порогу. Тогда ребро исчезает, если у него нулевой вес На третей строке картинки показано множество графов, бинаризированных по порогам тау = 0.025, ..., 0.75 (L - номер слоя, H - номер головы). Для тау = 0 граф является полносвязным, для тау = 1 - ребер нет 4. Смотрим на связи между узлами графа. В графе появляется дырка первой размерности, когда на текущей отсечке тау ребро цикла пропадает. Например, на картинке для тау = 0.025 виден цикл в виде квадрата, который пропадает на тау = 0.1 Дырка нулевой размерности появляется, когда пропадает ребро между вершинами и появляется новая компонента связности. Вот здесь написано, что означают эти дырки в математическом плане: ссылка 5. Разность между порогами тау, когда дырка появляется и пропадает, называется ее временем жизни. Среднее значение времен жизни всех дырок каждой размерности - топологические свойства (в статье называются barcode features) графа 6. Пусть в модели сорок self-attention слоев. Тогда для модели мы получим два вектора размером сорок, каждое значение которого - среднее время жизни. Эти векторы можно сконкатенировать и использовать как features для задачи. Вот здесь их используют как дополнительные фичи для нахождения текстов, сгенерированных моделями. 7. Кроме баркодов можно получить features из Representation Toplogy Divergence, ссылка. Я не понял, как это можно сделать Алгебраические выглядят так: Это сумма верхнетреугольной матрицы attention map размером N на N (то есть, все, что ниже главной диагонали, маскировано), нормализованная на N^2. Зачем это все: 1. Авторы показывают, что для частных задач можно использовать только предобученную модель для специализированной задачи. То есть, топологические фичи инварианты к небольшим сдвигам домена. 2. Такие фичи хорошо интерпретируются (смотрите статью)

Упоминал всуе Евгения Петровича Вдовина и его постоянный труд по реформе математического образования. Наверное, лучше ссылку на вконтакт кинуть https://vk.com/veprus1

Рассказывал про статью https://arxiv.org/abs/2404.03592 сегодня буду в 2100 нск рассказывать про нее у Лены с Настей https://t.me/+fQ07VSVJ2V8yZGYy

Видео про топологический анализ данных (тут про Ripster - одну из библиотек) https://www.youtube.com/watch?v=jgVr4FIySw4

Библиотеки для топологического анализа данных (с хорошими объяснениями в документации) * https://docs.scikit-tda.org/en/latest/ * https://github.com/GUDHI/TDA-tutorial

На датазавтраке рассказывал про использование топологического анализа данных в генетике - алгоритм Mapper Презентация https://peekxc.github.io/resources/DSSC_TDA_selected_slides.pdf Библиотека (одна из) https://kepler-mapper.scikit-tda.org/en/latest/ Видео с объяснениями https://www.youtube.com/watch?v=NlMrvCYlOOQ Статья с разбором https://www.quantmetry.com/blog/topological-data-analysis-with-mapper/ Исходная статья 2007 года https://research.math.osu.edu/tgda/mapperPBG.pdf

Рассказ Бурнаева про топологический анализ на конференции DataFusion 2024 https://broadcast.comdi.com/player/ruil8mxd

Lux: A Python API for Intelligent Visual Discovery — Lux 0.1.2 documentation https://lux-api.readthedocs.io/en/latest/

07.05.2024 🍳 датазавтраки по вторникам ☕️ в Новосибирском Академгородке с 8:30 до 10:00 в "Shurubor coffeeshop" у фонтана ТЦ https://go.2gis.com/wlkqi А потом датазавтрак уйдет на две недели на каникулы. Давайте бахнем кофейку перед отпуском.

Тут кстати Марк подкаст со мной выложил https://music.yandex.ru/album/27545130/track/125259140 Марк и Игорь делают на датафесте секцию про RAG и Advanced LLM - вдруг кто-то хочет выступить https://forms.gle/3BCE1vEAEJ7rLM1M7 регистрируйтесь. Думаю, что это будет одна из лучших секций на датафесте

Мольнар больше известен своей открытой книгой (и заодно своей диссертацией) про интепретируемость https://christophm.github.io/interpretable-ml-book/

Рассказывал про книжку Мольнара Modeling Mindsets https://christophmolnar.com/books/modeling-mindsets/

Рассказывал про подкаст Дайте Данных - к сохалению, не помню, в каком из выпусков они говорили про многокритериальную оптимизацию https://music.yandex.ru/album/17832170?activeTab=track-list