MadML 🚀
前往频道在 Telegram
MadML Talks — это инициатива ML-сообщества Mad Devs, где каждые две недели по четвергам (18:00 по Бишкеку) эксперты из сферы машинного обучения и ИИ делятся своими знаниями и опытом. Ссылка на встречу: meet.google.com/ryk-irww-moz
显示更多未指定国家未指定类别
281
订阅者
无数据24 小时
+17 天
+230 天
吸引订阅者
三月 '26
三月 '26
+3
在0个频道中
二月 '26
+7
在0个频道中
Get PRO
一月 '26
+19
在1个频道中
Get PRO
十二月 '25
+23
在1个频道中
Get PRO
十一月 '25
+20
在1个频道中
Get PRO
十月 '25
+117
在3个频道中
Get PRO
九月 '25
+113
在2个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 29 三月 | 0 | |||
| 28 三月 | 0 | |||
| 27 三月 | 0 | |||
| 26 三月 | 0 | |||
| 25 三月 | 0 | |||
| 24 三月 | 0 | |||
| 23 三月 | 0 | |||
| 22 三月 | +1 | |||
| 21 三月 | +1 | |||
| 20 三月 | 0 | |||
| 19 三月 | 0 | |||
| 18 三月 | 0 | |||
| 17 三月 | 0 | |||
| 16 三月 | 0 | |||
| 15 三月 | 0 | |||
| 14 三月 | 0 | |||
| 13 三月 | 0 | |||
| 12 三月 | 0 | |||
| 11 三月 | +1 | |||
| 10 三月 | 0 | |||
| 09 三月 | 0 | |||
| 08 三月 | 0 | |||
| 07 三月 | 0 | |||
| 06 三月 | 0 | |||
| 05 三月 | 0 | |||
| 04 三月 | 0 | |||
| 03 三月 | 0 | |||
| 02 三月 | 0 | |||
| 01 三月 | 0 |
频道帖子
В конце прошлого года OpenAI анонсировала Apps SDK, а позже открыла возможность регистрации собственных приложений. Что это дает? Теперь вы можете создавать собственные приложения, разворачивая MCP серверы, и регистрировать их в OpenAI и тогда любой пользователь ChatGPT сможет подключать их (или триггерить специальными фразами) и обращаться к вашему серверу. Уже сейчас магазин приложений достаточно широк и вы можете подключить Booking или сервисы Google.
Для одного из наших заказчиков мы как раз и занимемся разработкой такого приложения. И в ходе тестирования и дебаггинга сервиса обнаружилось интересное поведение: оказывается, ChatGPT довольно охотно раскрывает конфигурации тулов MCP сервера. Формально, это публичная информация. Но с другой стороны в описании тулов содержатся фактические инструкции для агента, Enum-ы и Literal-ы, промпты и ресурсы. Мне даже удавалось вытаскивать сообщения об ошибках и exceptions в ходе тестирования приложения.
При этом, многие приложения не требуют аутентификации и если каким-либо образом удастся узнать адрес MCP сервера (ChatGPT этого, к счастью, не знает), то это откроет простор для различных атак. В целом, ничего не мешает абьюзить сервер из чата, хотя это и может оказаться дороже для самого злоумышленника.
На скриншотах выше, например, информация, которую можно узнать о том же приложении Booking.
Самое интересное, что OpenAI сами предупреждают об опасностях инъекций для публичных MCP серверов, но ситация все равно сомнительная. Кажется, им нужно дотюнить аллаймент для приложений.
| 2 | 没有文字... | 206 |
| 3 | Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home | 228 |
| 4 | Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home | 2 |
| 5 | По техническим причинам звонок переносится в google meet
Video call link: https://meet.google.com/ryk-irww-moz | 81 |
| 6 | Начинаем через 5 минут: https://telemost.yandex.ru/j/40564204453826 | 45 |
| 7 | TnT-LLM: Text Mining at Scale with Large Language Models
Разметка больших текстовых корпусов вручную занимает недели и почти не масштабируется. В этом докладе мы покажем TnT-LLM — фреймворк на базе больших языковых моделей, который автоматически строит иерархии меток и создаёт псевдоразметку.
Разберём, как двухэтапный подход (генерация таксономии → разметка текста) позволяет ускорить создание классификаторов и обсудим реальные кейсы применения — от анализа пользовательских намерений до контент-понимания.
Доклад будет полезен исследователям и инженерам, работающим с задачами текстового майнинга, кластеризации, автоматической разметки и созданием классификаторов на основе текстов.
Спикер
Владислав Попов, Machine Learning Engineer
Время и дата
4 декабря, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
https://telemost.yandex.ru/j/40564204453826 | 964 |
| 8 | Материалы встречи 6.11.2025
Спикер: Алина Бурыкина, Machine Learning Engineer, Mad Devs
Доклад: Intro to Contrastive Learning: теория, интуиция и современные подходы
Запись на YouTube: https://www.youtube.com/watch?v=HCb0VNpjGCM | 310 |
| 9 | Intro to Contrastive Learning: теория, интуиция и современные подходы
Контрастивное обучение стало краеугольным камнем современных self-supervised методов в компьютерном зрении и за его пределами.
В этом докладе мы разберём ключевые идеи, лежащие в основе подхода — от информационно-теоретических принципов (взаимная информация, InfoNCE) до практических реализаций. Рассмотрим классические методы с отрицательными примерами (SimCLR, MoCo), подходы без негативов (BYOL, SimSiam) и модели, вдохновлённые кластеризацией.
Доклад будет интересен инженерам и исследователям, работающим с представлениями данных, self-supervised и foundation-моделями.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
6 ноября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 091 |
| 10 | Запись доклада доступна по ссылке: https://www.youtube.com/watch?v=0XhFB9OItqw 🚀 | 556 |
| 11 | Презентация сегодняшнего доклада | 684 |
| 12 | Через 10 минут начинаем | 615 |
| 13 | Schema-guided reasoning: как заставить LLM быть умнее.
В докладе рассмотрим SGR подход, который повышает бизнес-метрики и заставляет ризонить модели не обученные для этого. Возможно, вы уже использовали этот подход, но не знали об этом. Так же рассмотрим плюсы и минусы SGR и посмотрим, как собрать LLM агента без специальных фреймворков практически на чистом OpenAI SDK.
Сложность 3/10.
Спикер: Александр Брыль, ML инженер Mad Devs.
Дата и время: 25 сентября, четверг, в 18:00 (по Бишкеку).
Ссылка на встречу: meet.google.com/ryk-irww-moz | 1 683 |
| 14 | А вы замечали, что ЛЛМ могут быть не особо разнообразны в своих генерациях?
Все мы знаем, что уже давно принято добавлять синтетические данные для обучения новых моделей. Это дешевле, безопаснее, решает проблему регуляризации и репрезентации (аугментирование данных). Именно с одной из таких проблем мы столкнулись в работе.
Нам необходимо было построить модель классификации, которая бы относила пользовательский запрос к одному из 150 классов. Изначально у нас не было хорошей разметки и мы учили модели по косвенным признакам. Со временм мы построили систему сбора данных для новой модели, в которой на пользовательский запрос мы предлагаем топ-3 варианта (предсказанных как раз предыдущей моделью), и пользователь выбирает то, что подходит под его запрос. Обучили новую модель.
При анализе датасета выяснилось, что разнообразие пользовательских запросов не так велико и большая часть из них относится к 30 классам, а на остальных новая модель существенно проваливается. В этом моменте как раз пришла мысль сгенерировать тренировочные данные (на самом деле решили начать с генерации репрезентативного бенчмарка, но подход тот же).
Для генерации мы взяли крупную ЛЛМ из существующих на данный момент и по-разному промптили ее, чтобы повысить разнообразие: добавляли примеры, с некоторой вероятностью добавляли косвенную информацию по каждому классу, меняли стиль запроса и его длину, вносили ошибки правописания в текст и прочее.
На первый взгляд бенчмарк получился хорошим - чисто при визуальной оценке все было похоже на реальные человеческие запросы (хотя заставить генерировать существенные ошибки не удалось), а главное, гарантированная репрезентативность - для каждого класса есть самые разные примеры запросов. Но что там с энтропией?
В среднем энтропия сгенерированных запросов в рамках класса при подсчете по лемматизированным токенам оказалась около 5.3, реальных - 8. Т.е. В среднем почти на 3 бита на токен больше. Вроде бы немного, но это 2^5.3 ~ 39 против 2^8 = 256 возможных вариаций на единицу данных.
Мы пока не обучали модель на полностью синтетическом датасете, поэтому о реальных метриках ничего не можем сказать. Но очевидно, что текущий подход лучше использовать для обогащения, а не для замены датасета.
Мы хотели обучить просто модель классификации, а что если обучать ЛЛМ? Всегда можно улучшить механизмы генерации данных, но при ленивом подходе есть риск выстрелить себе в ногу - повысим репрезентативность, но переобучимся на скудных текстах, не отражающих реальный язык. А если этот цикл не заканчивать и продолжать обучать модели на синтетических текстах, полученных из моделей, обученных на синтетических текстах, то к чему мы придем? Звучит как идея для эксперимента. | 488 |
| 15 | Sonar Embedding Space и Large Concept Model (LCM): от универсального пространства представлений к работе с абстрактными понятиями
В этом докладе мы разберём две связанные работы — Sonar Embedding Space и Large Concept Model (LCM). Обе статьи поднимают вопрос: как моделям лучше захватывать и организовывать знания. Sonar предлагает единое встраиваемое пространство, где тексты и другие модальности сопоставляются напрямую. LCM идёт дальше: от языковых паттернов к оперированию более высокоуровневыми концептами. Обсудим, как такие подходы помогают моделям лучше захватывать и структурировать знания.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
11 сентября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 744 |
| 16 | Dynamic Chunking: end-to-end иерархическая модель без токенизатора (H-Net)
В ходе доклада вы узнаете о Dynamic Chunking — модели, которая сама учится разбивать текст на смысловые куски и строить иерархические представления, обходясь без традиционной токенизации. Покажем, как она обходит BPE на сложных данных вроде китайского текста, кода и ДНК, и почему end-to-end подход даёт лучшие результаты.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
28 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 214 |
| 17 | ATGen: активное обучение для эффективной генерации текста
В докладе рассмотрим фреймворк ATGen — современное решение, которое снижает стоимость разметки данных и повышает качество текстовой генерации. Разберём, как он работает, какие стратегии активного обучения существуют, и почему этот подход действительно экономит ресурсы без потери качества.
Спикер
Денис Деменков, Machine Learning Engineer, Mad Devs
Время и дата
14 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 831 |
| 18 | Начинаем уже через 10 минут! Присоединиться можно по ссылке: https://meet.google.com/ryk-irww-moz | 360 |
| 19 | 📹 Записи лекций MadML Talks теперь на YouTube!
Если вы пропустили эфир или хотите пересмотреть лекции — теперь они доступны на YouTube-канале Mad Devs! Делимся опытом, разбираем реальные кейсы и говорим о машинном обучении без лишней воды.
🔗 Смотрите по ссылке: https://www.youtube.com/watch?v=PGU48_Z1vrg&list=PLsmdb5W8ytyoEQ2ofWufKnJgUKnNdJN6B
Подписывайтесь, чтобы не пропустить новые выпуски! | 350 |
| 20 | Uplift modeling.
Uplift-моделирование — это подход, который выходит за рамки стандартных ML-задач классификации. Мы рассмотрим классическую и альтернативную постановки задачи, разберем базовые подходы к решению T-Learner, S-Learner, X-Learner.
Спикер
Дмитрий Сорока, Data scientist, Head of data в Элдик Банк
Время и дата
31 июля, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 557 |
