MadML 🚀
Открыть в Telegram
MadML Talks — это инициатива ML-сообщества Mad Devs, где каждые две недели по четвергам (18:00 по Бишкеку) эксперты из сферы машинного обучения и ИИ делятся своими знаниями и опытом. Ссылка на встречу: meet.google.com/ryk-irww-moz
БольшеСтрана не указанаКатегория не указана
281
Подписчики
Нет данных24 часа
+17 дней
+230 день
Архив постов
281
В конце прошлого года OpenAI анонсировала Apps SDK, а позже открыла возможность регистрации собственных приложений. Что это дает? Теперь вы можете создавать собственные приложения, разворачивая MCP серверы, и регистрировать их в OpenAI и тогда любой пользователь ChatGPT сможет подключать их (или триггерить специальными фразами) и обращаться к вашему серверу. Уже сейчас магазин приложений достаточно широк и вы можете подключить Booking или сервисы Google.
Для одного из наших заказчиков мы как раз и занимемся разработкой такого приложения. И в ходе тестирования и дебаггинга сервиса обнаружилось интересное поведение: оказывается, ChatGPT довольно охотно раскрывает конфигурации тулов MCP сервера. Формально, это публичная информация. Но с другой стороны в описании тулов содержатся фактические инструкции для агента, Enum-ы и Literal-ы, промпты и ресурсы. Мне даже удавалось вытаскивать сообщения об ошибках и exceptions в ходе тестирования приложения.
При этом, многие приложения не требуют аутентификации и если каким-либо образом удастся узнать адрес MCP сервера (ChatGPT этого, к счастью, не знает), то это откроет простор для различных атак. В целом, ничего не мешает абьюзить сервер из чата, хотя это и может оказаться дороже для самого злоумышленника.
На скриншотах выше, например, информация, которую можно узнать о том же приложении Booking.
Самое интересное, что OpenAI сами предупреждают об опасностях инъекций для публичных MCP серверов, но ситация все равно сомнительная. Кажется, им нужно дотюнить аллаймент для приложений.
281
Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home
281
Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home
281
По техническим причинам звонок переносится в google meet
Video call link: https://meet.google.com/ryk-irww-moz
281
TnT-LLM: Text Mining at Scale with Large Language Models
Разметка больших текстовых корпусов вручную занимает недели и почти не масштабируется. В этом докладе мы покажем TnT-LLM — фреймворк на базе больших языковых моделей, который автоматически строит иерархии меток и создаёт псевдоразметку.
Разберём, как двухэтапный подход (генерация таксономии → разметка текста) позволяет ускорить создание классификаторов и обсудим реальные кейсы применения — от анализа пользовательских намерений до контент-понимания.
Доклад будет полезен исследователям и инженерам, работающим с задачами текстового майнинга, кластеризации, автоматической разметки и созданием классификаторов на основе текстов.
Спикер
Владислав Попов, Machine Learning Engineer
Время и дата
4 декабря, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
https://telemost.yandex.ru/j/40564204453826
281
Материалы встречи 6.11.2025
Спикер: Алина Бурыкина, Machine Learning Engineer, Mad Devs
Доклад: Intro to Contrastive Learning: теория, интуиция и современные подходы
Запись на YouTube: https://www.youtube.com/watch?v=HCb0VNpjGCM
281
Intro to Contrastive Learning: теория, интуиция и современные подходы
Контрастивное обучение стало краеугольным камнем современных self-supervised методов в компьютерном зрении и за его пределами.
В этом докладе мы разберём ключевые идеи, лежащие в основе подхода — от информационно-теоретических принципов (взаимная информация, InfoNCE) до практических реализаций. Рассмотрим классические методы с отрицательными примерами (SimCLR, MoCo), подходы без негативов (BYOL, SimSiam) и модели, вдохновлённые кластеризацией.
Доклад будет интересен инженерам и исследователям, работающим с представлениями данных, self-supervised и foundation-моделями.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
6 ноября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz
281
Schema-guided reasoning: как заставить LLM быть умнее.
В докладе рассмотрим SGR подход, который повышает бизнес-метрики и заставляет ризонить модели не обученные для этого. Возможно, вы уже использовали этот подход, но не знали об этом. Так же рассмотрим плюсы и минусы SGR и посмотрим, как собрать LLM агента без специальных фреймворков практически на чистом OpenAI SDK.
Сложность 3/10.
Спикер: Александр Брыль, ML инженер Mad Devs.
Дата и время: 25 сентября, четверг, в 18:00 (по Бишкеку).
Ссылка на встречу: meet.google.com/ryk-irww-moz
281
А вы замечали, что ЛЛМ могут быть не особо разнообразны в своих генерациях?
Все мы знаем, что уже давно принято добавлять синтетические данные для обучения новых моделей. Это дешевле, безопаснее, решает проблему регуляризации и репрезентации (аугментирование данных). Именно с одной из таких проблем мы столкнулись в работе.
Нам необходимо было построить модель классификации, которая бы относила пользовательский запрос к одному из 150 классов. Изначально у нас не было хорошей разметки и мы учили модели по косвенным признакам. Со временм мы построили систему сбора данных для новой модели, в которой на пользовательский запрос мы предлагаем топ-3 варианта (предсказанных как раз предыдущей моделью), и пользователь выбирает то, что подходит под его запрос. Обучили новую модель.
При анализе датасета выяснилось, что разнообразие пользовательских запросов не так велико и большая часть из них относится к 30 классам, а на остальных новая модель существенно проваливается. В этом моменте как раз пришла мысль сгенерировать тренировочные данные (на самом деле решили начать с генерации репрезентативного бенчмарка, но подход тот же).
Для генерации мы взяли крупную ЛЛМ из существующих на данный момент и по-разному промптили ее, чтобы повысить разнообразие: добавляли примеры, с некоторой вероятностью добавляли косвенную информацию по каждому классу, меняли стиль запроса и его длину, вносили ошибки правописания в текст и прочее.
На первый взгляд бенчмарк получился хорошим - чисто при визуальной оценке все было похоже на реальные человеческие запросы (хотя заставить генерировать существенные ошибки не удалось), а главное, гарантированная репрезентативность - для каждого класса есть самые разные примеры запросов. Но что там с энтропией?
В среднем энтропия сгенерированных запросов в рамках класса при подсчете по лемматизированным токенам оказалась около 5.3, реальных - 8. Т.е. В среднем почти на 3 бита на токен больше. Вроде бы немного, но это 2^5.3 ~ 39 против 2^8 = 256 возможных вариаций на единицу данных.
Мы пока не обучали модель на полностью синтетическом датасете, поэтому о реальных метриках ничего не можем сказать. Но очевидно, что текущий подход лучше использовать для обогащения, а не для замены датасета.
Мы хотели обучить просто модель классификации, а что если обучать ЛЛМ? Всегда можно улучшить механизмы генерации данных, но при ленивом подходе есть риск выстрелить себе в ногу - повысим репрезентативность, но переобучимся на скудных текстах, не отражающих реальный язык. А если этот цикл не заканчивать и продолжать обучать модели на синтетических текстах, полученных из моделей, обученных на синтетических текстах, то к чему мы придем? Звучит как идея для эксперимента.
281
Sonar Embedding Space и Large Concept Model (LCM): от универсального пространства представлений к работе с абстрактными понятиями
В этом докладе мы разберём две связанные работы — Sonar Embedding Space и Large Concept Model (LCM). Обе статьи поднимают вопрос: как моделям лучше захватывать и организовывать знания. Sonar предлагает единое встраиваемое пространство, где тексты и другие модальности сопоставляются напрямую. LCM идёт дальше: от языковых паттернов к оперированию более высокоуровневыми концептами. Обсудим, как такие подходы помогают моделям лучше захватывать и структурировать знания.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
11 сентября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz
281
Dynamic Chunking: end-to-end иерархическая модель без токенизатора (H-Net)
В ходе доклада вы узнаете о Dynamic Chunking — модели, которая сама учится разбивать текст на смысловые куски и строить иерархические представления, обходясь без традиционной токенизации. Покажем, как она обходит BPE на сложных данных вроде китайского текста, кода и ДНК, и почему end-to-end подход даёт лучшие результаты.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
28 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz
281
ATGen: активное обучение для эффективной генерации текста
В докладе рассмотрим фреймворк ATGen — современное решение, которое снижает стоимость разметки данных и повышает качество текстовой генерации. Разберём, как он работает, какие стратегии активного обучения существуют, и почему этот подход действительно экономит ресурсы без потери качества.
Спикер
Денис Деменков, Machine Learning Engineer, Mad Devs
Время и дата
14 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz
281
Начинаем уже через 10 минут! Присоединиться можно по ссылке: https://meet.google.com/ryk-irww-moz
281
📹 Записи лекций MadML Talks теперь на YouTube!
Если вы пропустили эфир или хотите пересмотреть лекции — теперь они доступны на YouTube-канале Mad Devs! Делимся опытом, разбираем реальные кейсы и говорим о машинном обучении без лишней воды.
🔗 Смотрите по ссылке: https://www.youtube.com/watch?v=PGU48_Z1vrg&list=PLsmdb5W8ytyoEQ2ofWufKnJgUKnNdJN6B
Подписывайтесь, чтобы не пропустить новые выпуски!
281
Uplift modeling.
Uplift-моделирование — это подход, который выходит за рамки стандартных ML-задач классификации. Мы рассмотрим классическую и альтернативную постановки задачи, разберем базовые подходы к решению T-Learner, S-Learner, X-Learner.
Спикер
Дмитрий Сорока, Data scientist, Head of data в Элдик Банк
Время и дата
31 июля, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz
