uk
Feedback
MadML 🚀

MadML 🚀

Відкрити в Telegram

MadML Talks — это инициатива ML-сообщества Mad Devs, где каждые две недели по четвергам (18:00 по Бишкеку) эксперты из сферы машинного обучения и ИИ делятся своими знаниями и опытом. Ссылка на встречу: meet.google.com/ryk-irww-moz

Показати більше
Країна не вказанаКатегорія не вказана
281
Підписники
Немає даних24 години
+17 днів
+230 день
Архів дописів
В конце прошлого года OpenAI анонсировала Apps SDK, а позже открыла возможность регистрации собственных приложений. Что это дает? Теперь вы можете создавать собственные приложения, разворачивая MCP серверы, и регистрировать их в OpenAI и тогда любой пользователь ChatGPT сможет подключать их (или триггерить специальными фразами) и обращаться к вашему серверу. Уже сейчас магазин приложений достаточно широк и вы можете подключить Booking или сервисы Google. Для одного из наших заказчиков мы как раз и занимемся разработкой такого приложения. И в ходе тестирования и дебаггинга сервиса обнаружилось интересное поведение: оказывается, ChatGPT довольно охотно раскрывает конфигурации тулов MCP сервера. Формально, это публичная информация. Но с другой стороны в описании тулов содержатся фактические инструкции для агента, Enum-ы и Literal-ы, промпты и ресурсы. Мне даже удавалось вытаскивать сообщения об ошибках и exceptions в ходе тестирования приложения. При этом, многие приложения не требуют аутентификации и если каким-либо образом удастся узнать адрес MCP сервера (ChatGPT этого, к счастью, не знает), то это откроет простор для различных атак. В целом, ничего не мешает абьюзить сервер из чата, хотя это и может оказаться дороже для самого злоумышленника. На скриншотах выше, например, информация, которую можно узнать о том же приложении Booking. Самое интересное, что OpenAI сами предупреждают об опасностях инъекций для публичных MCP серверов, но ситация все равно сомнительная. Кажется, им нужно дотюнить аллаймент для приложений.

photo content
+3

Материалы встречи 4.12.2025 Спикер: Владислав Попов, Machine Learning Engineer Доклад "TnT-LLM: Text Mining at Scale with Large Language Models" Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0 Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1 Дополнительные материалы: https://docs.boundaryml.com/home

Материалы встречи 4.12.2025 Спикер: Владислав Попов, Machine Learning Engineer Доклад "TnT-LLM: Text Mining at Scale with Large Language Models" Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0 Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1 Дополнительные материалы: https://docs.boundaryml.com/home

По техническим причинам звонок переносится в google meet Video call link: https://meet.google.com/ryk-irww-moz

Начинаем через 5 минут: https://telemost.yandex.ru/j/40564204453826

TnT-LLM: Text Mining at Scale with Large Language Models Разметка больших текстовых корпусов вручную занимает недели и почти
TnT-LLM: Text Mining at Scale with Large Language Models Разметка больших текстовых корпусов вручную занимает недели и почти не масштабируется. В этом докладе мы покажем TnT-LLM — фреймворк на базе больших языковых моделей, который автоматически строит иерархии меток и создаёт псевдоразметку. Разберём, как двухэтапный подход (генерация таксономии → разметка текста) позволяет ускорить создание классификаторов и обсудим реальные кейсы применения — от анализа пользовательских намерений до контент-понимания. Доклад будет полезен исследователям и инженерам, работающим с задачами текстового майнинга, кластеризации, автоматической разметки и созданием классификаторов на основе текстов. Спикер Владислав Попов, Machine Learning Engineer Время и дата 4 декабря, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу https://telemost.yandex.ru/j/40564204453826

Материалы встречи 6.11.2025 Спикер: Алина Бурыкина, Machine Learning Engineer, Mad Devs Доклад: Intro to Contrastive Learning: теория, интуиция и современные подходы Запись на YouTube: https://www.youtube.com/watch?v=HCb0VNpjGCM

Intro to Contrastive Learning: теория, интуиция и современные подходы Контрастивное обучение стало краеугольным камнем соврем
Intro to Contrastive Learning: теория, интуиция и современные подходы Контрастивное обучение стало краеугольным камнем современных self-supervised методов в компьютерном зрении и за его пределами. В этом докладе мы разберём ключевые идеи, лежащие в основе подхода — от информационно-теоретических принципов (взаимная информация, InfoNCE) до практических реализаций. Рассмотрим классические методы с отрицательными примерами (SimCLR, MoCo), подходы без негативов (BYOL, SimSiam) и модели, вдохновлённые кластеризацией. Доклад будет интересен инженерам и исследователям, работающим с представлениями данных, self-supervised и foundation-моделями. Спикер Алина Бурыкина, Machine Learning Engineer, Mad Devs Время и дата 6 ноября, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу meet.google.com/ryk-irww-moz

Запись доклада доступна по ссылке: https://www.youtube.com/watch?v=0XhFB9OItqw 🚀

Презентация сегодняшнего доклада

Через 10 минут начинаем

Schema-guided reasoning: как заставить LLM быть умнее. В докладе рассмотрим SGR подход, который повышает бизнес-метрики и зас
Schema-guided reasoning: как заставить LLM быть умнее. В докладе рассмотрим SGR подход, который повышает бизнес-метрики и заставляет ризонить модели не обученные для этого. Возможно, вы уже использовали этот подход, но не знали об этом. Так же рассмотрим плюсы и минусы SGR и посмотрим, как собрать LLM агента без специальных фреймворков практически на чистом OpenAI SDK. Сложность 3/10. Спикер: Александр Брыль, ML инженер Mad Devs. Дата и время: 25 сентября, четверг, в 18:00 (по Бишкеку). Ссылка на встречу: meet.google.com/ryk-irww-moz

А вы замечали, что ЛЛМ могут быть не особо разнообразны в своих генерациях? Все мы знаем, что уже давно принято добавлять синтетические данные для обучения новых моделей. Это дешевле, безопаснее, решает проблему регуляризации и репрезентации (аугментирование данных). Именно с одной из таких проблем мы столкнулись в работе. Нам необходимо было построить модель классификации, которая бы относила пользовательский запрос к одному из 150 классов. Изначально у нас не было хорошей разметки и мы учили модели по косвенным признакам. Со временм мы построили систему сбора данных для новой модели, в которой на пользовательский запрос мы предлагаем топ-3 варианта (предсказанных как раз предыдущей моделью), и пользователь выбирает то, что подходит под его запрос. Обучили новую модель. При анализе датасета выяснилось, что разнообразие пользовательских запросов не так велико и большая часть из них относится к 30 классам, а на остальных новая модель существенно проваливается. В этом моменте как раз пришла мысль сгенерировать тренировочные данные (на самом деле решили начать с генерации репрезентативного бенчмарка, но подход тот же). Для генерации мы взяли крупную ЛЛМ из существующих на данный момент и по-разному промптили ее, чтобы повысить разнообразие: добавляли примеры, с некоторой вероятностью добавляли косвенную информацию по каждому классу, меняли стиль запроса и его длину, вносили ошибки правописания в текст и прочее. На первый взгляд бенчмарк получился хорошим - чисто при визуальной оценке все было похоже на реальные человеческие запросы (хотя заставить генерировать существенные ошибки не удалось), а главное, гарантированная репрезентативность - для каждого класса есть самые разные примеры запросов. Но что там с энтропией? В среднем энтропия сгенерированных запросов в рамках класса при подсчете по лемматизированным токенам оказалась около 5.3, реальных - 8. Т.е. В среднем почти на 3 бита на токен больше. Вроде бы немного, но это 2^5.3 ~ 39 против 2^8 = 256 возможных вариаций на единицу данных. Мы пока не обучали модель на полностью синтетическом датасете, поэтому о реальных метриках ничего не можем сказать. Но очевидно, что текущий подход лучше использовать для обогащения, а не для замены датасета. Мы хотели обучить просто модель классификации, а что если обучать ЛЛМ? Всегда можно улучшить механизмы генерации данных, но при ленивом подходе есть риск выстрелить себе в ногу - повысим репрезентативность, но переобучимся на скудных текстах, не отражающих реальный язык. А если этот цикл не заканчивать и продолжать обучать модели на синтетических текстах, полученных из моделей, обученных на синтетических текстах, то к чему мы придем? Звучит как идея для эксперимента.

Sonar Embedding Space и Large Concept Model (LCM): от универсального пространства представлений к работе с абстрактными понят
Sonar Embedding Space и Large Concept Model (LCM): от универсального пространства представлений к работе с абстрактными понятиями В этом докладе мы разберём две связанные работы — Sonar Embedding Space и Large Concept Model (LCM). Обе статьи поднимают вопрос: как моделям лучше захватывать и организовывать знания. Sonar предлагает единое встраиваемое пространство, где тексты и другие модальности сопоставляются напрямую. LCM идёт дальше: от языковых паттернов к оперированию более высокоуровневыми концептами. Обсудим, как такие подходы помогают моделям лучше захватывать и структурировать знания. Спикер Алина Бурыкина, Machine Learning Engineer, Mad Devs Время и дата 11 сентября, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу meet.google.com/ryk-irww-moz

Dynamic Chunking: end-to-end иерархическая модель без токенизатора (H-Net) В ходе доклада вы узнаете о Dynamic Chunking — мод
Dynamic Chunking: end-to-end иерархическая модель без токенизатора (H-Net) В ходе доклада вы узнаете о Dynamic Chunking — модели, которая сама учится разбивать текст на смысловые куски и строить иерархические представления, обходясь без традиционной токенизации. Покажем, как она обходит BPE на сложных данных вроде китайского текста, кода и ДНК, и почему end-to-end подход даёт лучшие результаты. Спикер Алина Бурыкина, Machine Learning Engineer, Mad Devs Время и дата 28 августа, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу meet.google.com/ryk-irww-moz

ATGen: активное обучение для эффективной генерации текста В докладе рассмотрим фреймворк ATGen — современное решение, которое
ATGen: активное обучение для эффективной генерации текста В докладе рассмотрим фреймворк ATGen — современное решение, которое снижает стоимость разметки данных и повышает качество текстовой генерации. Разберём, как он работает, какие стратегии активного обучения существуют, и почему этот подход действительно экономит ресурсы без потери качества. Спикер Денис Деменков, Machine Learning Engineer, Mad Devs Время и дата 14 августа, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу meet.google.com/ryk-irww-moz

Начинаем уже через 10 минут! Присоединиться можно по ссылке: https://meet.google.com/ryk-irww-moz

📹 Записи лекций MadML Talks теперь на YouTube! Если вы пропустили эфир или хотите пересмотреть лекции — теперь они доступны
📹 Записи лекций MadML Talks теперь на YouTube! Если вы пропустили эфир или хотите пересмотреть лекции — теперь они доступны на YouTube-канале Mad Devs! Делимся опытом, разбираем реальные кейсы и говорим о машинном обучении без лишней воды. 🔗 Смотрите по ссылке: https://www.youtube.com/watch?v=PGU48_Z1vrg&list=PLsmdb5W8ytyoEQ2ofWufKnJgUKnNdJN6B Подписывайтесь, чтобы не пропустить новые выпуски!

Uplift modeling. Uplift-моделирование — это подход, который выходит за рамки стандартных ML-задач классификации. Мы рассмотри
Uplift modeling. Uplift-моделирование — это подход, который выходит за рамки стандартных ML-задач классификации. Мы рассмотрим классическую и альтернативную постановки задачи, разберем базовые подходы к решению T-Learner, S-Learner, X-Learner. Спикер Дмитрий Сорока, Data scientist, Head of data в Элдик Банк Время и дата 31 июля, четверг, с 18:00 до 19:00 (по Бишкеку) Ссылка на встречу meet.google.com/ryk-irww-moz