MadML 🚀
رفتن به کانال در Telegram
MadML Talks — это инициатива ML-сообщества Mad Devs, где каждые две недели по четвергам (18:00 по Бишкеку) эксперты из сферы машинного обучения и ИИ делятся своими знаниями и опытом. Ссылка на встречу: meet.google.com/ryk-irww-moz
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
281
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+17 روز
+230 روز
در حال بارگیری داده...
کانالهای مشابه
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
ابر برچسبها
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
مارس '26
مارس '26
+3
در 0 کانالها
فوریه '26
+7
در 0 کانالها
Get PRO
ژانویه '26
+19
در 1 کانالها
Get PRO
دسامبر '25
+23
در 1 کانالها
Get PRO
نوامبر '25
+20
در 1 کانالها
Get PRO
اکتبر '25
+117
در 3 کانالها
Get PRO
سپتامبر '25
+113
در 2 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 29 مارس | 0 | |||
| 28 مارس | 0 | |||
| 27 مارس | 0 | |||
| 26 مارس | 0 | |||
| 25 مارس | 0 | |||
| 24 مارس | 0 | |||
| 23 مارس | 0 | |||
| 22 مارس | +1 | |||
| 21 مارس | +1 | |||
| 20 مارس | 0 | |||
| 19 مارس | 0 | |||
| 18 مارس | 0 | |||
| 17 مارس | 0 | |||
| 16 مارس | 0 | |||
| 15 مارس | 0 | |||
| 14 مارس | 0 | |||
| 13 مارس | 0 | |||
| 12 مارس | 0 | |||
| 11 مارس | +1 | |||
| 10 مارس | 0 | |||
| 09 مارس | 0 | |||
| 08 مارس | 0 | |||
| 07 مارس | 0 | |||
| 06 مارس | 0 | |||
| 05 مارس | 0 | |||
| 04 مارس | 0 | |||
| 03 مارس | 0 | |||
| 02 مارس | 0 | |||
| 01 مارس | 0 |
پستهای کانال
В конце прошлого года OpenAI анонсировала Apps SDK, а позже открыла возможность регистрации собственных приложений. Что это дает? Теперь вы можете создавать собственные приложения, разворачивая MCP серверы, и регистрировать их в OpenAI и тогда любой пользователь ChatGPT сможет подключать их (или триггерить специальными фразами) и обращаться к вашему серверу. Уже сейчас магазин приложений достаточно широк и вы можете подключить Booking или сервисы Google.
Для одного из наших заказчиков мы как раз и занимемся разработкой такого приложения. И в ходе тестирования и дебаггинга сервиса обнаружилось интересное поведение: оказывается, ChatGPT довольно охотно раскрывает конфигурации тулов MCP сервера. Формально, это публичная информация. Но с другой стороны в описании тулов содержатся фактические инструкции для агента, Enum-ы и Literal-ы, промпты и ресурсы. Мне даже удавалось вытаскивать сообщения об ошибках и exceptions в ходе тестирования приложения.
При этом, многие приложения не требуют аутентификации и если каким-либо образом удастся узнать адрес MCP сервера (ChatGPT этого, к счастью, не знает), то это откроет простор для различных атак. В целом, ничего не мешает абьюзить сервер из чата, хотя это и может оказаться дороже для самого злоумышленника.
На скриншотах выше, например, информация, которую можно узнать о том же приложении Booking.
Самое интересное, что OpenAI сами предупреждают об опасностях инъекций для публичных MCP серверов, но ситация все равно сомнительная. Кажется, им нужно дотюнить аллаймент для приложений.
| 2 | بدون متن... | 206 |
| 3 | Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home | 228 |
| 4 | Материалы встречи 4.12.2025
Спикер: Владислав Попов, Machine Learning Engineer
Доклад "TnT-LLM: Text Mining at Scale with Large Language Models"
Запись на YouTube: https://youtu.be/FY3VevXMuw8?si=DDKUoKpYielvQyF0
Ссылка на статью, которую обсуждали на встрече: https://arxiv.org/abs/2403.12173v1
Дополнительные материалы: https://docs.boundaryml.com/home | 2 |
| 5 | По техническим причинам звонок переносится в google meet
Video call link: https://meet.google.com/ryk-irww-moz | 81 |
| 6 | Начинаем через 5 минут: https://telemost.yandex.ru/j/40564204453826 | 45 |
| 7 | TnT-LLM: Text Mining at Scale with Large Language Models
Разметка больших текстовых корпусов вручную занимает недели и почти не масштабируется. В этом докладе мы покажем TnT-LLM — фреймворк на базе больших языковых моделей, который автоматически строит иерархии меток и создаёт псевдоразметку.
Разберём, как двухэтапный подход (генерация таксономии → разметка текста) позволяет ускорить создание классификаторов и обсудим реальные кейсы применения — от анализа пользовательских намерений до контент-понимания.
Доклад будет полезен исследователям и инженерам, работающим с задачами текстового майнинга, кластеризации, автоматической разметки и созданием классификаторов на основе текстов.
Спикер
Владислав Попов, Machine Learning Engineer
Время и дата
4 декабря, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
https://telemost.yandex.ru/j/40564204453826 | 964 |
| 8 | Материалы встречи 6.11.2025
Спикер: Алина Бурыкина, Machine Learning Engineer, Mad Devs
Доклад: Intro to Contrastive Learning: теория, интуиция и современные подходы
Запись на YouTube: https://www.youtube.com/watch?v=HCb0VNpjGCM | 310 |
| 9 | Intro to Contrastive Learning: теория, интуиция и современные подходы
Контрастивное обучение стало краеугольным камнем современных self-supervised методов в компьютерном зрении и за его пределами.
В этом докладе мы разберём ключевые идеи, лежащие в основе подхода — от информационно-теоретических принципов (взаимная информация, InfoNCE) до практических реализаций. Рассмотрим классические методы с отрицательными примерами (SimCLR, MoCo), подходы без негативов (BYOL, SimSiam) и модели, вдохновлённые кластеризацией.
Доклад будет интересен инженерам и исследователям, работающим с представлениями данных, self-supervised и foundation-моделями.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
6 ноября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 091 |
| 10 | Запись доклада доступна по ссылке: https://www.youtube.com/watch?v=0XhFB9OItqw 🚀 | 556 |
| 11 | Презентация сегодняшнего доклада | 684 |
| 12 | Через 10 минут начинаем | 615 |
| 13 | Schema-guided reasoning: как заставить LLM быть умнее.
В докладе рассмотрим SGR подход, который повышает бизнес-метрики и заставляет ризонить модели не обученные для этого. Возможно, вы уже использовали этот подход, но не знали об этом. Так же рассмотрим плюсы и минусы SGR и посмотрим, как собрать LLM агента без специальных фреймворков практически на чистом OpenAI SDK.
Сложность 3/10.
Спикер: Александр Брыль, ML инженер Mad Devs.
Дата и время: 25 сентября, четверг, в 18:00 (по Бишкеку).
Ссылка на встречу: meet.google.com/ryk-irww-moz | 1 683 |
| 14 | А вы замечали, что ЛЛМ могут быть не особо разнообразны в своих генерациях?
Все мы знаем, что уже давно принято добавлять синтетические данные для обучения новых моделей. Это дешевле, безопаснее, решает проблему регуляризации и репрезентации (аугментирование данных). Именно с одной из таких проблем мы столкнулись в работе.
Нам необходимо было построить модель классификации, которая бы относила пользовательский запрос к одному из 150 классов. Изначально у нас не было хорошей разметки и мы учили модели по косвенным признакам. Со временм мы построили систему сбора данных для новой модели, в которой на пользовательский запрос мы предлагаем топ-3 варианта (предсказанных как раз предыдущей моделью), и пользователь выбирает то, что подходит под его запрос. Обучили новую модель.
При анализе датасета выяснилось, что разнообразие пользовательских запросов не так велико и большая часть из них относится к 30 классам, а на остальных новая модель существенно проваливается. В этом моменте как раз пришла мысль сгенерировать тренировочные данные (на самом деле решили начать с генерации репрезентативного бенчмарка, но подход тот же).
Для генерации мы взяли крупную ЛЛМ из существующих на данный момент и по-разному промптили ее, чтобы повысить разнообразие: добавляли примеры, с некоторой вероятностью добавляли косвенную информацию по каждому классу, меняли стиль запроса и его длину, вносили ошибки правописания в текст и прочее.
На первый взгляд бенчмарк получился хорошим - чисто при визуальной оценке все было похоже на реальные человеческие запросы (хотя заставить генерировать существенные ошибки не удалось), а главное, гарантированная репрезентативность - для каждого класса есть самые разные примеры запросов. Но что там с энтропией?
В среднем энтропия сгенерированных запросов в рамках класса при подсчете по лемматизированным токенам оказалась около 5.3, реальных - 8. Т.е. В среднем почти на 3 бита на токен больше. Вроде бы немного, но это 2^5.3 ~ 39 против 2^8 = 256 возможных вариаций на единицу данных.
Мы пока не обучали модель на полностью синтетическом датасете, поэтому о реальных метриках ничего не можем сказать. Но очевидно, что текущий подход лучше использовать для обогащения, а не для замены датасета.
Мы хотели обучить просто модель классификации, а что если обучать ЛЛМ? Всегда можно улучшить механизмы генерации данных, но при ленивом подходе есть риск выстрелить себе в ногу - повысим репрезентативность, но переобучимся на скудных текстах, не отражающих реальный язык. А если этот цикл не заканчивать и продолжать обучать модели на синтетических текстах, полученных из моделей, обученных на синтетических текстах, то к чему мы придем? Звучит как идея для эксперимента. | 488 |
| 15 | Sonar Embedding Space и Large Concept Model (LCM): от универсального пространства представлений к работе с абстрактными понятиями
В этом докладе мы разберём две связанные работы — Sonar Embedding Space и Large Concept Model (LCM). Обе статьи поднимают вопрос: как моделям лучше захватывать и организовывать знания. Sonar предлагает единое встраиваемое пространство, где тексты и другие модальности сопоставляются напрямую. LCM идёт дальше: от языковых паттернов к оперированию более высокоуровневыми концептами. Обсудим, как такие подходы помогают моделям лучше захватывать и структурировать знания.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
11 сентября, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 744 |
| 16 | Dynamic Chunking: end-to-end иерархическая модель без токенизатора (H-Net)
В ходе доклада вы узнаете о Dynamic Chunking — модели, которая сама учится разбивать текст на смысловые куски и строить иерархические представления, обходясь без традиционной токенизации. Покажем, как она обходит BPE на сложных данных вроде китайского текста, кода и ДНК, и почему end-to-end подход даёт лучшие результаты.
Спикер
Алина Бурыкина, Machine Learning Engineer, Mad Devs
Время и дата
28 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 214 |
| 17 | ATGen: активное обучение для эффективной генерации текста
В докладе рассмотрим фреймворк ATGen — современное решение, которое снижает стоимость разметки данных и повышает качество текстовой генерации. Разберём, как он работает, какие стратегии активного обучения существуют, и почему этот подход действительно экономит ресурсы без потери качества.
Спикер
Денис Деменков, Machine Learning Engineer, Mad Devs
Время и дата
14 августа, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 831 |
| 18 | Начинаем уже через 10 минут! Присоединиться можно по ссылке: https://meet.google.com/ryk-irww-moz | 360 |
| 19 | 📹 Записи лекций MadML Talks теперь на YouTube!
Если вы пропустили эфир или хотите пересмотреть лекции — теперь они доступны на YouTube-канале Mad Devs! Делимся опытом, разбираем реальные кейсы и говорим о машинном обучении без лишней воды.
🔗 Смотрите по ссылке: https://www.youtube.com/watch?v=PGU48_Z1vrg&list=PLsmdb5W8ytyoEQ2ofWufKnJgUKnNdJN6B
Подписывайтесь, чтобы не пропустить новые выпуски! | 350 |
| 20 | Uplift modeling.
Uplift-моделирование — это подход, который выходит за рамки стандартных ML-задач классификации. Мы рассмотрим классическую и альтернативную постановки задачи, разберем базовые подходы к решению T-Learner, S-Learner, X-Learner.
Спикер
Дмитрий Сорока, Data scientist, Head of data в Элдик Банк
Время и дата
31 июля, четверг, с 18:00 до 19:00 (по Бишкеку)
Ссылка на встречу
meet.google.com/ryk-irww-moz | 1 557 |
