ch
Feedback
Yandex for ML

Yandex for ML

前往频道在 Telegram

💙Канал для ML-сообщества от Яндекса и место встречи специалистов в сфере анализа данных. Чат→ https://t.me/+XR1fd2QNnaIxNTUy Вопросы: @Ekaterina_Lyagina Все каналы по стекам: https://t.me/addlist/Hrq31w2p1vUyOGZi

显示更多

📈 Telegram 频道 Yandex for ML 的分析概览

频道 Yandex for ML (@yandexforml) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 18 815 名订阅者,在 营销与公关 类别中位列第 552,并在 俄罗斯 地区排名第 35 154

📊 受众指标与增长动态

невідомо 创建以来,项目保持高速增长,吸引了 18 815 名订阅者。

根据 05 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 170,过去 24 小时变化为 6,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 19.76%。内容发布后 24 小时内通常能获得 9.13% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 3 718 次浏览,首日通常累积 1 718 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 23
  • 主题关注点: 内容集中在 llm, yandex, хабре, контекст, рассылка 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
💙Канал для ML-сообщества от Яндекса и место встречи специалистов в сфере анализа данных. Чат→ https://t.me/+XR1fd2QNnaIxNTUy Вопросы: @Ekaterina_Lyagina Все каналы по стекам: https://t.me/addlist/Hrq31w2p1vUyOGZi

凭借高频更新(最新数据采集于 06 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 营销与公关 类别中的关键影响点。

18 815
订阅者
+624 小时
+337 天
+17030 天
吸引订阅者
九月 '26
九月 '26
+51
在1个频道中
八月 '26
+290
在3个频道中
Get PRO
七月 '26
+268
在0个频道中
Get PRO
六月 '26
+235
在5个频道中
Get PRO
五月 '26
+454
在5个频道中
Get PRO
四月 '26
+323
在0个频道中
Get PRO
三月 '26
+597
在4个频道中
Get PRO
二月 '26
+348
在2个频道中
Get PRO
一月 '26
+262
在2个频道中
Get PRO
十二月 '25
+464
在4个频道中
Get PRO
十一月 '25
+697
在6个频道中
Get PRO
十月 '25
+484
在7个频道中
Get PRO
九月 '25
+781
在8个频道中
Get PRO
八月 '25
+341
在5个频道中
Get PRO
七月 '25
+222
在4个频道中
Get PRO
六月 '25
+293
在3个频道中
Get PRO
五月 '25
+632
在1个频道中
Get PRO
四月 '25
+419
在5个频道中
Get PRO
三月 '25
+423
在4个频道中
Get PRO
二月 '25
+391
在6个频道中
Get PRO
一月 '25
+240
在1个频道中
Get PRO
十二月 '24
+298
在7个频道中
Get PRO
十一月 '24
+284
在4个频道中
Get PRO
十月 '24
+480
在4个频道中
Get PRO
九月 '24
+872
在4个频道中
Get PRO
八月 '24
+667
在2个频道中
Get PRO
七月 '24
+289
在3个频道中
Get PRO
六月 '24
+211
在0个频道中
Get PRO
五月 '24
+582
在3个频道中
Get PRO
四月 '24
+933
在4个频道中
Get PRO
三月 '24
+363
在4个频道中
Get PRO
二月 '24
+2 451
在2个频道中
Get PRO
一月 '24
+182
在3个频道中
Get PRO
十二月 '23
+271
在4个频道中
Get PRO
十一月 '23
+159
在8个频道中
Get PRO
十月 '23
+458
在1个频道中
Get PRO
九月 '23
+1 746
在0个频道中
Get PRO
八月 '23
+687
在0个频道中
Get PRO
七月 '23
+350
在0个频道中
Get PRO
六月 '23
+68
在0个频道中
Get PRO
五月 '23
+106
在0个频道中
Get PRO
四月 '23
+205
在0个频道中
Get PRO
三月 '23
+100
在0个频道中
Get PRO
二月 '23
+567
在0个频道中
Get PRO
一月 '23
+16
在0个频道中
Get PRO
十二月 '22
+205
在0个频道中
Get PRO
十一月 '22
+383
在0个频道中
Get PRO
十月 '22
+36
在0个频道中
Get PRO
九月 '22
+800
在0个频道中
日期
订阅者增长
提及
频道
06 九月0
05 九月+8
04 九月+11
03 九月+8
02 九月+6
01 九月+18
频道帖子
🔗 Аналитическая геометрия на чипсах, end-to-end вместо каскада кандидатогенераторов и агент в оценке качества товаров. Всё э
🔗 Аналитическая геометрия на чипсах, end-to-end вместо каскада кандидатогенераторов и агент в оценке качества товаров. Всё это и многое другое — в новом ML-дайджесте 🚕 Куда сходить ⚪️ 5 сентября — deep tech night. Уже сегодня погрузимся в технологии на масштабной онлайн-конференции Яндекса и обсудим вызовы, с которыми сталкивается IT-индустрия в эпоху AI. Успейте зарегистрироваться — ссылку на трансляцию пришлём на почту сразу после регистрации ⚪️ 26 сентября — Data Driven. Приглашаем аналитиков и всех, кто работает с данными, на флагманскую конференцию от бизнес-группы Поисковых сервисов и ИИ. В этом году сделаем акцент на будущем и поговорим о том, какой станет аналитика, когда данные и AI будут неразделимы 🌎 Что случилось ⚪️ AI в Яндексе: главное за август. Рассказали, где искусственный интеллект Яндекса нашёл себе новые применения: в школах, поликлиниках и других локациях 📖 Что почитать ⚪️ От аналитической геометрии на чипсах к поиску трендов в ML. Валя Бронер, руководитель ML-направления в ШАДе, рассказала, в какой момент полюбила преподавать, почему ушла в ШАД из университета и как ML-разработчики помогают создавать образовательную программу и делать её актуальнее ⚪️ Sona: end-to-end vs каскад кандидатогенераторов. Рассказали, как создали одну совместно обучаемую модель вместо всего рекомендательного стека Яндекс Музыки. Внутри: масштабируемая архитектура, новый движок рекомендаций и единая модель кандидатогенерации и ранжирования ⚪️ Как мы расчищали «серую зону» в Поиске по картинкам. Для этого научили модели смотреть на картинку и читать текст документа одновременно: начали с тяжёлой мультимодальной VLM ради максимального качества, а затем дистиллировали её в набор лёгких моделей ⚪️ Агент в оценке качества товаров. В рубрике «Обучено Яндекс Лавкой» рассказали, как мы обрабатываем жалобы пользователей на качество товара в доставке, чем нам помогает AI-агент и как мы научили его отвечать честно Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML

2
🤔 Лемур или почти лемур: как Поиск по картинкам научился отличать одно от другого Привет, это Константин Николаев, я занимаю
🤔 Лемур или почти лемур: как Поиск по картинкам научился отличать одно от другого Привет, это Константин Николаев, я занимаюсь внедрением нейротехнологий в Поиске по картинкам в Яндексе. Раньше релевантность картинки в поисковой выдаче мы оценивали по двум независимым сигналам: насколько запросу подходит изображение и насколько — текст рядом с ним. Это помогает не путать между собой похожие объекты — например, разные виды животных или похожие модели автомобилей. У подхода есть и слабое место: когда текстовый сигнал расходится с картиночным, непонятно, как свести оценки в один скор. Например, при запросе «лемур» система может принять похожего зверька за настоящего лемура просто потому, что в подписи есть нужное слово. 🅿️ Мы научили модели анализировать изображение и текст документа одновременно Сначала собрали тяжёлую мультимодальную VLM ради максимального качества, а затем дистиллировали её в набор лёгких моделей — по одной под каждую стадию пайплайна. Решение довели до realtime-поиска с десятками тысяч запросов в секунду, а совместный анализ модальностей добавил 5% релевантных картинок в топ выдачи. 🔳 На Хабре мы подробно разобрали весь путь от тяжёлой VLM до лёгких продакшен-моделей. В статье рассказываем: ⚪️ Что такое «серая зона» и почему из-за неё поиск иногда путает похожих зверей и предметы ⚪️ Как устроена совместная VLM-модель и чем vBERT отличается от неё по скорости ⚪️ Как дистиллировали vBERT в bi-encoder, embedder и light cross-encoder под разные стадии ранжирования ⚪️ Какой прирост релевантности получили в топе выдачи Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
2 172
3
🚀 Погружаемся в технологии на deep tech night Уже 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса
🚀 Погружаемся в технологии на deep tech night Уже 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о технологических вызовах, с которыми IT-индустрия сталкивается в эпоху AI: от изменений в разработке до новых требований к архитектуре и инфраструктуре. Это событие для ML-разработчиков, бэкендеров, фронтендеров, тимлидов, аналитиков, продактов и всех, кто работает в IT-индустрии, внедряет AI в процессы, проектирует сложные системы и ищет новые решения. 🔥 Вас ждут темы от инфраструктуры и железа для нейросетей до AI-агентов и внедрения AI в разработку и два формата: ⚪️ Hard — доклады о сложных и масштабных задачах для тех, кто хочет вдумчиво разобраться в технической стороне сферы. ⚪️ Experiment — лайтнинги и интерактивные кейсы об экспериментах с AI-агентами, новых подходах и продуктовых находках. Для всех, кому интересно пробовать новое и следить за трендами. Среди спикеров — Мо Гавдат, десять лет руководивший бизнес-развитием в Google X, Алексей Гусаков, CTO Поисковых сервисов и ИИ, Сергей Мельник, руководитель сервиса Автономного транспорта и роботов, и другие эксперты из Яндекса и других IT-компаний. 🧿 Чтобы подключиться к онлайн-трансляции, нужна предварительная регистрация. Она также даст возможность задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события. 🔳 Смотрите полную программу и регистрируйтесь на deep tech night. До встречи! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
2 535
4
🧿 Одна модель вместо всего рекомендательного стека Яндекс Музыки Привет, это Николай Савушкин, руководитель службы рекоменда
🧿 Одна модель вместо всего рекомендательного стека Яндекс Музыки Привет, это Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D. В августе мы опубликовали Sona Technical Report — результат года нашей работы над новой генеративной end-to-end-моделью рекомендаций. Раньше все рекомендации в Музыке проходили через многоступенчатый каскад: отбором занимались больше 15 кандидатогенераторов, а затем в дело шли отдельные модели преранжирования и ранжирования с сотнями признаков. ↔️ В Sona всё это удалось объединить в одной совместно обучаемой модели. Вот три кита, на которых она стоит: ⚪️ Масштабируемая архитектура Encoder-decoder, обучающийся хронологически на задачу Next Token Prediction без единой ручной фичи. Одной из самых сложных частей было сделать рецепт токенизации, который бы обеспечивал рост качества при росте словаря и числа токенов на документ. ⚪️ Единая модель кандидатогенерации и ранжирования OneRec ранжирует кандидатов отдельной моделью, причём с использованием ручных фич. Мы же стремились к совместному рецепту обучения и инференса. Проблема в том, что задача ранжирования слишком спарсовая и модель просто не обучается выполнять её достаточно хорошо. Решение — сжать год данных в ранжирующую модель, обучающуюся авторегрессивно, и дистиллировать эти знания в совместную модель. ⚪️ Инфраструктура обучения и инференса Любые большие изменения в ML приводят к настолько же большим изменениям в инфраструктуре. Нам пришлось фактически построить новый движок рекомендаций с нуля. Очень важной компонентой стало онлайн-обучение: end-to-end-путь события от возникновения до обновления модели в инференсе укладывается в 1 час в 99% случаев. ↔️ К каким результатам мы пришли Мы уже экспериментировали с unified-архитектурами, которые объединяют генерацию кандидатов и ранжирование, но Sona стала полноценной end-to-end-моделью, которая заменила весь каскад в A/B-тестах. Мы получили рост: ⚪️ +4,53% Active Users — основная метрика эксперимента ⚪️ +6,30% Total Listening Time — общее время прослушивания ⚪️ +11,42% Likes — количество лайков Новая архитектура одновременно упрощает систему и заметно улучшает рекомендации на реальном пользовательском трафике. Причём этот рост мы получили поверх улучшений от предыдущих внедрений, которые оставались в контрольной выборке в продакшене. 🔳 19 сентября на Practical ML Conf я подробнее расскажу, как мы создавали Sona, поделюсь сложностями, с которыми мы столкнулись в процессе, и покажу, как нам удалось их преодолеть. До встречи! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
2 800
5
🎓 Как преподаватель математики стала руководителем ML-направления в ШАДе Привет, это Валя Бронер. Я 11 лет преподавала студе
🎓 Как преподаватель математики стала руководителем ML-направления в ШАДе Привет, это Валя Бронер. Я 11 лет преподавала студентам математику в Томском государственном университете, а затем перешла в бигтех. Последние три года я руковожу ML-направлением в ШАДе Яндекса и создаю курсы по машинному обучению. Сегодня я расскажу, что мне нравится в преподавании, почему решила уйти из вуза в ШАД и как ML-разработчики помогают мне создавать актуальную программу в одной из самых динамичных современных индустрий. 🅿️ Всё началось ещё в магистратуре Однажды я заменяла преподавателя на курсе матанализа. Объясняла тему и вдруг, прямо посреди семинара, чётко осознала её место в общей структуре предмета. Картинка будто сложилась целиком, и я испытала такой восторг, что захотела одного: чтобы мои студенты чувствовали то же самое. Так я поняла, что мы с образованием друг друга любим. И сейчас я уверена, что, как бы ни менялась траектория моей жизни, она всегда будет с ним связана. 🅿️ 11 лет преподавала на любимой кафедре Я работала в ТГУ на творческой кафедре теории вероятностей и математической статистики: здесь все делали и продолжают делать больше, чем от них ожидается. Вместе с коллегами мы организовывали конференции, занимались наукой, экспериментировали с подходами к преподаванию и старались сделать занятия понятными, осязаемыми и наглядными. Например, на курсе аналитической геометрии, чтобы студенты лучше понимали сечения поверхностей и тел, мы демонстрировали их на овощах, фруктах и даже чипсах. Ломтик Pringles — это гиперболический параболоид, разрезанный огурец — модель цилиндра, картошка — эллипсоид. А после занятий студенты съедали наглядные пособия и были всем довольны. 🅿️ Но в университете мне становилось тесно Что-то кардинально менять я могла только в рамках кафедры, и мне не хватало кого-то, кто бы поддержал мои сумасшедшие идеи в большом масштабе. Окончательно уйти из вуза решила после ковида. Я обожала живое взаимодействие со студентами, но все перешли на удалёнку, и общения очень не хватало. А когда карантин закончился, студенты привыкли быть аватарками в зуме и просто молча писали конспекты. Это был очень тяжёлый опыт. Когда я решила расстаться с вузом, один из моих студентов-дипломников передал моё резюме руководителю Академии Яндекса. А через месяц после собеса я переехала в Москву и начала работать в ШАДе. 🅿️ С ML я познакомилась ещё до Яндекса Когда я работала в ТГУ, ко мне обратилась студентка, которая хотела писать диплом по ML. Это не было моей специализацией, но я согласилась стать её научруком: вместе мы разобрались в теме, и студентка успешно защитилась. Со временем ML стал частью моей работы, но я всё равно остаюсь математиком, а не разработчиком. Математический бэкграунд помогает мне разбираться в техническом содержании, а преподавательский опыт — понимать студентов и преподавателей. 🅿️ Теперь я шуршу по Яндексу и ищу идеи для новых курсов Одна из моих задач в ШАДе — следить за актуальностью ML-программы и развивать её. Поэтому я хожу в разные ML-команды, зову разработчиков на кофе и спрашиваю, чем они занимаются, что интересного происходит в их области и что обсуждают на конференциях. Часто ребята приходят к нам с идеями сами: так было с курсом по рексистемам, который полностью пересобрали тимлид из Лавки и его команда. Потом я собираю или пересматриваю программу, решаю, какой курс будет внутри неё, и приношу ML-разработчикам на уточнение, а параллельно ищу преподавателя, который будет вести курс. Затем — запуск, занятия и сбор фидбэка от студентов. Есть и особый формат курсов — открытые интенсивы на широкую аудиторию. Тут я тоже решаю много задач: ищу темы, подбираю команды, готовлю преподавателей к съёмкам и взаимодействую с аудиторией. 🔳 Читайте мою историю целиком в блоге о работе в Яндексе. Там я рассказала, кто помогает мне в проектах, почему мне нравится курировать студентов и какими образовательными проектами я занимаюсь помимо ШАДа. Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
2 941
6
📎 Найти баланс между ресёрчем и инженерией Всем привет, это Никита Корягин, ML-инженер в команде алайнмента Alice AI. До тог
📎 Найти баланс между ресёрчем и инженерией Всем привет, это Никита Корягин, ML-инженер в команде алайнмента Alice AI. До того как устроиться в Яндекс, я довольно много занимался ресёрчем: экспериментировал с моделями, писал статьи, публиковался на конференциях. Такой формат мне всё ещё очень близок, но в какой-то момент я захотел получать больше практической отдачи от работы: увидеть, как идея доезжает до реальной модели и начинает влиять на пользовательский опыт. 🅿️ Поэтому я решил попробовать Weekend Offer ML Из нескольких вариантов я выбрал команду алайнмента Alice AI. Мне было интереснее заниматься тем, что происходит с моделью уже после базового обучения: как научить её лучше рассуждать, отвечать на сложные запросы и в целом делать её полезнее для пользователя. 🅿️ Сейчас я в основном занимаюсь посттрейном reasoning-моделей Работаю с reward-сигналами, думаю над тем, как лучше оценивать сложные ответы и как использовать эту оценку для обучения. Это особенно важно для non-verifiable-задач, где нет простого способа автоматически проверить правильность ответа — например, когда модель должна хорошо объяснить, сравнить варианты или помочь с открытым вопросом. На практике от качества такой оценки напрямую зависит, чему именно модель научится в процессе post-training и станет ли её ответ полезнее. Представим ситуацию: пользователь просит модель помочь выбрать место, куда поехать в отпуск. В одном ответе — полотно текста про все страны в мире, в другом — пара уточнений и конкретный вариант под них. Мы награждаем модель за второе, и она учится рассуждать так, чтобы её ответы реально помогали пользователю. 🅿️ Граница между ресёрчем и инженерией стала гораздо менее чёткой Можно взять идею из свежей статьи, быстро проверить её на своих задачах, понять, где она ломается, переделать и довольно быстро увидеть эффект уже на реальной модели. Для меня это как раз хороший баланс между ресёрчем, которым я занимался раньше, и практической работой, которую я хотел найти. Но есть и различия. В исследовании часто приходится долго разбираться с одной красивой гипотезой. В продуктовой работе приходится сильнее думать о цене эксперимента — например, что именно мы хотим проверить, какой минимальный эксперимент даст ответ и насколько результат вообще масштабируется. 🔳 Кстати, с 11 по 12 сентября пройдёт новый Weekend Offer ML. Коллеги ищут ML- и DL-инженеров с опытом от двух лет в доменных областях NLP, CV, RecSys и Classic ML. Регистрируйтесь до 4 сентября 23:59, пройдите две технические секции и ловите офер, если всё будет успешно. Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 818
7
🍫 Как мы читаем даты изготовления с фотографий На связи Роман Шинкаренко, я разработчик в службе AI-сервисов Лавки. В новом
🍫 Как мы читаем даты изготовления с фотографий На связи Роман Шинкаренко, я разработчик в службе AI-сервисов Лавки. В новом посте рубрики «Обучено Яндекс Лавкой» расскажу, как мы обрабатываем жалобы пользователей на качество товара в доставке. В процессе обсудим, как нам в этом помогает AI-агент и как мы научили его отвечать честно. 🅿️ Поддержка заводит тикет с тегом и фотографиями Сотрудник техподдержки открывает фото, ищет на упаковке дату изготовления, сверяет товар с паспортом качества и выбирает причину брака из таблицы. Затем он проставляет уровень последствий и определяет, кто виноват: склад, поставщик или курьер. 🅿️ Затем тикет разбирает агент Внутри — граф из 27 нод: маршрутизация по тегу поддержки, отдельные ветки под ОФЯГ (овощи, фрукты, ягоды, грибы) и неОФЯГ, VLM, OCR, классификация, проверка на массовость дефекта, простановка полей и переход тикета. Но когда мы тестировали модель, самым тяжёлым узлом в этом графе оказалась на первый взгляд простая задача — прочитать дату изготовления с фотографии. 🅿️ Когда модель не могла ответить точно, она додумывала VLM всегда читает дату с картинки, даже если она смазана, стёрлась с плёнки или обрезалась кадром. Модель не ответит «непонятно» или «я не могу разобрать», а дорисует недостающие цифры сама. Ответ будет правдоподобный и в правильном формате, а отличить его от настоящего невозможно: 2025-07-12 выглядит ровно как 2025-01-12. Причину видно на бенчмарках: если убрать у текста языковую структуру и подать строки из случайных букв, точность распознавания падает примерно с 90 до 20%. Большая часть чтения была угадыванием по языковой статистике. Модель работает автокорректором: видит ayreadl — уверенно выдаёт already. Формат даты с цифрами ломает этот механизм. В дате 12.05.25 шесть почти равновероятных чисел. Ни одна не предсказывается из соседних, опереться не на что, и ошибку нечем поймать. В слове «молоко» опечатку исправит контекст, а неверная цифра остаётся валидной датой. Цена высокая: от даты зависят расчёт срока годности, поиск виновного и порог массовости. 🅿️ Как мы это вылечили Стали задавать каждой модели только тот вопрос, на который она отвечает честно: есть число или нет. VLM находит среди фото нужный товар по описанию из тикета и решает, видна ли на кадре читаемая дата. Извлекать значение ей запрещено прямо в промпте: наличие даты — грубый признак, он переживает сжатие картинки, а сами цифры — нет. Значение достаёт классический инструмент OCR из OCR Tools. Он не пытается понять, что написано, вместо этого он разбирает картинку на символы, и додумывать ему нечего. Фото с датой уходят в два разных движка распознавания, и цифры мы принимаем, только если оба вернули одно и то же. 🔛 А дальше четыре варианта: ⚪️ Дата найдена ⚪️ Даты на фото нет ⚪️ Движки прочитали по-разному ⚪️ Дата видна, но не читается Последние три — разные причины, и агент реагирует на каждую по-своему. 🅿️ Чего удалось достичь Половина фотографий в тикетах вообще не содержит даты: клиент снимает сам товар, а не маркировку. На таких кадрах модель тоже часто выдумывала значения. Гейт снимает их до распознавания, и с этой задачей VLM справляется отлично: recall 0,99. Найти нужный товар по описанию и оценить, есть ли на кадре дата, ей вполне по силам, так что и выдумывать оказывается нечего. Per-ticket accuracy выросла с 84 до 95%. 84% — это OCR Tools без гейта, 95% — с ним; считаем по тикету целиком, а не по отдельному фото. А сложные случаи агент не додумывает, а отдаёт оператору. Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 630
8
⭐️ Продолжаем рассказывать про спикеров 19 сентября встретимся на Practical ML Conf — хардовой конференции по практическому п
⭐️ Продолжаем рассказывать про спикеров 19 сентября встретимся на Practical ML Conf — хардовой конференции по практическому применению ML в бизнесе. В программе будет буквально всё: доклады и keynotes, дискуссии, много нетворкинга и отдельная зона с сервисами Яндекса, где можно участвовать в активностях, узнавать про технологии и получать подарки. Продолжаем знакомить вас со спикерами конференции. В прошлый раз рассказали про экспертов Яндекса, сегодня — про инженеров из бигтехов: ⚪️ Дмитрий Веснин, старший ML-разработчик Авито. Объяснит, как развивали item-энкодер в своей модели: заменили DCN трансформерной архитектурой, стабилизировали обучение и оптимизировали производительность. ⚪️ Никита Ермолаев, руководитель команды инфраструктуры обучения Text LLM в GigaChat, SberDevices. Расскажет, как масштабировали инфраструктуру Online RL для своих MoE-моделей и с какими реальными проблемами столкнулись. ⚪️ Станислав Илюшин, старший инженер Huawei. Поговорит о диффузионном драфтинге в спекулятивном декодинге: DFlash и DSpark — от модели до вывода в продакшен. ⚪️ Александр Мисевич, руководитель Group Of Efficient Runtime & Inference в AI Platform & Copilot, Т-Банк. Поделится, как команда строит инфраструктуру для массового инференса LLM в компании, а также внутренними процессами, которые позволяют быстрее выводить LLM в продакшен. ⚪️ Антон Разжигаев, старший научный сотрудник FusionBrain Института AIRI, руководитель группы «Интерпретируемый ИИ». Расскажет про Ouroboros — действующего экспериментального агента, который обошёл Codex, Claude Code и Cursor. 🔛 Программа пополняется, актуальный список докладов смотрите на сайте. 🔳 А ещё лучше — регистрируйтесь на Practical ML Conf и подписывайтесь на канал конференции, тогда вы точно будете в курсе всех апдейтов и активностей. Встретимся офлайн в Москве или онлайн из любой точки мира! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 651
9
🥹 Как добавить в умную колонку новые команды и ничего не сломать Чтобы начать взаимодействовать с умной колонкой, не обязате
🥹 Как добавить в умную колонку новые команды и ничего не сломать Чтобы начать взаимодействовать с умной колонкой, не обязательно говорить активационное слово «Алиса». Вместо этого можно использовать быстрые команды — короткие фразы, с помощью которых можно управлять музыкой, громкостью или умным домом. Например, чтобы переключить трек, достаточно сказать «дальше», а чтобы убавить звук — «тише». Такие команды делают жизнь проще и пользователям, и системе: запросы через слово «Алиса» требуют обращения к модели распознавания речи ASR, которой необходимы серверные вычислительные ресурсы из-за её размера. Модель быстрых команд, напротив, устроена компактнее и работает прямо на устройстве. Правда, у этой медали есть обратная сторона: проблема масштабирования. Модель ограничена вычислительными ресурсами самой колонки — её CPU и оперативной памятью. Со временем у нас появилась задача: добавить новые фразы «лайк» и «дизлайк» для управления треками, а также «включи блютус» и «выключи блютус». Но как сделать это так, чтобы ничего не сломать, не уронить качество на существующих командах и не увеличить потребление ресурсов на устройстве слишком сильно? 🅿️ Как можно решить эту задачу Мы решили присмотреться к идее Parameter-Efficient Fine-Tuning. Обычно это семейство методов используют для тюнинга больших моделей под специфический домен, когда данных мало, а бюджет на вычисления сильно ограничен. Но в своём классическом виде те же адаптеры или популярный LoRA вмешиваются во внутренние активации слоёв. Из-за этого их пришлось бы натаскивать сразу на две задачи: учить новые команды и параллельно следить, чтобы модель не забыла старые. Но выход есть — можно запустить две параллельные ветки вычислений: ⚪️ Первая остаётся полностью замороженной. Она сохраняет старые активации и логиты старых фраз, гарантируя прежнее качество ⚪️ Вторая получает новые обучаемые веса и натаскивается исключительно на новые команды Однако здесь возникает другой нюанс: нужно уменьшать размерности ветки новых команд, чтобы не сильно растить нагрузку на память и CPU. Если переборщить со сжатием, модель просто не сможет вытащить из урезанных активаций ничего полезного. 🅿️ Нужно было найти компромисс Решение получилось следующее: с определённого слоя оригинальной модели мы отводим параллельную ветку, забираем туда активации замороженного слоя, а внутри считаем небольшой добавочный вектор, который конкатенируем на каждом последующем шаге. 🅿️ В итоге: ⚪️ Новые слои имеют прямой доступ к активациям старой модели ⚪️ Модель учится распознавать новые команды и не тратит ёмкость на удержание старого контекста ⚪️ Мы полностью контролируем размерность новых слоёв и подгоняем её под лимиты железа 🔳 А в статье на Хабре мы рассказали: ⚪️ Откуда мы берём данные для обучения ⚪️ Почему нам не подошли существующие подходы PEFT и continual learning ⚪️ Каких результатов удалось достичь в цифрах Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 408
10
📕 Делимся главными статьями ICRA 2026, генерируем и редактируем картинки в одной модели и внедряем AI в Лавку. Всё это и мно
📕 Делимся главными статьями ICRA 2026, генерируем и редактируем картинки в одной модели и внедряем AI в Лавку. Всё это и многое другое — в новом дайджесте Yandex for ML 🚕 Куда сходить ⚪️ 5 сентября — deep tech night. Уже поделились первыми спикерами и их докладами: обсудим переход к генеративным моделям в RecSys, Physical AI, инфраструктуру RL-обучения, современную архитектуру NPU и другие вызовы IT-индустрии в эпоху AI ⚪️ 9 сентября — Data Dojo в Санкт-Петербурге. Приглашаем дата-самураев, которые уже владеют основами ML и хотят двигаться дальше. Здесь мы обсудим тренды, разберём реальные задачи из соревнований и поделимся прикладными кейсами ⚪️ 12–13 сентября — Weekend Offer ML. Это формат быстрого найма для ML-специалистов. Приглашаем за выходные пройти все этапы собеседований, познакомиться с командами и затем получить офер, если всё пройдёт хорошо ⚪️ 19 сентября — Practical ML Conf 2026. Хардовая конференция для экспертов и практиков. В программе: экономически эффективный инференс LLM, Agentic Vision, query-based-модель в автономном транспорте и end-to-end генеративная модель рекомендаций в Музыке 📖 Что почитать ⚪️ Alice AI ART 2.0: генерируем и редактируем. Рассказываем, как мы объединили генерацию по тексту и редактирование по картинке в одной модели, что пришлось изменить в архитектуре и как наше решение смотрится на фоне аналогов ⚪️ Главные итоги ICRA 2026. Команда Автономного транспорта Яндекса сделала обзор ключевых статей ICRA — одной из крупнейших конференций по робототехнике. Среди тем из разбора: Reinforcement Learning, генерация редких edge-кейсов, предсказание траекторий автономного транспорта и другие ⚪️ Как дела у AI в Лавке. Рассказываем о задачах службы AI-сервисов Яндекс Лавки и делимся итогами за прошедшие полгода: как мы построили инфраструктуру для агентов и при чём тут космолёты Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 647
11
🔎 Как мы объединили фичи картиночной Алисы На связи команда генеративных моделей в компьютерном зрении Поисковых сервисов и
🔎 Как мы объединили фичи картиночной Алисы На связи команда генеративных моделей в компьютерном зрении Поисковых сервисов и ИИ. Вместе с коллегами мы делаем мультимодального ассистента «Алиса AI». У модели Alice AI ART, которая отвечает за визуальную генерацию, есть два базовых сценария: ⚪️ Text-to-Image (T2I) — генерация фото по текстовому описанию ⚪️ Image-to-Image (I2I) — редактирование по картинке с инструкцией Всё это время эти сценарии жили как два разных стека: свои базовые модели, данные, метрики и своя отдельная боль в разработке и поддержке. Поэтому мы решили объединить их в одну модель, которая одинаково хорошо умеет и в T2I, и в I2I. 🅿️ Как мы проводили обучение 🔛 I2I-задача редактирования требует от модели понимания референса: входное изображение всегда содержит конкретный объект, который нужно сохранить, трансформировать или дополнить. Чтобы корректно применить инструкцию (например, «замени фон»), модель должна научиться точно кодировать визуальное содержимое и удерживать детали при генерации. Навык «читать картинку» напрямую улучшает и общее визуальное восприятие модели. 🔛 T2I-задача содержит промпты для генерации с нуля, и они, в свою очередь, подтягивают релевантность (соответствие картинки и текста). Так происходит, потому что они, как правило, детальнее editing-инструкций и описывают всё, что должно быть на изображении. Модель, которую обучили воспроизводить такие развёрнутые описания, вырабатывает более глубокое понимание языка и его связи с визуальными элементами. А ещё через T2I у модели проще расширить понимание концептов: любой именованный или безымянный объект, персонаж, свойство или стиль, с которым можно сопоставить визуальное воплощение. Ключевая особенность обучения uni-модели — общий для обеих задач претрейн. T2I- и I2I-данные перемешаны, чтобы визуальный и текстовый прайоры были едиными. 🅿️ Как мы провели показательный эксперимент Взяли набор концептов, которые отсутствовали в наших данных для редактирования, но которые ранее собирались для T2I. Затем смешали данные и провели совместное обучение, а после проверили, что станет с I2I. Результат оказался такой, на какой мы и надеялись: концепты, выученные из T2I, становятся доступны в редактировании по инструкции. Специфические запросы начинают работать без необходимости повторять работу по сбору узких срезов данных. Так знания из генерации переносятся в режим редактирования: даже если модель уже что-то знала о концепте, его качество в editing улучшается. 📖 А в статье на Хабре мы рассказали: ⚪️ На каких метриках мы измеряем качество моделей ⚪️ Что изменилось в самой модели ⚪️ Что планируем реализовать в будущем Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 484
12
🍫 AI’изация Лавки: что мы построили и куда идём дальше Привет! Меня зовут Алёна Зайцева, я руковожу службой AI-сервисов Янде
🍫 AI’изация Лавки: что мы построили и куда идём дальше Привет! Меня зовут Алёна Зайцева, я руковожу службой AI-сервисов Яндекс Лавки. Ниже расскажу, чем мы занимаемся и что удалось сделать за прошедшее полугодие, а в следующих постах рубрики «Обучено Яндекс Лавкой» мои ребята подробнее расскажут о строительстве платформы, «космолётов» и конкретных агентов. 🅿️ Над чем мы работаем Наша задача — системно перестраивать бизнес Лавки вокруг AI-first-подхода. Мы находим рутину, которую можно переложить с людей, строим агентные системы и замеряем эффект в FTE-gain. Это показатель, который отображает, сколько новых «виртуальных сотрудников» мы создаём для бизнеса каждым проектом. 🅿️ За прошедшее полугодие мы: ⚪️ Построили платформу, на которой живёт 40+ агентов. Получилась инфраструктура с интерфейсами, LLM-роутингом, тулами, оркестрацией и observability. Классического агента теперь можно довести от идеи до продакшена за пару дней ⚪️ Внедрили несколько десятков агентов и добавили свыше 100 виртуальных сотрудников Лавки. К примеру, мы запустили агента, который расследует пропавшие посылки, ассистента для мониторинга Лавок и курьерского фрода, а также AI-дежурного ⚪️ Много экспериментировали с архитектурами и подходами и получили опыт end-to-end-разработки AI-агентов: общались с бизнесом, искали точки оптимизации, обучали и внедряли ассистентов 🚀 А дальше — космолёты Агенты, которые заточены под отдельные процессы, зачастую упираются в потолок: оптимизируешь один кусочек, а вокруг него всё ещё остаётся много ручной работы. Следующий шаг — построить единую AI-систему на всю бизнес-функцию целиком с общим контекстом, единой точкой входа задач и AI-ядром. Такую схему мы называем космолётом: AI анализирует метрики, ставит задачи и исполняет их, а человек контролирует результат. Этот принцип мы уже пробуем в операционном управлении дарксторами, а в будущем планируем запустить пилоты в коммерции, маркетинге и на других задачах. 🔳 В следующих постах рубрики подробнее расскажем про свои проекты и заглянем под капот наших космолётов. Оставайтесь на связи! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 653
13
📖 Обзор статей с ICRA 2026 С 1 по 5 июня в Вене прошла International Conference on Robotics and Automation (ICRA). Это главн
📖 Обзор статей с ICRA 2026 С 1 по 5 июня в Вене прошла International Conference on Robotics and Automation (ICRA). Это главная международная конференция по робототехнике и автономным системам, и в этом году среди участников были ребята из команды Автономного транспорта Яндекса: Егор Волков, разработчик модели планирования движения, и Максим Спорышев, руководитель службы поведения и предсказания движения. 🔽 Собрали для вас самые крутые работы с конференции 🏆 Выбор жюри ⚪️ SymSkill: Symbol and Skill Co-Invention for Data-Efficient and Reactive Long-Horizon Manipulation. Интересный не ML-подход к манипуляционным задачам с большим горизонтом планирования ⚪️ OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction. Новый способ ретаргетинга для обучения роботов-гуманоидов на человеческих демонстрациях, который сохраняет пространственные отношения с объектами ⚪️ Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning. Необычный кондишенинг на положения камер в VLA-моделях — тех, что переводят картинку и инструкцию в действия робота ⚪️ FindAnything: Open-Vocabulary and Object-Centric Mapping for Robot Exploration in Any Environment. Здесь речь идёт об exploration и mapping над пространством объектов. Робот ищет произвольный объект в неизвестной локации и по пути строит карту всего, что нашёл 🚙 Статьи об автономном транспорте ⚪️ Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction. Это работа от Waabi AI. Основная идея — взять диффузионные модели как генеративный prior и на нём дотянуть 3D-реконструкцию до устойчивости к экстраполяции ⚪️ AttBEV: Enhancing Multi-Modal 3D Object Detection with CBAM Attention in BEVFusion for Autonomous Driving. Attention BEV — развитие идеи BEV Fusion, то есть всё того же представления сцены сверху, но с прибавкой по метрикам на nuScenes, одном из основных бенчмарков в автономном транспорте ⚪️ TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning. Авторы совместили два мира: алгоритмический и ML-планировщик. В качестве генератора траекторий-кандидатов используется Monte Carlo tree search, а для выбора лучшего кандидата — ML-модель. И это решение, которое уже в проде. Они действительно ездят на этой технологии по Лас-Вегасу ⚪️ Learning to Annotate Delayed and False AEB events: a Practical System for Extreme Class Imbalance and Asymmetric Label Noise. Решение задачи автоматической аннотации событий для системы автономного экстренного торможения — Automated Emergency Braking ⚪️ VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving. Авторы дообучают модель предсказания траекторий с помощью VLM. Сама VLM тут вспомогательный модуль, который выбирает лучшую траекторию из сгенерированных. Дальше этот преференс используется для формирования таргета в DPO-loss при обучении основной модели 🔳 Ещё больше интересных статей об автономном транспорте ищите на Хабре. Там мы также рассказали, какие воркшопы и доклады были на конференции, и поделились наблюдениями, которые мы оттуда увезли. Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 624
14
🔥 Делимся первыми спикерами на deep tech night В карточках рассказываем, кто и на какие темы будет выступать на конференции+5
🔥 Делимся первыми спикерами на deep tech night В карточках рассказываем, кто и на какие темы будет выступать на конференции 5 сентября. А чтобы получить доступ к эфиру, задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события, зарегистрируйтесь на сайте. 🔳 Подробности о докладах и форма регистрации Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
4 663
15
⚡️ Data Dojo возвращается — встреча ML-комьюнити в Питере 9 сентября в Санкт-Петербурге соберём тех, кто уже владеет основами
⚡️ Data Dojo возвращается — встреча ML-комьюнити в Питере 9 сентября в Санкт-Петербурге соберём тех, кто уже владеет основами ML и хочет двигаться дальше. Data Dojo — это живое общение с единомышленниками, разбор реальных кейсов от экспертов Яндекса и погружение в то, что происходит в ML прямо сейчас. Если вы начинающий ML-специалист — это шанс войти в тусовку, познакомиться с трендами индустрии и получить карьерную консультацию. Если уже опытнее — возможность для нетворкинга. Что в программе: ⚪️ Антон Клочков, руководитель группы ML-разработки Фотоинпута, расскажет, как они выкатили фичу, а потом откатывали её год ⚪️ Маргарита Мишустина, руководитель группы ранжирования Рекламы, покажет техническую эволюцию аукциона дизайнов, как оптимально группировать объявления для демонстрации пользователям и при чём тут химера ⚪️ Сергей Фиронов, ведущий разработчик службы поведения и предсказания департамента Автономного транспорта, разберёт задачи с соревнования Yandex ML Challenge Как участвовать: 1️⃣ Подайте заявку до 26 августа, приложив резюме 2️⃣ Дождитесь результатов отбора 2–3 сентября 3️⃣ Приходите на встречу 9 сентября, если получите приглашение ↔️ Участие бесплатное. Проезд и проживание за свой счёт. Трансляции не будет — только офлайн. Data Dojo — не разовая акция. Мы строим сообщество: сильное, открытое и любопытное. Здесь у каждого есть шанс стать лучше — и сделать лучше других. 🔳 Регистрация и подробности 🛄 Ждём вас! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
5 593
16
🛎 Через час начинаем ML Global Recap Вместе подведём ключевые итоги ICML и других международных конференций, поделимся своими инсайтами и выводами. Разложим по полочкам, что произошло в ML-индустрии за первое полугодие 2026 года. В программе — доклады руководителей разных команд Яндекса: ⚪️ Артём Бабенко, руководитель Yandex Research, расскажет о развитии Tabular DL ⚪️ Дмитрий Мокеев, руководитель группы качества претрейна Alice AI в Яндекс Поиске, разберёт тренды и вызовы в ризонинге ⚪️ Иван Дёгтев, руководитель аналитики Alice AI LLM в Яндекс R&D, поделится новыми подходами и стандартами в оценке качества моделей ⚪️ Андрей Бежин, руководитель службы ML-инфраструктуры в Яндекс R&D, расскажет об оптимизации LLM-инференса 💻 Подключайтесь к онлайн-трансляции: 🔛 Яндекс Плеер 🔛 Ютуб 🛄 Ждём вас! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
5 023
17
视频消息
3 762
18
📖 Что читают в команде ML Лавки? В свободное время ML-разработчики читают статьи, каналы бизнес-юнитов Яндекса, книги по тай+5
📖 Что читают в команде ML Лавки? В свободное время ML-разработчики читают статьи, каналы бизнес-юнитов Яндекса, книги по тайм-менеджменту и управлению креативными людьми и... бессмертную классику вроде «Анны Карениной»! 👷 В новом посте из рубрики «Обучено Яндекс Лавкой» собрали в карточках любимые книги или материалы, которые читают наши разработчики после работы. Рекомендациями поделились: ⚪️ Тимур Исхаков, ML-разработчик в логистике Лавки ⚪️ Марк Нарусов, ML-разработчик группы рекомендательных сервисов Лавки ⚪️ Руслан Кулиев, ML-разработчик Лавки ⚪️ Артур Ильичёв, лид группы рекомендательных и поисковых сервисов Лавки Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
4 156
19
⭐️ Сегодня знакомим со спикерами от Яндекса 📆 Practical ML Conf 2026 пройдёт 19 сентября в Москве и онлайн. На конференции б
⭐️ Сегодня знакомим со спикерами от Яндекса 📆 Practical ML Conf 2026 пройдёт 19 сентября в Москве и онлайн. На конференции будем обсуждать практический ML, который реально влияет на бизнес. Приготовили для вас хардовые доклады, дискуссии и классные активности. Наши спикеры — независимые эксперты, специалисты из разных IT-компаний и приглашённые гости с keynote-докладами. Про всех будем рассказывать постепенно, за обновлениями следите на сайте и в официальном канале Practical ML Conf. Рассказываем про первых спикеров от Яндекса: ⚪️ Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D. Расскажет, как в Яндекс Музыке протестировали end-to-end генеративную модель вместо рекомендательного стека и какие результаты получили в A/B-тесте. ⚪️ Владислав Носивской, руководитель группы инференса LLM в Yandex AI Studio. Объяснит весь путь строительства экономически эффективного инференса LLM для агентских (и не только) сценариев. ⚪️ Данил Кашин, руководитель команды претрейна VLM Яндекс R&D. Расскажет про то, как мы научили VLM рассуждать и использовать инструменты. ⚪️ Артемий Голиков, руководитель бригады визуальных агентов в Алисе, Алиса и Умные устройства. Поделится, как мы построили и обучили VLM-агента, который выполняет задачи в браузере. ⚪️ Иван Лунев, руководитель команды ядра детекции службы восприятия сцены в Автономном транспорте и роботах. Покажет, как мы перешли на query-based-модель MV2DFusion и ощутимо расширили зону видимости автономного транспорта. Что общего между Practical ML Conf и днём рождения? Ждёшь год, проживаешь на одном дыхании, а потом долго вспоминаешь и обсуждаешь. 🔳 Регистрируйтесь на конференцию! Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 294
20
🔗 Автоматизируем базу знаний с AI, заглядываем за кулисы ICML и возвращаем пользователей Лавки с помощью uplift-моделей. Всё
🔗 Автоматизируем базу знаний с AI, заглядываем за кулисы ICML и возвращаем пользователей Лавки с помощью uplift-моделей. Всё это и многое другое — в новом дайджесте Yandex for ML 🚕 Куда сходить ⚪️ Последний шанс зарегистрироваться на ML Global Recap’H1 2026, который пройдёт 13 августа. Обсудим итоги ICML и других международных конференций, главные ML-тренды первого полугодия 2026 года и собственный опыт команды. 🌎 Что случилось ⚪️ ICML: итоги и победы Яндекса. На ICML 2026 команда Yandex Research представила графовую foundation-модель GraphPFN и три публикации. Одна из них — как раз про GraphPFN — получила статус Best Paper Award на тематическом воркшопе. 📖 Что почитать ⚪️ Я перепоручил ведение базы знаний AI-агенту. Толя Панов, CTO Яндекс Карт, рассказал, как доверил AI-агенту суммаризацию, систематизацию и связывание материалов в своей базе знаний Obsidian и что из этого вышло. ⚪️ За кулисами реактивации оттока в Лавке. Слава Костров, ML-разработчик Лавки, объяснил, почему для реактивации пользователей недостаточно оценить вероятность оттока и как uplift-модели помогают понять, какой офер способен вернуть клиента. ⚪️ Предсказываем время сборки на складах в Лавке. Джавид Фаталиев, ML-разработчик в команде Яндекс Лавки, рассказал, как прогноз времени сборки влияет на скорость доставки и почему эта ML-модель остаётся незаметной для пользователя, хотя играет важную роль в работе сервиса. ⚪️ Как выжать из железа максимум: эволюция инференса в Алисе. Виктор Хаймоненко рассказал, как команда прошла путь от инференса на чистом C и пайплайна на корутинах до современных движков и квантизованных моделей. 💻 Что посмотреть и послушать ⚪️ «Грифон»: как адаптируем LLM-принципы в рекомендательных системах. Дарья Тихонович из команды Поисковых сервисов и ИИ рассказала, как в Яндексе развивают генеративные рекомендации: от Semantic IDs и эмбеддингов до квантизации и архитектур генеративных моделей. ⚪️ 1×1 с Димой Александровым на ютубе и в VK Видео. Что Дима понял о яндексоидах за годы работы в компании, как устроена ротация, каково управлять большой командой и почему автомобили стали для него больше чем хобби. ⚪️ «Доверительный интервал»: как аналитики драйвят бизнес — на ютубе и в VK Видео. Чем различаются аналитика эффективности и партнёрская аналитика, как по-разному они влияют на P&L компании и может ли эксперт-одиночка быть визионером и лидером. Подписывайтесь: 💬 @Yandex4ML 📹 @YandexML
3 492