en
Feedback
Доска AI-объявлений

Доска AI-объявлений

Open in Telegram

Это не душный, а душевный канал про Data Science в Авито. Пишем о том, что у нас происходит, про ML, вакансии, мероприятия.

Show more
4 044
Subscribers
+1824 hours
+467 days
+7630 days
Posts Archive
Что думаете про конфы в офлайне?
Anonymous voting

Надеюсь, все пережили datafestовую неделю 🙂 С вами Андрей Широбоков и мне удалось попасть только на часть офлайн-конференции
Надеюсь, все пережили datafestовую неделю 🙂 С вами Андрей Широбоков и мне удалось попасть только на часть офлайн-конференции у нас в офисе. Как всегда, было мощно: от докладов до обедов. Если не согласны — делитесь мнениями в комментариях ⬇️ Но после каждого такого мероприятия у меня стабильно возникает один вопрос: офлайн-конференции — это всё ещё must-have или поросшее мхом legacy? В онлайне, кажется, выигрывает почти всё: 👉 проще собрать и спикеров, и слушателей, 👉 не нужно тратить время и деньги на дорогу, 👉 можно пересматривать, ставить на паузу, ускорять. В субботу пару раз хотел кликнуть на на особо интересных слайдах.Отсюда опрос.

Делимся впечатлениями: Data Fest 2026 Несмотря на погоду за окном, с вами было по-настоящему тепло! Что успели за день: ☑️ пр
+3
Делимся впечатлениями: Data Fest 2026 Несмотря на погоду за окном, с вами было по-настоящему тепло! Что успели за день: ☑️ прослушать 15 докладов от экспертов индустрии; ☑️ подвести итоги Avito ML Cup; ☑️ познакомиться и пообщаться; ☑️ разгадать ML-кроссворд; ☑️ и отлично провести время в тёплой компании на веранде нашего офиса. За день успели сделать сотню фоток, ищите себя здесь. Если пропустили какие-то выступления или хотите пересмотреть доклады — здесь сохранили трансляцию. Спасибо всем, кто был с нами на Data Fest × AvitoTech. До новых встреч! Увидимся в последнюю субботу весны через год! ❤️

Стартовал Data Fest 2026 by AvitoTech! Подключиться к трансляции: 🚀Основной трек 🔵смотреть в VK 📺смотреть на Youtube 💻Соревновательный трек(начало в 12:00!) 🔵смотреть в VK 📺смотреть на Youtube

Video message00:10

Как объединить несколько целей в один скор Привет! В прошлый раз мы разобрали Multi-task learning и в конце я остановился на
Как объединить несколько целей в один скор Привет! В прошлый раз мы разобрали Multi-task learning и в конце я остановился на том, что модель выдаёт несколько скоров, а сортировать выдачу нужно по одному числу. Сегодня разберём, как его собрать. Этот шаг называется Multi-Task Fusion (MTF): он собирает в финальный скор несколько предсказаний, например pCTR, pCVR, ожидаемое время просмотра и вероятность лайка. Самый простой вариант — формула с весами Например: score = w1·pCTR + w2·pCVR + w3·watch_time, где веса подбирают вручную — похожим образом сделали в статье про YouTube из прошлого поста.
Но возникают три проблемы: 1. Параметров много, и перебирать их в A/B долго и дорого. 2. Веса одинаковы для всех, хотя оптимальный баланс у всех разный. 3. Мы оптимизируем сиюминутный клик, а не то, вернётся ли пользователь завтра.
Дальше исследования по очереди решают эти проблемы и по пути находят новые. Пусть веса подбирает RL, а не человек BatchRL-MTF (Tencent, KDD 2022) — одна из немногих работ, где к фьюжну успешно применили обучение с подкреплением вместо ручного подбора весов. Сессия рассматривается как MDP: в состоянии лежат признаки пользователя, действие задаёт веса фьюжна, а награда отражает долгосрочное удовлетворение. Политику учат по логам в офлайне, а параллельно понемногу пробуют новые веса на трафике. Главное ограничение: в состоянии только пользователь, без контекста и товаров.
Внедрено в Tencent на коротких видео.
UnifiedRL (Tencent, 2024) — здесь улучшают сам процесс обучения. Чтобы не доверять оценкам для неопробованных весов, offline RL держится близко к логам, и улучшается слабо. А поиск новых весов на трафике обычным шумным способом идёт медленно и портит выдачу. UnifiedRL делает его намного эффективнее: пробует веса в узком персональном коридоре вокруг текущей политики. Зная его границы, модель безопасно ослабляет жёсткое ограничение и и свободнее исследует новые веса.
На A/B-тесте дало +4.64% полезных просмотров и +1.74% времени в приложении.
EnhancedRL (Tencent, 2024) — та же команда идёт дальше: кладёт в состояние признаки самих товаров, выдавая каждому свой вес, а не один набор на выдачу. Например, 30 секунд просмотра у 40-секундного ролика означают, что досмотрели почти до конца, а у двухчасового видео — что ушли почти сразу. Одним весом эти случаи не различить, а веса, зависящие от товара, справляются. Эффективный поиск весов при этом берётся из UnifiedRL.
На A/B-тесте дало +3.84% полезных просмотров и +0.58% времени в приложении.
Меняем постановку задачи xMTF (Kuaishou, WWW 2025). Зачем нужна фиксированная формула? Здесь каждый скор пропускают через обучаемую монотонную кривую вместо прямой линии, а затем складывают. Модель сама учит форму комбинирования, а не только веса. RL остаётся в роли внешнего контура, а кривые обучаются обычным образом.
Внедрено в Kuaishou, более 100 миллионов пользователей.
HarmonRank (Kuaishou, 2026, препринт). А ту ли цель мы оптимизируем? Раз сортируем выдачу, фьюжн стоит обучать под качество ранжирования, а не промежуточный лосс. Здесь переписывают AUC как дифференцируемую задачу о сумме рангов и обучают под неё модель. Оптимизировать ранжирование пробовали через RL, но там градиент шумный и нестабильный, а тут — устойчивый. Дополнительно self-attention учитывает, что скоры не независимы: pCTR и pCVR связаны между собой.
На A/B-тесте в Kuaishou дало +2.6% к покупкам.
И что в итоге Вырисовывается развилка. Можно оптимизировать то, что пользователь делает прямо сейчас, по наблюдаемым меткам, как HarmonRank: это устойчиво, но близоруко. Такая модель закрепляет текущее поведение и страдает от смещения меток показами: чего пользователю не показывали, того в данных нет, и модель делает вывод «не интересно». А можно оптимизировать долгосрочную ценность, как RL-линия выше: это ценнее и может менять поведение, но сложнее и менее стабильно. Чем платить, близорукостью или нестабильностью, пока открытый вопрос.

К старту приготовиться Напоминаем, что через час ждём вас на ML reading club. Николай Хохлов и Альберт Акопян прочитают и обсудят технический репорт DeepseekV4. Узнаем, какие проблемы возникли у команды DeepSeek в Pretrain и как с этими сложностями удалось разобраться. 📌 Эфир пройдёт сегодня в 18:00 🔗 Ссылка на подключение в Контур Толк Приходите, ждём всех! 🤗

К старту приготовиться Напоминаем, что через час ждём вас на ML reading club. Николай Хохлов и Альберт Акопян прочитают и обсудят технический репорт DeepseekV4. Узнаем, какие проблемы возникли у команды DeepSeek в Pretrain и как с этими сложностями удалось разобраться. 📌 Эфир пройдёт сегодня в 18:00. 🔗 Ссылка на подключение в Контур Толк Приходите, ждём всех! 🤗

А вы уже зарегистрировались на Дата Фест в Авито? Приглашаем всех желающих послушать доклады об ML и LLM, а также понетворкат
+1
А вы уже зарегистрировались на Дата Фест в Авито? Приглашаем всех желающих послушать доклады об ML и LLM, а также понетворкать и приятно провести время. Напомним 🗓 30 мая в 11 утра, 📍офис на Лесной. Расписание докладов и активностей на второй карточке поста ⬆️ Зарегистрироваться можно до вечера 27 мая.

Кто же лидирует в соревновании Всем привет! На связи Данила Бочарников, DS-инженер команды поискового ранжирования в Авито. С
Кто же лидирует в соревновании Всем привет! На связи Данила Бочарников, DS-инженер команды поискового ранжирования в Авито. Сегодняшний тезис: мы живём в трансформирующую эпоху с интересным соревнованием в ИИ. 📃 Отчёт Anthropic Компания опубликовала доклад, в котором написала, что США могут занять лидирующие позиции в ИИ. По их оценкам, к 2028 году получится создать «страну гениев» внутри дата-центра. В оппоненты записали Китай. Ключевые тезисы про сравнение с Китаем: 🟢DeepSeek обучила модель на санкционных чипах. 🟢Другие компании обходят ограничения через обучение моделей в дата-центрах Юго-Восточной Азии. 🟢Ответы моделей собирают и дистиллируют с помощью фейковых аккаунтов. Текущий разрыв оценивают в 6 месяцев, и если ужесточить ограничения, США смогут оторваться сильнее. В альтернативном сценарии Китай заберёт себе рынки развивающихся стран за счёт дешевизны. Отчёт ⭐ Звёздное пополнение Anthropic продолжают собирать таланты. Недавно к ним присоединился герой одного из наших прошлых постов — Андрей Карпаты. Забавно, что он стоял у истоков OpenAI, но выбрал конкурента. Его мнение: ближайшие годы будут решающими в ИИ. Твит Карпаты 🇨🇳 Ещё один кодовый агент Пока американцы думают, как оторваться от остальных, китайцы продолжают погоню. DeepSeek набирает команду для создания своего кодового агента, чтобы конкурировать с Claude, Codex и Cursor. Твит Опрос: кто будет лидировать в гонке? 👌 — США 🐳 — Китай Пишите своё мнение в комментариях!

Давно мы с вами не обсуждали статьи, это надо немедленно исправить С вами Николай Хохлов и Альберт Акопян с анонсом нового re
Давно мы с вами не обсуждали статьи, это надо немедленно исправить С вами Николай Хохлов и Альберт Акопян с анонсом нового reading club. В следующую среду будем обсуждать технический репорт DeepseekV4 🤖 Узнаем, какие проблемы возникли у команды DeepSeek в Pretrain и как с ними удалось разобраться. Затем рассмотрим новый подход к Post-Training — дистилляцию знаний у доменных экспертов (On Policy Self Distillation). О чём поговорим ➡️ Постараемся вспомнить предыдущие разработки Deepseek, как они применялись в архитектуре V4. ➡️ Узнаем, как работает новый механизм Compressed Attention-а, и почему он позволяет работать с контекстами до 1M токенов. ➡️ Выясним, какие проблемы возникли у команды DeepSeek в Pretrain и как с ними удалось разобраться. ➡️ Рассмотрим новый подход к Post-Training — дистилляцию знаний у доменных экспертов (On Policy Self Distillation). ➡️ Посмотрим, на инфраструктурные инновации и другие трюки, которые применяли в обучении модели. Приходите на прямой эфир 27 мая в 18:30. Ссылку пришлём за час до начала встречи 🙂

Приходите обсуждать ML и встречать лето на верандах московского офиса Авито! 30 мая в 11 утра у нас в офисе пройдёт ежегодный
Приходите обсуждать ML и встречать лето на верандах московского офиса Авито! 30 мая в 11 утра у нас в офисе пройдёт ежегодный Data Fest. Уверены, вы все знаете, что это, поэтому сразу расскажем об активностях. В программе: 🔥 ML in Marketplace 🔥 Секции LLM и CV 🔥 ML&Edication 🔥 А также соревновательный трек, посвящённый ML CUP Авито Как и всегда, кроме докладов вас ждут открытые дискуссии и афтепати на верандах. 📎 Офис не резиновый, так что регистрируйтесь по ссылке до вечера 27 мая. И приходите встречать лето с нами!

Близится Data Fest 2026, уже решили, куда пойдёте? 😎
Anonymous voting

Как Jupyter Notebook превратился во внутренний инструмент для поиска нарушителей Привет! Меня зовут Юля, я работаю в команде
Как Jupyter Notebook превратился во внутренний инструмент для поиска нарушителей Привет! Меня зовут Юля, я работаю в команде антифрода Авито. Мы разрабатываем алгоритмы скоринга и проверки пользователей — следим, чтобы недобросовестным покупателям и продавцам было тяжелее жить на платформе. 🔗 Один из наших ключевых инструментов — сервис связей между пользователями. Подаём на вход user_id, и на выходе получаем граф: кто с ним «сцеплен» и почему. Изначально эту информацию мы использовали только в наших моделях. 🔍 Раньше, когда мы разбирали примеры пользователей, нужная информация была разбросана по разным источникам. Я собрала всё в одном Jupyter Notebook: ответы сервиса связей, возраст аккаунта, количество доставок, жалобы и другие фичи по юзеру. Получился удобный инструмент для расследований. 🐍 У ноутбука быстро нашли минус: сложно шарить с коллегами, не у всех был доступ к нашим серверам. Поэтому я написала первую версию визуализации на Python с Jinja templates и подняла её внутри прод-контура. 🕵️ Постепенно стало понятно, что это удобно всем: можно смотреть конкретных пользователей, фичи по ним и разбираться, почему модель приняла то или иное решение. Инструментом начали пользоваться не только DS, но и модераторы, поддержка и детективы. 💚 В какой-то момент мы передали поддержку и развитие этой «админки» backend-команде — они улучшили интерфейс, добавили отказоустойчивость и разграничение прав доступа. Инструмент живёт и развивается до сих пор. Мораль: не пренебрегайте визуализацией данных. Она бывает разной — от ноутбука до полноценного внутреннего сервиса. А в эру AI-агентов поднять такую «админку» стало существенно быстрее, чем раньше 🙂

Свежий обзор старых статей Всем привет! На связи Алина Бабенко, DS Тимлид в команде Auction Efficiency. В одном из постов я о
Свежий обзор старых статей Всем привет! На связи Алина Бабенко, DS Тимлид в команде Auction Efficiency. В одном из постов я обозревала темы докладов с конференции CIKM в Южной Корее. Однако интересные статьи выходят регулярно, и даже в старых можно почерпнуть много полезной информации. Поэтому сегодня покажу несколько материалов для вдохновения 🙂 1️⃣ Сейчас мы исследуем переход на DL в наших монетизационных моделях. Путь непростой, поэтому полезно посмотреть на опыт других компаний. Копировать их шаги не стоит, но некоторые любопытные мысли почерпнуть можно. Когда-то давно я наткнулась на статью от Airbnb про их переход на DL. Мне очень понравился этот обзор: рассказывали, что получилось, и самое интересное — что не получилось. А недавно я увидела статью от Pinterest на Medium, в которой кратко описали улучшения для модели. 2️⃣ Известная проблема для обучения — data drift. Конечно же, это важно и для монетизационных моделей, и мы применяем разные решения. Например, переобучаем на новых данных, но теряем старые 😒 В статье Continual Learning for CTR Prediction: A Hybrid Approach авторы рассматривают изменение самого датасета через memory replay — это сохраняет репрезентативную часть данных из истории, и новая модель обучается на них. Шаг обучения выглядит так: отдаём модели новые данные и информацию из буфера, а дальше обновляем буфер. При этом авторы пробовали оставлять случайную подвыборку, но подход, в котором остаются более сложные примеры, показывает себя лучше. 3️⃣ В Авито продавцы платят не только за клики, но и за более глубокие действия. Для таких пользователей мы сейчас предсказываем CVR-модели — это конверсия из клика в отклик, контакт или сделку. В прошлом посте я показывала пример, в котором авторы поправляют на смещение, что объявления показаны на разных позициях, но подобный эффект есть и для CVR-моделей. В датасеты для обучения попадают только объявления, на которые кликнули. Можно было бы использовать CTR как модель для IPS, но в статье Click-aware Structure Transfer with Sample Weight Assignment for Post-Click Conversion Rate Estimation решили рассмотреть другой подход. Авторы используют несколько голов для раздельного предсказания CTR/CVR и исследуют разные подходы к общей информации между этими головами. Ещё интересно пишут про концепцию Curse Escaper, в которой они как раз разбирают, как оптимально взвешивать данные для подсчёта лосса, чтобы сделать оценку CVR несмещённым. А какие интересные статьи для работы находили вы?

Приглашаем послушать, как ИИ троллили техногигантов 😏 Поговорим на такие темы, которые обычно не обсуждают на публике. Как о
Приглашаем послушать, как ИИ троллили техногигантов 😏 Поговорим на такие темы, которые обычно не обсуждают на публике. Как ошибаются ИИ во время обучения и почему это может неожиданно повлиять на продукт. Например, узнаете о таких случаях: 🔴Как переобучение модели для борьбы с нежелательным контентом неожиданно затронуло неправильные категории, 🔴Как эволюционировала функция размытия на изображениях, 🔴Что случилось, когда при запуске новой модели «исчез» ценный список контактов, 🔴Как ИИ начала спокойно рассказывать пользователю о грамматике мата, 🔴Почему противодействие недобросовестным пользователям — это работа с неопределённостью, серыми зонами и очень дорогими ошибками. Если вы DS- или ML-продакт, приходите на встречу, чтобы послушать яркие истории от специалистов из Авито и Яндекса, а после пообщаться и отдохнуть. Когда и где 🗓15 мая, 18:30 🔥Москва, офис Авито на Лесной, 7 👉Предварительно нужно зарегистрироваться ❗Трансляции и записи не будет, доклады услышат только те, кто придёт лично.

Панельная дискуссия про пользу ИИ Привет, с вами Екатерина Давыдова, продакт-менеджер Авито (ex Program Manager GenAI), и на
Панельная дискуссия про пользу ИИ Привет, с вами Екатерина Давыдова, продакт-менеджер Авито (ex Program Manager GenAI), и на прошлой неделе я заехала на AIConf, чтобы поучаствовать в панельной дискуссии. Это было интересно. Поймала себя на мысли, что рынок делает поворот от обмена восхищением ИИ к разговору о деньгах и о том, как вообще это всё приземлить в прод. Что обсудили ➡️ где ИИ даёт бизнес-эффект, а где только видимость крутоты, ➡️ почему пользователи часто не видят самые прибыльные кейсы, ➡️ как не перепутать провал идеи с тем, что технология не дотягивает, ➡️ почему MVP на сильной модели почти всегда создаёт ложное ощущение, что всё работает. Отдельно поговорили о продакшене. Сколько стоит инференс, что делать с ограничениями по данным, как интегрировать ИИ в прод. В общем, всё то, что красиво выглядит на демо, но ломается в реальности. Пока обсуждали, в очередной раз убедилась в правильности двух мыслей про ИИ в продукте: 🟢Он делает ошибки дороже. 🟢Надо на него смотреть как на продуктовый портфель: где-то уже есть понятная экономика, где-то R&D, где-то стратегические ставки. 🤩 Ну и как обычно, самое ценное — разговоры в кулуарах. Там становится понятно, что действительно работает, поскольку хайпа меньше, а реальности больше.

Объявляем ML Cup 2026 открытым! 🏆 Прошёл год с предыдущего соревнования и пора проводить его в третий раз. Avito ML Cup 2026
Объявляем ML Cup 2026 открытым! 🏆 Прошёл год с предыдущего соревнования и пора проводить его в третий раз. Avito ML Cup 2026 — это возможность попробовать свои силы на прикладной задаче, и получить приятный денежный бонус. Вы можете решать самостоятельно или в команде до 4 человек. Как участвовать. Регистрируйтесь на сайте ODS в период с 27 апреля по 26 мая. Чем раньше начнёте, тем больше решений успеете предложить. Какую задачу решаем. Изучите историю пользователей и метаинформацию об объявлениях. А потом определите, с какими предложениями проконтактирует пользователь с большей вероятностью. Призы 🎁 300 000 ₽ за 1 место 250 000 ₽ за 2 место 200 000 ₽ за 3 место Зарегистрироваться и решить задачу

Проводим небольшое исследование, чтобы понять, на что уходит время ML-инженеров во время работы. Пройдите, пожалуйста, опрос.
Проводим небольшое исследование, чтобы понять, на что уходит время ML-инженеров во время работы. Пройдите, пожалуйста, опрос. Он анонимный, займёт 3 минуты. Результаты в разрезе грейдов опубликуем в канале через 2 недели 🙂

Как мы автоматизировали проверку кода с помощью нейросети В Авито создаётся 1 000 пул-реквестов в неделю, а в пиковые часы —
Как мы автоматизировали проверку кода с помощью нейросети В Авито создаётся 1 000 пул-реквестов в неделю, а в пиковые часы — до 300 штук в час. Всё надо обработать, а ложные замечания — отсеять. 🤔 Раньше на это тратили много времени и сил, поэтому мы решили автоматизировать процесс. Взяли модель и обучили её анализировать код, чтобы находить потенциальные проблемы, а затем проверять собственные находки. ✅ В результате до разработчиков доходят только те комментарии, которые помогают улучшать продукт. Все подробности этой работы наш инженер Марк Каширский рассказал в свежей статье: Читать на Хабре