en
Feedback
RWB делает ML

RWB делает ML

Open in Telegram

RWB делает ML — канал про технологии в компании. Делимся инженерными разборами, архитектурой сервисов, статьями, докладами и опытом построения ML в продакшне.

Show more
1 564
Subscribers
No data24 hours
+137 days
+6030 days
Posts Archive
⚙️ Как ИИ меняет онлайн-торговлю на масштабе десятков миллионов пользователей? Павел Раваев, директор по данным RWB, рассказа
+8
⚙️ Как ИИ меняет онлайн-торговлю на масштабе десятков миллионов пользователей? Павел Раваев, директор по данным RWB, рассказал, какие ИИ-решения уже работают в продукте и какой измеримый результат они приносят. Собрали интересное на карточках: ⏹️ поиск по фото и его метрики за год ⏹️ виртуальная ИИ-примерка одежды, косметики и мебели ⏹️ генеративный ИИ для продавцов ⏹️ ИИ-функции в отзывах для покупателей и продавцов. @rwb_delaet_ml

⭐️⭐️ Один Шрек, 200+ брендов на старте и векторный поиск, который заменяет собой армию YOLO-моделей — Лев Нечаев, руководител
+8
⭐️⭐️ Один Шрек, 200+ брендов на старте и векторный поиск, который заменяет собой армию YOLO-моделей — Лев Нечаев, руководитель команды «Автоматическая модерация методами ИИ» в RWB, рассказал, как в модерации Wildberries ловят логотипы и лица без отдельной модели под каждую новую задачу. Подробнее — на Хабре 🖥 @rwb_delaet_ml

Хорошая модель бесполезна, если ее нельзя встроить в реальные процессы. Илья Бадекин, Data Scientist в команде товарных реком
+8
Хорошая модель бесполезна, если ее нельзя встроить в реальные процессы. Илья Бадекин, Data Scientist в команде товарных рекомендаций RWB, рассказывает, как команда сжала эмбеддинги для онлайн-ранжирования рекламы. О чём статья: ⏹️ зачем рекомендациям текстовый энкодер и как он помогает с «холодными» товарами ⏹️ как ту же модель применили к рекламным баннерам в поиске ⏹️ почему классические методы уменьшения размерности (PCA, TruncatedSVD) не дали нужного качества ⏹️ как «Матрёшка» (MRL) помогла сжать вектор в 8 раз, потеряв всего 4–5% качества 👆 Читать больше на Хабре @rwb_delaet_ml

DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее Что делать, если классический A/B-тест не р
DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее Что делать, если классический A/B-тест не работает из-за конфаундеров и сетевых эффектов? Рассказал Платон Попов, дата-аналитик в команде A/B-платформы RWB, на примере кейса оценки эффекта таргетированной рекламы в ПВЗ. Сначала использовали Propensity Score Matching (PSM), но метод не прошёл валидацию: доля ложноположительных результатов оказалась выше допустимого уровня. ➡️ Тогда перешли к Double Machine Learning (DML) — и получили более устойчивую оценку. Читать статью на Хабре 👆 @rwb_delaet_ml

💻 Как большие языковые модели работают со звуком — и чем работа с аудио отличается от текста? Анна Текучева, Data Scientist
+8
💻 Как большие языковые модели работают со звуком — и чем работа с аудио отличается от текста? Анна Текучева, Data Scientist HML NLP & Speech в RWB, разобрала, что умеет LLM в аудио, сравнила популярные модели синтеза речи и показала, как управлять результатом генерации. Читайте карточки или смотрите запись выступления на ODS LLM Meetup 🖥 @rwb_delaet_ml

Как мы внедрили AIOps для контроля GPU-утилизации и повысили её на 60 процентов В RWB команда ML-платформы построила поверх м
Как мы внедрили AIOps для контроля GPU-утилизации и повысили её на 60 процентов В RWB команда ML-платформы построила поверх мониторинга отдельный слой для управления такими кейсами на базе open source KeepHQ. Через систему прошло около 400 тысяч событий, а дедупликация составила ~99%. В новой статье на Хабре рассказываем, как устроили жизненный цикл алерта — от поиска владельца и сохранения контекста до автоматической проверки исправления и эскалации. И показываем, какие части Keep пришлось доработать и почему AI оказался далеко не главным элементом решения ⚙️ Результат: +62% к средней месячной утилизации GPU на одном из кластеров @rwb_delaet_ml

Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков Команда обучения и инфе
Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков Команда обучения и инференса RWB обучила текстовую версию Qwen3.5-2B с нуля — без pretrained-весов. В статье разбираем весь путь: от сборки доменных датасетов и Megatron-LM до online-оценки и экспериментов с архитектурой 👆 Хайлайты: ⏹️ обучили модель сначала на 1, затем на 11 трлн токенов ⏹️ протестировали XSA и получили −0,009 val loss и +1,6 п. п. на MMLU ⏹️ разобрались, почему MMLU в разных форматах показывает совершенно разную динамику ⏹️ проверили, как меняется качество при разных доменных блендах ⏹️ нашли слабое место модели — математику и reasoning А ещё рассказали, как устроен наш pretrain-пайплайн и какие эксперименты планируем дальше. ➡️ Узнать больше @rwb_delaet_ml

Repost from Старт в RWB
2 награды, 1 хакатон и сотни талантливых участников 🏆 У нас сразу две победы на национальной премии «Хакатоны России»! Студе
2 награды, 1 хакатон и сотни талантливых участников 🏆 У нас сразу две победы на национальной премии «Хакатоны России»! Студенческий хакатон RWB по машинному обучению и программированию стал лучшим сразу в двух номинациях — «Дебют года» и «Лучший хакатон в сфере ИИ» 😎
Эксперты премии отметили проект, который мы проводили в рамках Cookie Fest. Ребятам нужно было разработать ML-модель, способную находить дубликаты товаров на маркетплейсе по названиям, описаниям и изображениям.
К Хакатону присоединились более 270 студентов из ведущих вузов страны — НГУ, НГТУ, ТГУ, МИСИС, МИРЭА, СПбГУ, МАИ, Школы 21 и многих других. До финала дошли 100 участников, а 10 сильнейших команд представили свои решения экспертному жюри.

Mechanistic Interpretability ч2 🟣 В предыдущем посте мы защищали модель снаружи — через guardrails. Но что, если заглянуть L
+8
Mechanistic Interpretability ч2 🟣 В предыдущем посте мы защищали модель снаружи — через guardrails. Но что, если заглянуть LLM «под капот» и понять, как она вообще принимает решения? Максим Пантелеев, руководитель направления Core M&D в RWB, продолжает рассказ: сегодня про Mechanistic Interpretability и про то, как Sparse Autoencoders помогают распутать смыслы внутри нейросети. 👀 Смотреть запись выступления @rwb_delaet_ml

Почему нельзя взять одну большую LLM и использовать её везде? На практике каждая продуктовая задача предъявляет свои требован
+8
Почему нельзя взять одну большую LLM и использовать её везде? На практике каждая продуктовая задача предъявляет свои требования: например, к качеству, latency и стоимости инференса. Поэтому в RWB развивается не одна модель, а целое семейство BerryLM. Узнали у Матвея Сапрыкина, AI Assistants Models Tech Lead, как оно устроено ⚙️ @rwb_delaet_ml

RWB на Data Day 2026 Уже завтра, 9 июля, пройдет Data Day — рассказываем о наших спикерах ↓ ⏹️ 14:30, Трек «Финтех» Дискуссия
RWB на Data Day 2026 Уже завтра, 9 июля, пройдет Data Day — рассказываем о наших спикерах ↓
⏹️ 14:30, Трек «Финтех» Дискуссия «Управляемый запуск ML-решений в банковском секторе — сложности и рецепты» | Роман Бобров, Руководитель ML-направления в Fintech & WB Bank ⏹️ 16:15, Трек «Финтех» Доклад «Как с помощью данных запустить рассрочку: рецепт управляемого масштабирования» | Михаил Кузин, Руководитель управления аналитики b2c-продуктов ⏹️ 16:00, Трек «Путешествия и транспорт» Доклад «Быстрее, умнее, дешевле — ML/AI в логистике, складах и цепочках поставок RWB» | Михаил Дьячков, Руководитель ML-направлений в Supply and Demand Chain ⏹️ 15:40, Трек «Ритейл» Доклад «Как мы ускорили delivery фич за счет централизации ML сервисов» | Даниил Понизов, Руководитель ML-платформы ⏹️ 16:00, Трек «Ритейл» Дискуссия «AI-ассистенты» | Пётр Лукьянченко, Руководитель направления ML и Data Science, и Юрий Софронов, Руководитель направления «Модели и сервисы для ИИ-Ассистентов»
Заглядывайте, чтобы узнать больше о технологиях RWB и пообщаться со спикерами ⭐️ @rwb_delaet_ml

ML-системы внутри RWB — это десятки сервисов, которые работают вместе Машинное обучение у нас — это применение готовых моделе
+9
ML-системы внутри RWB — это десятки сервисов, которые работают вместе Машинное обучение у нас — это применение готовых моделей в реальном времени, обучение на исторических данных и строгие требования к задержке отклика и масштабированию. А ещё — большая команда, которая поддерживает отношения между продавцами и покупателями ❗️❗️ Рассказываем, как и где ML-решения прижились в Wildberries & Russ и почему теперь это часть единого технологического контура бренда RWB 🌟 rwb_delaet_ml

BerryLM-XL вошла в топ-3 русскоязычного бенчмарка MERA Дообученная командой RWB модель BerryLM-XL заняла 3-е место в общем ли
BerryLM-XL вошла в топ-3 русскоязычного бенчмарка MERA Дообученная командой RWB модель BerryLM-XL заняла 3-е место в общем лидерборде MERA с интегральной оценкой 0,835. Для сравнения, результат Human Benchmark на тех же задачах составляет 0,852. В топ-5 также вошла BerryLM-v2, занявшая 5-е место с оценкой 0,810 ✅
«Мы дообучаем модели под конкретные сценарии маркетплейса — от поиска и сравнения товаров до инструментов для продавцов — и измеряем их влияние на продуктовые и бизнес-метрики. Результат MERA показывает, что мы предоставляем продавцам и покупателям доступ к решениям мирового уровня для автоматизации процессов и решения повседневных задач», — прокомментировал директор по данным RWB Павел Раваев
Модели семейства BerryLM уже используются в поиске и сравнении товаров, ИИ-ассистенте для покупателей, инструментах для продавцов и ряде внутренних сервисов компании. Делаем подробный пост про BerryLM? Ставьте реакции 👀 Кстати, больше про ML в Wildberries & Russ — в @wb_delaet_ml. Подписывайтесь!

Открыли набор на «Лабс» — командные ИТ-стажировки Wildberries & Russ Это не учебные задачи в стол: вы собираете команду из тр
Открыли набор на «Лабс» — командные ИТ-стажировки Wildberries & Russ Это не учебные задачи в стол: вы собираете команду из трёх человек и работаете в связке с техническим ментором — с доступом к данным и инфраструктуре. На выходе — готовое портфолио, оплачиваемая стажировка и шанс остаться в команде. Есть два формата на выбор: 🟣 Исследовательский — берёте готовый кейс и решаете реальную бизнес-задачу WB. 🟣 Инновационный — развиваете собственный ИТ-проект при менторской поддержке. Вы можете выбрать 4 трека для решения:
1️⃣ Диффузионные модели в рекомендательных системах: исследуем диффузионные модели для рекомендаций, ставим эксперименты на открытых датасетах, готовим статью и репозиторий. 2️⃣ WB-FM: базовая модель пользователя для электронной коммерции. Одна модель вместо десятков энкодеров — ранжирование, поиск, антифрод, маркетинг. 3️⃣ Internship DevOps: четырёхмесячное погружение в работу дежурного инженера: Linux, Kubernetes, мониторинг, алертинг, непрерывная интеграция и доставка, разбор инцидентов. 4️⃣ Fit-the-Look: капсульные образы. Повышаем качество образов через гипотезы машинного обучения и компьютерное зрение на реальном пользовательском опыте.
Как попасть: до 30 июня собрать команду из трёх человек → подать заявку от капитана → пройти отбор и собеседование с техническим специалистом. Заявки и подробности по всем трекам — на лендинге 🖥 @wb_delaet_ml

❓ Можно ли доверять LLM-агенту, который сам принимает решения и вызывает инструменты? Максим Пантелеев, руководитель направле
+7
Можно ли доверять LLM-агенту, который сам принимает решения и вызывает инструменты? Максим Пантелеев, руководитель направления Core M&D в Wildberries & Russ, рассказывает, почему «ванильная» модель небезопасна по умолчанию и как выстроить защиту на практике. А в следующем посте серии пойдем глубже — заглянем модели «под капот» и разберем Mechanistic Interpretability и Sparse Autoencoders. Кстати, как вам кажется — заглянем ли мы однажды в «мысли» большой модели? 🏆 Да, рано или поздно мы это поймем 👾 Нет, так и останется «чёрным ящиком» ⚡️ Заглянем, но не до конца 👀 Просто наблюдаю за развитием темы Запись доклада — здесь! 🌟 @wb_delaet_ml

Repost from Data Day
‼️ Как ML/AI помогает товару быстрее пройти путь от склада до клиента? Логистика маркетплейса — это тысячи решений, которые н
‼️ Как ML/AI помогает товару быстрее пройти путь от склада до клиента? Логистика маркетплейса — это тысячи решений, которые нужно принимать быстро и точно. И чем масштабнее бизнес, тем выше цена ошибки — и тем важнее становятся ML/AI-инструменты, которые помогают оптимизировать процессы, снижать издержки и повышать качество сервиса. На Data Day Михаил Дьячков, руководитель ML-направлений в Supply&Demand Chain, RWB (Объединенная компания Wildberries & Russ), выступит в треке «Путешествия и Транспорт. Интеллект в движении» и расскажет, как ML и AI работают в «закулисье» движения товара. Вы узнаете: ✅ на каких этапах логистической цепочки Wildberries&Russ применяет ML/AI и почему именно там технологии дают наибольший эффект; ✅ какие бизнес-задачи помогают решать ML-модели в складах, логистике и supply chain; ✅ как AI-подходы влияют на скорость, стоимость и качество операционных процессов; ✅ к каким практическим результатам пришла команда RWB при внедрении ML/AI в Supply&Demand Chain. Михаил Дьячков более 10 лет работает в ML. Ранее развивал гео-направление в marketplace efficiency в Ситимобил, работал с ML в B2B в ecomtech. В RWB отвечает за направления, связанные с Supply&Demand Chain. 👉 Сайт и программа Data Day — 😁 Канал Data Day в MAX

9 июля увидимся на Data Day 2026 О чем расскажем? ➡️ где в логистической цепочке Wildberries & Russ применяются ML и AI ➡️ какие задачи модели решают в логистике и Supply & Demand Chain ➡️ как ML влияет на скорость, стоимость и качество операций ➡️ каких результатов удалось добиться после внедрения ML/AI Если будете на конференции — заходите на доклад 😎

👀 Как понять, что перед тобой настоящее фото, а не генерация нейросети? AI-картинки сейчас почти не отличить от настоящих фо
+8
👀 Как понять, что перед тобой настоящее фото, а не генерация нейросети? AI-картинки сейчас почти не отличить от настоящих фото. Даже на Sony World Photography Awards, победил снимок, созданный в Midjourney. Татьяна Кутузова, Иван Горбунов, Юлиан Гилязев и Елисей Мягких (команда T&S, Wildberries & Russ) рассказали, как создавался AI-детектор изображений и почему «95% точности» – это ещё не победа. В статье о том: 🟣 как мы учили нейросеть различать реальные фото и генерации 🟣 как определяем продуктовые границы и сценарии применения 🟣 почему честно измерить качество модели оказалось сложнее, чем обучить 🟣 какие метрики используются в обучении модели 🟣 какое решение нашли RWB AI Detector сейчас в открытой бете – команда ждет ваши сложные случаи! 🌟 @wb_delaet_ml

Делимся видеозаписями после Inside AI Meetup 😗 9 докладов и дискуссия о применении AI, нетворкинг и новые знакомства, инсайты из работы с искусственным интеллектом — вот, как прошел наш Inside AI Meetup 20 мая. А сегодня делимся с вами записями докладов: ➕ О применении AI в Wildberries & Russ | Павел Раваев, Wildberries & Russ ➕ Внедрение AIOps-практик для контроля и повышения общей утилизации ресурсов для тысяч продуктовых сервисов | Даниил Понизов и Роман Лазовский, Wildberries & Russ ➕ Автоматические гардрейлы | Владимир Солодкин, МФТИ ➕ Как мы за перевели более 10 продуктов на единую Discovery-платформу | Денис Самохвалов, VK ➕ Text is All You Need. Отекстовка потока видеоклипов в платформе Wibes | Антон Кости и Виталий Подобедов, Wildberries & Russ ➕ Эволюция поиска вакансий на Avito: ML-оптимизации в Avito Работе | Вадим Вахрушев, Avito ➕ ИИ для среднего размера компании | Дмитрий Лахвич, M2 ➕ Векторный поиск в модерации контента: как поместить более 200 моделей в 1 ансамбль | Лев Нечаев, Wildberries & Russ ➕ RAG, который не галлюцинирует (почти) | Артем Каледин и Александр Швайко, MWS ➕ Что на самом деле представляет запуск продуктов на базе LLM | Юрий Софронов, Wildberries & Russ ➕ Inside AI: Panel Discussion (Wildberries & Russ, Альфа-Банк, Сбер, red_mad_robot) Еще записи докладов можно посмотреть в VK Видео А презентации спикеров — в папке Встретимся на следующих митапах Wildberries & Russ! Чтобы не пропустить анонсы, подписывайтесь: @wb_delaet_ml 🌟

Что происходит, когда AI выходит за пределы прототипа? Обсудили на Inside AI Meetup 20 мая ⭐️⭐️ «Внедрение ИИ в production на
+8
Что происходит, когда AI выходит за пределы прототипа? Обсудили на Inside AI Meetup 20 мая ⭐️⭐️
«Внедрение ИИ в production на большом масштабе — это не магия, а постоянные компромиссы, ограничения и инженерный вкус, позволяющий сказать «нет» нейросетям там, где достаточно хороших данных и простой метрики», — Павел Раваев, CDO Wildberries & Russ
Эксперты из Wildberries & Russ, VK, Avito, МФТИ, M2, MWS, red_mad_robot, Альфа-Банка, Сбера поделились реальными кейсами из своего опыта: от высоконагруженной модерации с векторным поиском и AIOps-подходов к управлению ML-сервисами до практики построения RAG-систем, тонкостей реранкинга и реальных этапов запуска LLM-продуктов. Фотографии с мероприятия смотрите здесь 🖥 Ждем вас на следующих митапах Wildberries & Russ! Следите за анонсами в @wb_space