en
Feedback
ML доставляет

ML доставляет

Open in Telegram

Привет! Ты заглянул на канал ML-команды Купер.тех. Здесь мы рассказываем, как создаём доставку будущего с помощью DS, NLP, CV и как стать одним из нас.

Show more
786
Subscribers
No data24 hours
No data7 days
+730 days
Posts Archive
💚Герои признаются сегодня На День всех влюбленных принято дарить сердечки, поэтому мы сделали валентинки от тех, кто точно з
+5
💚Герои признаются сегодня На День всех влюбленных принято дарить сердечки, поэтому мы сделали валентинки от тех, кто точно знает толк в силе, магии, болотах и сложных решениях специально для подписчиков «ML доставляет». Листайте валентинки и забирайте ту, которая откликнулась. Спасибо, что вы с нами.

Как LLM чувствуют себя в поиске? 👉 Кажется, что поиск — это «нашёл → показал → купили». Но если бы всё было так просто, у на
Как LLM чувствуют себя в поиске? 👉 Кажется, что поиск — это «нашёл → показал → купили». Но если бы всё было так просто, у нас не было бы этого поста. Предлагаем пройти небольшой квиз и попробовать угадать, какие особенности есть у поиска в Купер.тех на самом деле:
🟢Где LLM проще всего принимать решение? - Исправление опечаток - Проверка синонимов - Разметка релевантности - Комплементарные товары (Подсказка: не всё, что кажется простым человеку, так же просто для модели) Ответ: Валидация исправлений опечаток — лучший и самый стабильный кейс 🟢А где, наоборот, больше всего «серых зон» и субъективности? - Оценка «почти подходит» vs «подходит» - Различие похожих товаров - Понимание пользовательского намерения - Все варианты сразу Ответ: Оценка «почти подходит» vs «подходит» (промежуточные классы) 🟢Как думаете, что сильнее всего повлияло на качество LLM-разметки? - Качество промпта - Формат данных - Несколько моделей вместо одной - Выбор схемы классов - «Модель просто стала умнее»
Разобраться, что действительно сыграло ключевую роль, можно в новой статье Александра Баранова, аналитика данных в команде поиска Купера, где он подробно рассказывает, как LLM-разметка прошла путь от эксперимента до инструмента в проде.

✨Как быть pick me ML-инженером (это лучший гайд, не благодарите) В конце недели хочется чего-то не слишком серьёзного. Поэтом
Как быть pick me ML-инженером (это лучший гайд, не благодарите) В конце недели хочется чего-то не слишком серьёзного. Поэтому сегодня сделали для вас вредные советы о том, как стать pick me ML-инженером и сиять в любой ситуации:
🟢 На любой встрече обязательно говори: «Ну вообще это можно было бы решить через ML…» Даже если обсуждают новый цвет кнопки. 🟢 Старайся использовать нейросети даже там, где хватило Excel. Особенно на испытательном сроке, это точно произведет впечатление. 🟢 Никогда не говори просто «модель». Только «казуальная self-supervised архитектура с кастомным лоссом». 🟢 Если что-то сломалось — уточни: «Это не модель плохая, это данные не готовы к такому уровню интеллекта». 🟢 На демо всегда добавляй фразу: «Ну это baseline, дальше будет только лучше» (даже если это уже четвёртый «baseline»). 🟢 Люби графики. Даже если они ничего не значат. Особенно тепловые карты. Никто не знает, что они делают, но выглядит умно. 🟢 Говори, что обучали модель 2 недели, хотя просто нажали одну кнопку 14 дней назад.
🥳Узнали себя или коллегу? Пишите в комментариях!

👉 Один день «в полях» против месяца аналитики Можно бесконечно спорить про метрики, собирать отчёты и рисовать идеальные про
+3
👉 Один день «в полях» против месяца аналитики Можно бесконечно спорить про метрики, собирать отчёты и рисовать идеальные процессы. Но реальность обычно чуть коварнее: она не читает наши регламенты, не уважает SLA и очень любит обходные пути. Именно поэтому у нас есть Iron Man-челлендж — практика, которая помогает тем, кто разрабатывает продукт побывать на месте сборщиков и курьеров. 🏃 ML Unit Lead Тимур Кадыров принял в нём участие и поделился своим опытом и мыслями о вещах, которые становится видно только «в поле», и почему после этого меняется взгляд на продукт и приоритизацию. А вы когда-нибудь выходили «в поля» — в операционку или саппорт? Расскажите в комментариях, что больше всего удивило и какие инсайты забрали с собой

🤷‍♂️ Сейчас как начну работать Праздники закончились — и рабочие чаты снова подают признаки жизни, а задачи «давай после янв
+5
🤷‍♂️ Сейчас как начну работать Праздники закончились — и рабочие чаты снова подают признаки жизни, а задачи «давай после январских» так никуда и не делись. Чтобы не мучить себя «ну почему я не продуктивный» собрали список лайфхаков, которые помогают быстро включиться в работу. 🏃 А какой у вас самый лучший способ, чтобы прийти в себя после праздников? Делитесь в комментариях!

Неформальные сотрудники года: Senior Purr-formance Engineer и Chief Bork Officer 🟢 У этих сотрудников нет грейдов, но они вл
+8
Неформальные сотрудники года: Senior Purr-formance Engineer и Chief Bork Officer 🟢 У этих сотрудников нет грейдов, но они влияют на производительность. 🟢 У них нет задач, но есть результат. 🟢 Они ничего не коммитят, но без них деплой не такой. Мы собрали фото питомцев команды ML и подписали их очень важные «рабочие обязанности», которые они усердно выполняли весь год. 🏃 Теперь ваша очередь: кидайте в комментарии фото своих хвостатых коллег — тех, кто морально поддерживал и прерывал митинги ради важного «погладь меня». Посмотрим, кто старался больше всех!

🤪Итоги 2025 года: 605 миллионов запросов спустя или если бы 2025 был датасетом Чтобы подвести итоги года, мы выбрали способ,
+5
🤪Итоги 2025 года: 605 миллионов запросов спустя или если бы 2025 был датасетом Чтобы подвести итоги года, мы выбрали способ, который любим больше всего — через данные. ML-команда Купер.тех собрала несколько срезов, которые хорошо показывают, как 2025 ощущался изнутри сервиса. В карточках выше подвели показали картину, которая складываюется из множества маленьких действий пользователей. Интересно, найдёте ли вы там себя 👀 Спасибо, что были с нами весь год и сыграли в наших данных важную роль!

Топ важных теоретических результатов в Data Science и Machine Learning: 👉 Data Processing Inequality. Простыми словами: «Обр
Топ важных теоретических результатов в Data Science и Machine Learning: 👉 Data Processing Inequality. Простыми словами: «Обработка данных не может увеличить объём информации». Чуть более формально: Если случайные величины X, Y, Z образуют марковскую цепь X -> Y -> Z (то есть Z условно не зависит от X при известном Y), то для взаимной информации справедливо: I(X; Z) <= min{I(X;Y), I(Y; Z)}, в том числе I(X;Z) <= I(X;Y). Зачем нам это надо: из теоремы можно сделать вывод, что лучше всего получать данные из первоисточника. Каждый последующий обработчик в лучшем случае сохранит ту информацию, которую получил. Любая оценка X по Z будет заведомо не лучше, чем оценка X по Y. И это также обосновывает ценность хранения и использования максимально «сырых» данных. Ещё раз стоит вспомнить, что «мусор на входе — мусор на выходе». 👉Можно почитать: «An intuitive proof of the data processing inequality» 👉 Optimal Bayes classifier Байесовское решающее правило обеспечивает минимально возможную ошибку классификации среди всех классификаторов и по сути является «теоретическим золотым стандартом». К сожалению, на практике его почти никогда нельзя явно построить. Тем не менее, его можно использовать как ориентир: оно позволяет оценить, насколько малой в принципе может быть ошибка. На практике для такой оценки, например, применяют 1-NN. 👉Можно почитать: «A Bayes consistent 1-NN classifier» 👉 Universal Approximation Theorem Утверждает, что искусственная нейронная сеть с одним скрытым слоем, содержащая достаточное число нейронов, может аппроксимировать (с любой желаемой точностью) любую непрерывную функцию. Является хорошим теоретическим фундаментом и объясняет, почему нейронные сети в принципе способны решать широкий спектр задач. Кроме того, теорема смещает фокус с вопроса «может ли сеть это сделать?» на вопрос «как обучить сеть, чтобы она это сделала?», что и привело к появлению множества методов регуляризации и инициализации. 👉 ELBO (Evidence Lower BOund) Математически является нижней оценкой лог-правдоподобия. По сути представляет собой дифференцируемый функционал, который можно максимизировать градиентными методами. Лежит в основе VAE и диффузионных моделей. Представляет собой мостик между байесовской теорией и прикладным deep learning. Без этого результата генерация картинок вероятно работала бы намного хуже. 👉Можно почитать: ELBO - What & Why 👉 Probably approximately correct (PAC) learning Утверждает, что для достижения хорошего результата с высокой вероятностью не требуется использовать все данные в мире — достаточно конечного, обозримого набора примеров. Однако чем меньшую ошибку мы хотим получить и чем выше необходимая уверенность, тем больше данных нам потребуется. Именно PAC-подход позволяет оценить это требуемое число примеров. 👉 Vapnik-Chervonenkis dimension Если у нас есть набор классификаторов, то Vapnik–Chervonenkis dimension (VC-dimension) — это мера их выразительной способности. По сути, это максимальное число точек, которое алгоритм (или класс алгоритмов) может разделить всеми возможными способами. VC-dimension позволяет оценить необходимый объём данных: зная сложность модели, можно примерно понять, сколько примеров потребуется для её надёжного обучения. 👉 Cramér-Rao Bound Позволяет оценить, насколько в принципе точно можно измерить некоторую величину при заданном уровне шума. По сути, утверждает, что какой бы хорошей ни была оценка, дисперсия этой оценки не может быть меньше границы Крамера–Рао (CRB). 👀Конечно же, есть и другие фундаментальные результаты — ЦПТ, ЗБЧ и теорема Байеса. Думаю, их все проходили в университете: они важные и классические, так что тут и обсуждать особо нечего. Мораль простая: данные не волшебные, модели не всесильные, а математика всё помнит 🥳

Как научить поиск понимать контекст? Когда пользователь пишет «газировка спрайт», а поиск должен за 300 миллисекунд понять, ч
Как научить поиск понимать контекст? Когда пользователь пишет «газировка спрайт», а поиск должен за 300 миллисекунд понять, что ему нужно, — это задача со звёздочкой. О том, как мы решали её в Купере, в своей статье рассказывает Игорь Самарин, Machine Learning Engineer в Купер.тех. Он объясняет, как устроены полнотекстовый и векторный поиск в сервисе с сотнями тысяч запросов ежедневно, а также показывает, как обучить векторную модель на своих данных, чтобы она понимала специфику каталога. 👉 Читайте на Хабре! Для тех, кто хочет разобраться в теме с нуля, Игорь проведёт вебинар в karpovꓸcourses 18 декабря в 18:00. Приходите и задавайте вопросы! 🏃 Регистрируйтесь на вебинар

👉Прокачали поиск: теперь он читает ваши мысли! Знакомо, когда кот стоит у полной миски и жалобно смотрит на вас в ожидании ч
+3
👉Прокачали поиск: теперь он читает ваши мысли! Знакомо, когда кот стоит у полной миски и жалобно смотрит на вас в ожидании чего-то вкусненького? 😾 Вы срочно ищете лакомства в приложении доставки, но сначала видите их в продуктовых магазинах, а потом замечаете, что зоомагазины где-то дальше? Нам — да! Поэтому научили наш поиск выводить вперед экспертов в своей области. Как у нас это получилось рассказывает Алина Закирова, аналитик данных в Купер.тех на карточках выше 👆

Что делать ML-инженеру, когда в e-grocery появляются многорукие бандиты, глубокие скидки и адвент-календари? Лиза Петяева, Se
Что делать ML-инженеру, когда в e-grocery появляются многорукие бандиты, глубокие скидки и адвент-календари? Лиза Петяева, Senior ML Engineer, подробно разобрала этот вопрос на прошедшем вебинаре Центра непрерывного образования ФКН про динамическое ценообразование и объяснила: как устроены модели, что делать с эластичностью спроса и почему ML-задачи в e-grocery такие необычные. 🏃Ловите запись

💭Как прошёл ML Meetup: репортаж и видео докладов Вечер получился ярким и насыщенным: обсудили тренды в машинном обучении, об
+8
💭Как прошёл ML Meetup: репортаж и видео докладов Вечер получился ярким и насыщенным: обсудили тренды в машинном обучении, обменялись опытом и зарядились новыми идеями. Атмосферу передать не сможем, а видео докладов смотрите на YouTube и в VK Видео: 🟢Первый шаг к векторному поиску Игорь Самарин, Machine Learning Engineer в Купер.тех 🟢Применение LLM в поиске для разметок Александр Баранов, Data Analyst в Купер.тех 🟢Как картинки находят себе пары Николай Чугунников, Senior Machine Learning Engineer в Купер.тех Большое спасибо всем, кто присоединился к нам в офлайне и онлайн! 🥳

🏃ML Meetup is coming Подключайтесь в 19:00 по Москве к онлайн-трансляции митапа — будем разбирать практические кейсы, делиться опытом и рассказывать, как мы используем машинное обучение в Купер.тех.

👋ML Meetup уже совсем скоро! Готовы погрузиться в мир современных ML-решений? Вас ждут три увлекательных доклада, каждый из
+3
👋ML Meetup уже совсем скоро! Готовы погрузиться в мир современных ML-решений? Вас ждут три увлекательных доклада, каждый из которых раскрывает разные практические подходы в области машинного обучения. Также будет много живого общения с нашей ML-командой. 🏃Подробности и регистрация — по ссылке. Успейте записаться и попасть на офлайн встречу или онлайн-трансляцию.

👉На следующей неделе ML-команда Купер.тех будет активно общаться офлайн и онлайн, так что это отличная возможность узнать бо
👉На следующей неделе ML-команда Купер.тех будет активно общаться офлайн и онлайн, так что это отличная возможность узнать больше про нас и позадавать вопросы! 1️⃣2️⃣3️⃣4️⃣5️⃣6️⃣7️⃣8️⃣ Лиза Петяева, Senior ML Engineer и редактор канала «ML доставляет» выступит с вебинаром в Центре непрерывного образования ФКН и расскажет, про динамическое ценообразование в e-grocery, и то, как модели учатся не просто считать, а принимать решения. Поговорим про: 🟢принципы динамического ценообразования 🟢оценку спроса и влияние внешних факторов 🟢роль статистики, классического ML и RL 🟢метрики, цели и главные подводные камни 👉 Если хотите послушать, как ML помогает бизнесу зарабатывать не в теории, а в реальных проектах — регистрируйтесь на вебинар.

👉 Rotation Forest Представьте себе Random Forest, который вместо того чтобы хаотично тыкаться в признаки, проводит для каждо
👉 Rotation Forest Представьте себе Random Forest, который вместо того чтобы хаотично тыкаться в признаки, проводит для каждого дерева свой собственный PCA, чтобы найти самые информативные проекции данных, и чтобы ему проще было строить разделения. Часто обходит по точности градиентный бустинг, сохраняя все плюсы бэггинга. Хорошо показывает себя на задачах с большим количеством непрерывных признаков и сильной корреляцией между ними. Хотя является довольно медленным в тренировке. Проще говоря: если Random Forest — это толпа случайных прохожих, которым вы задаете вопрос, то Rotation Forest — это та же толпа, но каждому вы предварительно выдали по паре волшебных очков, чтобы они видели данные под правильным углом. 👉 Linear Tree Любопытный гибрид, где сила деревьев встречается с элегантностью линейных моделей. В Linear Tree в каждом листе обучается маленький lin. reg. на данных, которые туда попали. Бывает очень полезен в задачах с экстраполяцией, где обычные деревья пасуют. Есть из коробки в LightGBM. Проще говоря: это как если бы в филиалах большой компании не просто бездумно исполняли указания головного офиса, а имели право на месте проводить микро-анализ и принимать более взвешенные, адаптированные к местным условиям решения. 👉 Isolation Forest scikit-learn 🟢 online Модель для поиска выбросов, основанная на идее, что такие объекты проще изолировать, чем нормальные. В отличие от классических методов, Isolation Forest не пытается моделировать данные. Вместо этого он ищет, насколько легко изолировать некоторую точку. А совсем недавно появилась онлайн версия. Проще говоря: чтобы найти сумасшедшего в толпе, не нужно знать, как ведет себя каждый нормальный человек. Достаточно посмотреть, кого легче всего отгородить от всех остальных. Если на одного человека хватило всего два забора, чтобы он остался в одиночестве — вероятно, он и есть тот самый «выброс». 👉 Canonical Correlation Forests Менее известный, но достаточно изящный ансамблевый метод, который расширяет идею случайных лесов, используя статистически обоснованное преобразование признаков. Модель использует канонический корреляционный анализ, чтобы найти такие проекции признаков, которые наиболее связаны с целевой переменной. Проще говоря: вместо случайного выбора признаков CCF умно подбирает тему для разговора между признаками и ответом, чтобы каждое дерево в лесу было не просто случайным, а статистически обоснованно умным. 👉 RuleFit Гибридная модель, которая объединяет силу деревьев решений и интерпретируемость линейных моделей. Основная особенность — извлечение правил из ансамбля деревьев и использование их в качестве признаков в линейной регрессии или классификации. Обладает сильно более интерпретируемой в сравнении с уже классическим Random Forest. Проще говоря: RuleFit — это юрист, который переводит сложные, запутанные законы в четкий свод простых и понятных правил. 👉 Deep Forest Смелая попытка создать нечто столь же мощное, как глубокая нейросеть, но без ее магии и градиентов. Вместо слоев нейронов Deep Forest использует каскады из ансамблей деревьев. Каждый следующий слой получает на вход исходные данные и предсказания предыдущего, постепенно составляя все более сложные и абстрактные представления о данных — как это делают нейросети. Проще говоря: если нейросеть — это оркестр, где каждый нейрон — музыкант, то Deep Forest — это хор, где каждый певец не очень сложен, но вместе, слоями, они создают невероятно богатую полифонию. 👉 Hoeffding Trees Специальный тип дерева для мира, где данные льются бесконечным потоком, и у вас нет возможности переучивать модель на всем историческом архиве. Hoeffding Tree учится инкрементально, по одному примеру, и очень полезен в потоковой обработке. Проще говоря: это дерево, которое учится «на лету», как студент-заочник, который читает лекцию по одному слайду и сразу применяет знания, не дожидаясь конца семестра. 🌲 Лес большой, а тропинок в нём ещё больше. Поделитесь в комментариях, какие редкие, но достойные модели попадались вам?

Repost from Купер.тех
👉Какие планы на 19 ноября? ML-инженеры, дата-аналитики и все, кто работает с машинным обучением, бронируйте вечерний слот в
👉Какие планы на 19 ноября? ML-инженеры, дата-аналитики и все, кто работает с машинным обучением, бронируйте вечерний слот в календарях, потому что мы зовем вас на митап в Москве и онлайн. Встречаемся, чтобы поговорить про ML и показать, как мы применяем его в Купер.тех. В программе: 🟢Первый шаг к векторному поиску Игорь Самарин, Machine Learning Engineer в Купер.тех 🟢Применение LLM в поиске для разметок Александр Баранов, Data Analyst в Купер.тех 🟢Как картинки находят себе пары Николай Чугунников, Senior Machine Learning Engineer в Купер.тех 🟢От интуиции к алгоритмам: data-driven подход к массовому найму Вадим Грошев, Machine Learning Engineer в Купер.тех Регистрируйся, чтобы попасть в офлайн или не пропустить ссылку на трансляцию.

🏃 Ваш заказ мемов доставлен ML Kuper Memes. Part 6 Немного шуток о тяжёлой работе с данными, чтобы после всех профессиональн
+5
🏃 Ваш заказ мемов доставлен ML Kuper Memes. Part 6 Немного шуток о тяжёлой работе с данными, чтобы после всех профессионально выполненных задач отдыхать было еще приятнее!

🖥️ «Не звони! Я в интернете!» — если ты это говорил, этот выпуск для тебя. Тимур Кадыров, руководитель отдела анализа данных
🖥️ «Не звони! Я в интернете!» — если ты это говорил, этот выпуск для тебя. Тимур Кадыров, руководитель отдела анализа данных в Купер.тех, поучаствовал в качестве гостя в выпуске подкаста «Скрамное ИТ». Ребята погрузились в эпоху, где модемы пели, сайты грузились по строчке, а одна гифка могла положить браузер. Понастальгировали и обсудили: — как мы жили с пузатыми мониторами и дискетами на 3,5 дюйма? — почему интернет по карточкам был настоящим экстримом? — как ИИ незаметно ворвался в нашу жизнь (и уже не уйдёт) — что будет с Интернетом через десять лет: глобальный Wi-Fi или что-то совсем иное? Слушай или смотри выпуск: 🟢YouTube🟢VK Видео 💬 А теперь твоя очередь: расскажи в комментах, что было на твоем первом компьютере — Counter-Strike, «1000 игр в одной папке» или «Сапёр» на фулл-тайме?

Лиза Петяева, старший специалист по анализу данных в Купер.тех, рассказывает, как её ML-команда структурировала документацию
+5
Лиза Петяева, старший специалист по анализу данных в Купер.тех, рассказывает, как её ML-команда структурировала документацию проектов и нашла дзен. Как появилась эта идея? У Лизы был болезненный опыт — проект без документации, устаревшие данные и нулевой онбординг. В итоге проект заморозили, так и не доведя до продакшена. Возможно, вам тоже это очень знакомо. Какие проблемы нужно было решить? 🔥входящие задачи: неформализованные задачи от стейкхолдеров, бизнеса и продуктов, отсутствующий или слабый этап discovery 🔥проблемы с discovery: ошибки в принятии решений и нерациональное использование ресурсов 🔥отсутствие артефактов и документации: сложности с онбордингом новых участников проекта Чтобы такого не повторялось, команда собрала обязательные пункты документации, распределила ответственность между ролями и добавила чеклист — теперь процесс перестал быть завязан на одном человеке. Какие артефакты мы встроили в этапы развития проекта, чтобы улучшить наш онбординг, читайте в карточках выше!🏃 А какие решения в вашей команде помогают избегать проблем с документацией и онбордингом? Делитесь опытом в комментариях!