ML доставляет
Open in Telegram
Привет! Ты заглянул на канал ML-команды Купер.тех. Здесь мы рассказываем, как создаём доставку будущего с помощью DS, NLP, CV и как стать одним из нас.
Show more786
Subscribers
No data24 hours
No data7 days
+730 days
Posts Archive
+3
В статье Розы Морозенковой, MLOps-инженера в Купер.тех, — реальная история о том, как превратить хаотичный ML в управляемую систему.
Собрали не только ML-платформу, но и мемы про то, как это происходило. Они отлично иллюстрируют, почему:
🟢 «идеальная схема» запуска моделей разваливается на практике
🟢 в работу вовлекаются DevOps, DataOps, MLOps и SecOps, и у каждого своя правда
🟢 шаблоны и CI/CD спасают от хаоса и «велосипедов»
🟢 сервисные карточки и контракты делают процессы прозрачнее
🏃Читайте на Хабре!
+5
🌍 ML-проекты живут по своим законам: здесь много ресерча, неожиданных открытий и управленческих вызовов.
Как справляться с ними и при этом сохранять доверие команды и бизнеса?
Чтобы в этом разобраться мы взяли небольшое интервью у руководителя команды поиска и рекомендаций, Владислава Евтеева.
Читайте подробности — в карточках выше и пишите комментарии 👉
+5
🔎Поиск в e-commerce — это не просто список товаров, а целый механизм, который должен быстро и точно угадывать, что имел в виду пользователь.
Игорь Самарин, специалист по анализу данных, делится опытом внедрения гибридного поиска: как мы обучали модель, какие сценарии тестировали и как выбрали решение, которое почти не нагружает систему.
🥳Если понравилось, то ставь лайк — и мы скоро расскажем о развитии нашего проекта!
+5
ML Kuper Memes. Part 6
ML инженеры — как персонажи из сериалов нулевых: каждый со своим характером, подходом и неповторимым вайбом.
Узнаете себя или коллег? 😉
Что общего у штрихкодов, эмбеддингов и Airflow?
Правильный ответ — матчинг товаров.
В e-commerce это не так просто организовать и настроить: офферов много, данные приходят в разнобой, а карточки должны появляться на витрине быстро. Мы в Купер.тех прошли уже множество итераций — от «олдскула» до ML-пайплайнов.
В новой статье ML-инженер команды контента Николай Чугунников рассказывает, как эволюционировал автоматчинг, и какие решения помогли нам двигаться дальше.
👉 Читайте на Хабре!
👉Думаете, с чего начать свой путь в ML или как прокачаться еще больше?
Мы собрали подборку книг и материалов, которые сами читают и очень рекомендуют наши ребята из ML-команды Купер.тех.
📚Уровень «Лайт» - это научпоп литература:
Дж.Элленберг — «Как не ошибаться: Сила математического мышления»
👉 Читать
Ч.Уилан — «Голая статистика»
👉 Читать
📚Полезные гайды:
Хэндбук от Яндекса (настоящая классика)
👉Читать
Классный гайд про то, как учить большие LLM
👉Читать
Официальные гитхабы и статьи от антропика и Open IA про то, как создавать агентов с большим количеством примеров:
👉Читать 👉Читать 👉Читать
📚Уровень «Хард» - для настоящих душнил про математику:
Christopher Bishop — «Pattern Recognition and Machine Learning» (классика, чтобы разобраться в теории, статистике и байесовских методах)
👉Читать
Ian Goodfellow — «Deep Learning» (структурно и системно про нейросети, от основ до современных архитектур)
👉Читать
Ричард Хэмминг — «The Art of Doing Science and Engineering»
👉Читать на английском
👉Читать на русском
📚 На английском языке:
Matheus Facure — «Causal Inference for the Brave and True»
👉Читать
Martin Zinkevich — «Rules of Machine Learning: Best Practices for ML Engineering»
👉Читать
O'REILLY — «Machine Learning Design Patterns Solutions to Common Challenges in Data Preparation, Model Building, and MLOps»
👉Читать
O'REILLY — «Reliable Machine Learning Applying SRE Principles to ML in Production»
👉Читать
O'REILLY — «Designing Machine Learning Systems An Iterative Process for Production-Ready Applications»
👉Читать
А какие книги или материалы по ML помогли вам больше всего? Делитесь своими рекомендациями в комментариях!
ty 👉свежий type checker для Python от создателей Ruff и uv. Лёгкий, быстрый, минималистичный — без лишнего оверхеда. В отличие от MyPy и Pyright, здесь не нужно разбираться в конфигах.
Embedding Atlas 👉еще одна библиотека от Apple для визуализации эмбедингов и других данных. Можно интерактивно посмотреть на векторное пространство, кластеры, распределения. Отличный инструмент, который помогает лучше интерпретировать модель.
Apache Hamilton 👉инструмент для создания и управления dataflow на Python. В наших проектах мы его не используем, но он может быть очень полезен: позволяет делать ML-пайплайны прозрачными, воспроизводимыми и легко тестируемыми.
hummingbird 👉библиотека от Microsoft, которая позволяет конвертировать классические ML-модели в высокопроизводительные тензорные вычисления, совместимые с PyTorch, ONNX и TVM. При этом сохраняется полная совместимость с API scikit-learn. Особенно полезна для задач, требующих быстрого инференса в реальном времени (фрод-детекция, рекомендательные системы), а также для унификации ML-стека, когда классические модели и нейросети работают на одном GPU.
pyro 👉мощная библиотека для вероятностного программирования на базе PyTorch, разработанная в Uber. С её помощью можно легко собрать сложные байесовские модели. Хорошо масштабируется благодаря PyTorch. Особенно полезна в задачах с неопределённостью — например, в A/B-тестах или прогнозировании, где важно не только предсказывать результаты, но и оценивать доверительные интервалы и риски.
CalFram 👉тоже библиотечка для оценки откалиброванности ML моделей. Очень похожа на relplot, но помощнее.
tinygrad 👉минималистичная библиотека для deep learning на чистом Python и NumPy. В отличие от тяжеловесных фреймворков вроде TensorFlow или PyTorch, её код занимает всего 3–4 тысячи строк. При этом она достаточно мощная, чтобы решать почти любые задачи. Даже сайт у неё в таком же минималистичном стиле. В работе мы её не используем, но библиотека интересная сама по себе — можно поиграться, изучить подходы и прокачать понимание.
+4
🏃Пост для тех, кто следил за нашим каналом и хотел попасть к нам в команду.
На эту позицию редко открываются вакансии, но сейчас мы активно ищем двух ML-инженеров (middle/middle+) в рекомендательные системы.
В карточках выше мы рассказали, чем занимается команда, почему с ними интересно работать, и даже взяли комментарий у руководителя ML-направления клиентской вертикали Тимура Кадырова.
Откликайтесь по ссылке и присылайте знакомым, если думаете, что для них это могло бы быть релевантно!
+4
Aha!25 — это целых два дня про развитие продуктов и умную работу с данными.
👋О чем рассказывали?
Было много разноплановых выступлений: аналитические, инфраструктурные, продуктовые, технические и ML-доклады. Часть тем пересекалась с DataFest.
🔥Какие доклады запомнились?
— Алёна Картошкина: «Как сократить TTM за счёт ускорения разработки ML-моделей». Наша бывшая коллега подготовила мощный доклад, после которого точно было о чём подумать.
— Галя Ширанкова из Авито: «Считаем деньги от внедрения LLM: Traction model Avito Assistant». Во время такого выступления всем в какой-то момент действительно захотелось стать продакт-менеджерами.
— Виктор Кантор: «Задачи, за решения которых платят и будут продолжать платить». Профессиональный взгляд на развитие карьеры и тот редкий спикер, которого можно слушать просто ради харизмы.
— Анна Крючкова из Яндекса рассказала про аналитическую систему «Атлас» и ответила на вопросы: как и зачем анализировать терабайты геоданных в реальном времени? Например, как по картинке загруженности такси понять, что в Алматы приехал Егор Крид.
— Юлия Антохина и команда AI-стилиста Lamoda: «Стильный код: натуральный поиск редких атрибутов по картинке». Получилось очень атмосферное погружение в ML-задачи модной индустрии.
— Саша Абрамов: «Тренды и главные вызовы в GenAI 2025». Было интересно послушать про будущее LLM и куда всё движется.
🛍Стенды и мерч:
Квест «собери весь лут» был успешно пройден — пришлось зависнуть у стендов компаний.
Самая необычная активность — гонки на радиоуправляемых машинках в шлеме с камерой.
😁Бонус:
— Во второй день внезапно появилось отделение на тему здоровья (где даже была лекция уролога) которое, судя по всему, не стало хитом у аудитории, но оставило яркие впечатления.
— Коллеги из Лавки посоветовали попробовать медовейник (и да, он оказался реально вкусным).
Наши ребята из команды ML в Купер.тех не только пишут модели, но и любят нетворкинг и регулярно ходят на конференции,чтобы привозить оттуда новые знания и идеи.
Теперь будем делиться этим и с вами: запускаем рубрику с честными обзорами событий, которые мы успели посетить!
OR-Tools 👉библиотека от Google для решения задач оптимизации — по сути, удобный интерфейс для работы с разными солверами. Может пригодиться, например, чтобы понять, как правильно распределить бюджет между каналами найма. Не Gurobi, конечно, но зато бесплатная и открытая! Не писать же руками динамическое программирование или эвристики.
SymPy 👉аналог Wolfram, но для Python. Полезна, когда нужно прикинуть теоретические оценки: найти корни или экстремумы какого-нибудь функционала, а затем использовать эти результаты как ориентир для практических расчётов.
Polars 👉библиотека для работы с табличными данными, альтернатива pandas, но быстрее и удобнее. Поддерживает ленивые вычисления, потоковую обработку и работу с GPU. Короче, кайф. Жду, когда все наконец пересядут с pandas. Кстати, тут же есть и Narwhals — чтобы было проще совмещать разные библиотеки.
Venn-ABERS 👉используем для калибровки наших ML-моделей. Кажется, о нём мало кто знает, но он действительно классный и часто показывает себя лучше других подходов. Здесь же стоит упомянуть библиотеку relplot — полезный инструмент для оценки откалиброванности моделей. Она строит наглядные и аккуратные графики, которые приятно и самому посмотреть, и коллегам показать. Кстати, разработана ребятами из Apple. Да-да, они не только айфоны делают, но и модели калибруют.
Fire 👉позволяет автоматически превратить любой модуль, класс или функцию в CLI. Даже проще, чем Click: не нужно вручную писать парсер аргументов.
Iceream и wat("What?!") 👉позволяют заглядывать внутрь объектов, выражений и результатов функций без лишнего шаблонного кода. Полезны для логирования и отладки, а заодно помогают изучать разные нюансы Python.
СleanLab 👉библиотека для автоматического поиска и исправления ошибок в данных — must have, когда впервые берёшься за датасет и хочешь понять, что там с разметкой. Максимально гибкая: подойдёт для любой задачи и любой предметной области. Построена на confident learning, а у авторов есть множество статей на топовых конференциях. Есть даже функция для детекции галлюцинаций LLM. Рекомендасьён👍
Pipe 👉небольшая, но очень приятная библиотека для Python, которая позволяет писать конвейеры почти как в bash. Такой синтаксис в Python — дело вкуса, но иногда он помогает сделать код лаконичным и наглядным.
+2
Команда HR из Купер.тех узнала у наших инженеров, какие странные вопросы им задавали на собеседованиях в разных компаниях.
Интервью — это диалог, но иногда кажется, что участники говорят на разных языках.
То, что для HR — способ проверить мотивацию, для инженера может звучать как неловкий small talk.
Для технического интервьюера — это рутинный скрининг, а для кандидата — уже надоевший набор вопросов или желание уточнить: «А зачем вы это спрашиваете?».
👉А какие странные вопросы задавали вам?
Пишите свои варианты в комментариях!
⚠️ Внимание: содержит сцены, вызывающие флешбеки у дата-сайентистов!
Мы собрали ML-бинго от команды Купер.тех с моментами, о которых каждый может сказать: "ну было, да...".
Ошибки — это не баг, а фича. Без них никуда: они учат, прокачивают и делают нас сильнее (даже если сначала хочется все бросить и пойти трогать траву).
Делитесь своими ситуациями в комментариях и проверяйте, кто вы сегодня🏃👉
+5
Мы прошли путь от идеи до продакшена без тяжёлых ML-моделей — и получили рабочий блок, который выиграл A/B-тест. Теперь его видят новые пользователи и частично те, кто уже пользуется приложением.
Владислав Куриченко, ML-инженер из команды рекомендаций Купер.тех, рассказывает в карточках, как устроен блок и что мы узнали в процессе.
Оставляем вам ссылки на ресурсы, которые стоит посмотреть для лучшего понимания:
👉🏻Correlation does not imply causation
👉🏻Сайт, на котором представлены различные неочевидные корреляции
💬 А как бы вы подошли к задаче без тяжёлых моделей? Делитесь идеями и подходами в комментариях!
+4
🕺 30 минут вместо суток: как мы ускорили разбор отзывов и повысили CSI
Мы автоматизировали работу с отзывами: теперь система сама тегирует комментарии, считает CSI и запускает проверки при проблемах.
Даниил Богданов рассказывает в карточках, как устроен проект и что удалось улучшить.
Repost from Купер.тех
+8
🥳 Data Science Meetup: репортаж и видео докладов
Запустили космолёт и вернули обратно — с матчингом, рекомендациями и без потерь. Хотите повторить? Записи — уже тут в плейлисте VK Видео и Youtube. А фотокарточки — здесь.
👉 Как мы делали матчинг в Купере
Николай Чугунников, Machine Learning Engineer, Купер.тех
👉 Uplift Space Oddity, или как запустить ML-космолёт и не упасть
Екатерина Апраксина, Machine Learning Engineer, Купер.тех
👉 Как делать рекомендации не с нуля
Александр Лоскутов, Machine Learning Team Lead, Купер.тех
Спасибо, что присоединились — очно и онлайн, было классно вместе 😏
+7
👀🛍 Как мы учим модель отличать пустую полку от полной?
Когда товара нет, но приложение говорит, что он есть — страдает всё: и конверсия, и пользователь, и команда саппорта.
Мы так не любим.
Поэтому строим модель Out of Stock! О том, что под капотом, расскажут Product lead Гриша Фрольцов и ML-инженер Вика Каплун.
Листайте карточки 👉
+5
🏃 Ваш заказ мемов доставлен
ML Kuper Memes. Part 5
Делимся новыми ML-приколами для тех, кто знает, что такое настоящая регуляризация смеха. Поделись улыбкою своей, и дача с шашлыками ещё к тебе вернется.
#мемный_четверг
Repost from Купер.тех
👆Лучше один раз сходить на митап, чем 100 раз прочитать доку!
24 апреля в 19:00 зовём на Data Science Meetup, соберёмся в Москве и онлайн!
В программе доклады и QA-сессия:
🟢Как мы делали матчинг в Купере». Николай Чугунников, Machine Learning Engineer, Купер.тех
🟢«Uplift Space Oddity, или как запустить ML-космолёт и не упасть». Екатерина Апраксина, Machine Learning Engineer, Купер.тех
🟢«Как делать рекомендации не с нуля». Александр Лоскутов, Machine Learning Team Lead, Купер.тех
Регистрируйся, чтобы попасть в офлайн или не пропустить ссылку на трансляцию!
