Big Ledovsky | AI изнутри
Open in Telegram
Александр Ледовский Head of AI @ Listee, ex: Avito, Сбер, ШАД @aledovsky
Show more2 044
Subscribers
-124 hours
+67 days
+17630 days
Posts Archive
Обучение на тестовых данных - новый вид искусства
Андрей Карпати в итогах года аргументированно объяснил ровно то, о чем я интуитивно писал в прошлом посте.
Публичным бенчмаркам LLM-ок нельзя доверять, когда вы выбираете модель для своей задачи. Нужно делать свои тесты.
Все исследователи LLM специально тюнят свои сети под бенчмарки - типа решать ЕГЭ. Чтобы занимать первые строчки в рейтингах.
Рефлексия по LLM
Сейчас много работаю с LLM. Они обрабатывают сырые текстовые данные и заменяют ручную разметку во многих местах.
Осознал, что LLM - это easy to start, hard to master. Решить задачу как-то на небольшом объеме данных может каждый. А дальше возникают тонкости.
Абсолютно невозможно разобраться в современном многообразии моделей. Качество оценить сложно. Быстро упираешься в производительность.
Пока стратегия, которую я выбрал - попытаться разобраться в семействе моделей одного производителя, OpenAI. Не из-за качества работы, а просто потому, что мне нравится их документация.
Ее так много, словно это не LLM, а самолет. Кто не видел, посмотрите сколько новых инструкций выходит каждый месяц.
Если считаете, что OpenAI фигня и нужно пользоваться чем-то другим - напишите!
#tech@big_ledovsky
Repost from Доска AI-объявлений
Всем привет! Я Саша, DS-менеджер в Авито. Знакомые из других компаний часто задают мне такой вопрос: что значит «DS-менеджер»? Раскрываю карты.
Какие у него обязанности
DS-менеджер — это руководитель нескольких команд. Что он делает, можно посмотреть в матрице компетенций.
Ключевые вещи: формирование стратегии, архитектурного видения, выстраивание процессов и бОльший по сравнению с тимлидом горизонт планирования. Ну и конечно работа с руководителями — тимлидами.
На что я трачу своё время
Объяснить структуру рабочего дня по матрице компетенций сложно. Для себя я делю время по характеру деятельности. В таком виде, мне кажется, вам будет понятнее. Цифры ниже основаны на моих личных заметках за последние недели.
👉 Операционная работа: 2 часа в день. В основном статусы, дейли, 1-1, собеседования. Всё, чтобы поддерживать эффективную работу команды. Бывают периоды, когда много собеседований, но это случается эпизодически.
👉 Экспертная работа: 2.5 часа в день. Пишу документы, стратегии, веду консультации, провожу ревью кода, прорабатываю архитектуру решений.
👉 Техническая работа: 1 час в день. Всегда стараюсь чуть-чуть работать руками. Чаще всего это тестирование чужой работы или вспомогательные задачи.
👉 Занятость: 2.5 часа в день. Переписки, решение проблем, организационные вопросы, ответы на запросы.
Бонус: как не потонуть в менеджерской рутине
Операционную работу фиксируем в необходимом разумном количестве. Занятость снижаем, насколько можно. Экспертную работу увеличиваем. Техническую не забрасываем.
Повторюсь, что вышеописанное — личный опыт. На холивар и просто с вопросами приглашаю в комментарии! 👇
+2
Потестировал Shopping Research в ChatGPT
На мой взгляд получилось ужасно. Причем именно с точки зрения продуктового флоу
🔸 Сперва даешь задачу на поиск какой-то вещи. Я попросил подобрать мне телефон на Андроиде
🔸 Проходишь небольшой опрос. Ответов на большинство вопросов я не знал. Например, что для меня важнее - основная камера или камера для селфи
🔸 Затем начинается tiktok. Смотришь ленту телефонов и нажимаешь нравится/не нравится
🔸 Затем ChatGPT выдает портянку с описанием нескольких моделей, которые по его мнению подходят тебе больше всего
Ключевая проблема - текущая реализация не помогает разобраться, что тебе нужно
Я использую ChatGPT для выбора вещей в трех сценариях: попросить сравнить набор моделей, попросить гайд на что смотреть при выборе вещи и попросить аналоги определенной модели.
Новый функционал пока не выглядит улучшением. Зато дает ссылки на магазины))
+3
Вчера от Авито проводили мероприятие-вечеринку для DS тимлидов и менеджеров. Было много друзей и знакомых, много с кем познакомился впервые.
Сразу хочу извиниться, что кого-то не позвали. Собирать гостей на ивенты без открытой регистрации дело не самое простое.
Душевный получился вечер. Одной из наших целей было создавать сильное комьюнити вокруг нас, и я считаю это удалось.
#lifestyle@big_ledovsky
+3
Как инженеру качать навыки общения
Откровенно, многим инженерам чтобы расти, нужно качать софты 😀. Особенно, коммуникацию. И я на смом деле могу порекомендовать только один путь - поработать в колл-центре в холодных продажах позаниматься в актерской студии. Я ходил на голос и речь в мае, а потом продолжил с сентября и это очень круто.
Речь, пластика, то, как мы себя ведем, меняется очень медленно и регулярными усилиями. Совсем как тело меняется в спортзале. Однодневные тренинги по публичным выступлениям - это полнейшая шляпа.
А знаете эти обсуждения на 1-1? "Давай качать коммуникацию, сейчас составим роадмап, в этом квартале тебе нужно прочитать две книги и выступать на митапе" 😂
По итогу, мне занятия очень понравились. Я поразился насколько велика пропасть между профессиональным актером и обычным человеком с точки зрения владения собой. И ощутил эффект от того, что у меня что-то начало лучше получаться. Например, я научишся держать зрительный контакт с аудиторией.
Имплементировать в жизнь получается сильно не все. Я не понимаю как так происходит, что когда я забываюсь, начинаю быстро говорить, глотать слова и заполнять речь словами-паразитами. Но, все чаще я учусь это замечать и исправлять.
На фото - на мини-спектакле по Евгению Онегину. Столько стихов не учил во всей жизни 😁
#career@big_ledovsky
+2
Нестандартные инсайты с Data-Driven
На Data-Driven было много интересных докладов. Я не буду их пересказывать. Можете посмотреть сами на x1.5, это недолго. Вместо этого делюсь личными инсайтами, которые отходят от основного повествования
📌 Яндекс Поиск в Межнаре (Роман Васильев) VK
Одна из основных метрик международного поиска - Side by Side like NPS Яндекс vs Google. Удивительно, что я совсем недавно писал об этой метрике в предыдущем посте про поиск и LLM. И сейчас еще больше задумался, чтобы ее внедрить в некоторые задачи
📌 Метрики качестве и эффективности в Яндекс Картах (Тимофей Струнков) VK
Одна из ключевых метрик Карт, полнота организаций на карте, считается ML-based. Раньше я крайне негативно относился к ML-based метрикам и предпочитал твердые метрики, которые не поедут от переобучения модели. Но увидев какое-то количество кейсов, я поменял мнение. ML-based метрики при аккуратном обращении вполне жизнеспособны
Если что, моделью там предсказывается популярность, на которую взвешивается метрика. Наличие организаций проверяется специальными пешеходами-исследователями 🙂
📌 End-to-end качество Алисы (Мария Акопян) VK
Разметка качества Алисы LLM+асессор почти также хороша как полностью асессорская. Интересная часть - консенсус легких LLM на первом этапе. Если модели дают одинаковый ответ, он принимается. Если нет, задача идет на более дорогую оценку
Такое ансамблирование LLM - это сильный метод. Сильнее, чем может показаться на первый взгляд
Заключение
Плейлисты со всеми докладами тут:
- Трек "Data to Artifacts": YT | VK
- Трек "Data to Insights": YT | VK
Пост предложили написать ребята из PR Яндекса. С удовольствием согласился. Как вам формат?
Карьерные изменения и вакансии
Всем привет! У меня две новости 🙂
Во-первых, я постепенно перехожу на новую позицию внутри Авито. Я не могу рассказать подробности, но это новое направление бизнеса, и я буду отвечать там за DS. Я очень воодушевлен и верю, что новое направление будет очень успешным!
Во-вторых, у меня открываются вакансии. В новом направлении нужно будет собрать поиск и рекомендации практически с нуля. Конечно, мы по-максимуму используем все наработки, которые уже есть внутри компании. Но специфика нового направления очень велика. И это будет отдельно работающая система.
Кого ищу
Сейчас я ищу трех ребят уровня DS4 и DS5 по уровням Авито: мидл+ и синьоры. Ожидаю, что у вас есть опыт продового ML. Замечательно если в поиске, рекомендациях или рекламе. Но может быть это что-то другое, например чат-боты, автоматизация поддержки или модерация. Будет сложно, но очень интересно! Искренне думаю, что это одна из наиболее интересных позиций сейчас на рынке.
💎 Пишите в личку @aledovsky
Repost from Доска AI-объявлений
Собеседование в прямом эфире: ML system design
13 октября | 18:30 мск
Что будет на стриме:
1️⃣ Разберём ML system design кейс, который ещё в недавнем прошлом предлагали на реальных собеседованиях.
2️⃣ Поговорим про компетенции, которые в Авито ждут от DS-инженеров.
3️⃣ Разберём результаты по итогам решения кейса и ответим на ваши вопросы.
Кто будет на стриме:
👤 Интервьюеры — Саша Ледовский, руководитель DS команд монетизации Авито и Максим Каширин, руководитель Data Science направления в модерации Авито.
👤 Кандидат —Дмитрий Савелко, LLM-инженер в R&D команде банка Точка.
Больше информации про событие и регистрация на Timepad.
Пришлём вам ссылку с напоминанием за 5 минут до старта 🚀
+1
Поиск и LLM. Как сломался data-driven подход
Из разговоров на кухне ☕. Я уже давно перестал пользоваться традиционным поиском, таким как Яндекс и Google, и перешел на ChatGPT. Это глобальный тренд. ChatGPT и его аналоги существенно лучше работают. Кто-то использует Perplexity, например
Что мне меньше нравится в обычном поиске - это качество источников. Вводишь условно «как лучше спать», тебе выходят статьи из комсомольской правды. А ChatGPT даст саммари и подкрепит ссылками на рецензируемые статьи с PubMed. Это конечно круто.
Необычность ситуации в том, что поиск - зрелая индустрия. В технологических гигантах сотни людей годами качают метрики качества поиска. Например, релевантность или конверсию в клик в ранжировании. И тут такой заметный скачок в пользовательском восприятии.
Почему так произошло? У меня одно объяснение. Традиционные метрики поиска на самом деле паршивые. Они недостаточно хорошо отражают пользовательское качество. Надеюсь не сильно расстроил читателей, который обучают ML модели в поиске на эти метрики (я сам из них 🤷♂). Может быть поисковикам стоит начать показывать две выдачи слева и справа как ChatGPT?
#tech@big_ledovsky
Как нас с другом приняли за ***
Предыстория. Приехали мы в командировку в СПб, чтобы посидеть вместе с сейлзами и послушать, как они общаются с клиентами.
Я обожаю все, что касается общения с клиентами. На такое у нас кстати берут не только менеджеров, но и обычных дата сайнтистов. Но к теме
Мы с Денисом заходим в отель. Отель шикарный, исторический - нам открывают дверь швейцары, интерьер с вензелями, вид на Исакий. Мы даем паспорта. Мой паспорт что-то долго смотрят и ничего не говорят. Берут паспорт Дениса и говорят - нашли вашу бронь.
Спрашивают - вы вдвоем? А к Денису должна приехать жена. Он говорит - да, вдвоем, до выходных. Нам улыбаются и начинают оформлять 😅
Я понимаю, что что-то не так. Проверяю бронь и понимаю, что у меня другой отель. К счастью он в соседнем доме. Я об этом говорю, возникает неловкая пауза, мы с Денисом заливаемся смехом, а ресепшионист нет 😂 Я забираю паспорт и поспешно ретируюсь.
Совет: внимательнее проверяйте отель в который вы заселяетесь 😀
+3
Сегодня на Practical ML
Уже третий раз на этой конференции. Она опять круто сделана. Качество докладов очень высокое.
Мы и в этот раз с докладом. Ходили с ребятами поддержать Антона с его выступлением про DL CTR.
И, конечно, подходите познакомится и пообщаться! Буду очень рад 🙂
Почему рекомедации популярнее поиска?
С интересом читаю посты ребят, кто сейчас на конфе RecSys (например Кирилла Хрыльченко и Никиту Зелинского). Если вы специализируйтесь на рекомендациях, наверное следите тоже.
Мне не дает покоя вопрос, почему в DS сообществе рекомендации сейчас так популярны, а поиск как будто нет?
Да, в рекомендациях есть прикольные трансформерные модели. Но и в поиске есть DSSM модели. С точки зрения пользы бизнесу - и поиск, и рекомендации приносят сравнимые аплифты метрик.
💎 Почему так? У кого какие мнения?
Моя версия Это как горные лыжи и сноуборд. Поиск просто вышел из моды
Пятничная атмосфера. Вместо мониторингов - фильмы про дикую природу 😃
ps. А вообще мониторинги на телевизорах - это для самоуспокоения. Все проблемы должны обрабатываться на алертах дежурными
Ну вот, нарешали на 3 место. Жаль Мишу Каменьщикова и Рому Снеткова онлайн не подключили.
+1
🍜 Что происходит на рынке DS
Пару мыслей по поводу отчета dev crowd, который вышел в августе.
Мне было приятно приятно увидеть, что Авито продвинулся с пятого на второе место в рейтинге работодателей. Я участвую в рабочей группе DS PR. Этот год мы системно вкладывались в наш DS бренд. Короче, мы большие молодцы 🔥
Что насторожило. Большая часть DS-ов работает в крупных компаниях. Это ожидаемо. Но при этом, лишь у 20% респондентов результат измеряется в бизнес-метриках. Больше половины не видят прямого влияния на бизнес.
Как так? Вроде DS уже зрелая функция, во многих компаниях существует лет 10. И большинство людей не видят влияния на бизнес. Вопрос риторический.
Какие DS конференции будут в сентябре
Сентябрь традиционно очень богатый на конференеции
Ozon E Code. 13-14 сентября. DS часть 14-го. Точно пойду. Помимо традиционной части с докладами, мы еще участвуем в Ozon E Cup, у нас будет питчинг решений.
AI Conf. 26 сентября. Скорее всего не пойду. Не влезает в график, плюс конфа платная. Билетов от компании у меня в этот раз нет, а бюджет на обучение я планирую потратить на другое. Короче, так сильно мне на нее не хочется.
Practical ML. 27 сентября. Хочу пойти. Честно говоря поздно подал заявку, надеюсь что пришлют приглашение. Если нет, может быть по связям напрошусь.
Если будете на E Code, пишите, встретимся!
Вышел мой большой доклад про ранжирование продвижения
Вышло видео моего доклада с IML 2025: «Как мы ранжируем платные объявления в поиске и ленте рекомендаций Авито».
В нём я подвожу итоги 2,5 лет работы моей команды над алгоритмами размещения платных объявлений, над которыми мы работали вместе с коллегами и всеми, кто нам помогал.
Это рассказ не только про наши текущие алгоритмы. Это еще про наш путь и про эволюцию нашей мысли.
YouTube
VK
А слайды выкладывал в одном из прошлых постов
Субботний пост про overemployment
🩸 В начале августа была волна обсуждения в соцсетях про увольнение сотрудника Rutube за то, что состоял в ИТ-«секте» «Осознанная меркантильность», где учат работать на нескольких работах одновременно
Помню, что приехал в Киргизию, настраивался на поход, отдыхал и читал тг. На этот случай я наткнулся в канале Тимлид очевидность, потом оттуда перешел еще в пару каналов итд. Было любопытно, можете повторить мой путь.
Моя реакция на оверэмплоймент (утаиваемый) - жесткий красный флаг. Но тут я посмотрел подкаст Мастридера с основателем сообщества. И знаете. Так я его послушал. Да вроде и не такое зло он несет. Мой флаг остался красный, но чуть-чуть пожелтел.
Я разделяю один его поинт. Средний сотрудник не топ-тир компании работает не очень эффективно. Если работать как следует, можно тот же объем работы делать за 4 часа.
И частично разделяю другой. Рынок труда уравнивает людей и за x2 продуктивность нельзя получить x2 компенсацию.
Моя корректировка: в краткосроке. В долгосроке в правильном месте только так и можно вырасти.
Согласны? 🤔
#career@big_ledovsky
