Yandex for Analytics
Open in Telegram
Канал для аналитиков от Яндекса. Рассказываем о событиях, обсуждаем кейсы, знакомимся с командами и внимательно смотрим на данные. Чат: t.me/YandexDataDriven Вопросы: @Ekaterina_Lyagina Все каналы Яндекса по стекам: https://t.me/addlist/Hrq31w2p1vUyOGZi
Show more9 445
Subscribers
+1224 hours
+527 days
+23530 days
Posts Archive
9 445
🚀 Погружаемся в технологии на deep tech night
Уже 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о технологических вызовах, с которыми IT-индустрия сталкивается в эпоху AI: от изменений в разработке до новых требований к архитектуре и инфраструктуре.
Это событие для ML-разработчиков, бэкендеров, фронтендеров, тимлидов, аналитиков, продактов и всех, кто работает в IT-индустрии, внедряет AI в процессы, проектирует сложные системы и ищет новые решения.
🔥 Вас ждут темы от инфраструктуры и железа для нейросетей до AI-агентов и внедрения AI в разработку и два формата:
🔵 Hard — доклады о сложных и масштабных задачах для тех, кто хочет вдумчиво разобраться в технической стороне сферы.
🔵 Experiment — лайтнинги и интерактивные кейсы об экспериментах с AI-агентами, новых подходах и продуктовых находках. Для всех, кому интересно пробовать новое и следить за трендами.
Среди спикеров — Мо Гавдат, десять лет руководивший бизнес-развитием в Google X, Алексей Гусаков, CTO Поисковых сервисов и ИИ, Сергей Мельник, руководитель сервиса Автономного транспорта и роботов, и другие эксперты из Яндекса и других IT-компаний.
🧑💻 Чтобы подключиться к онлайн-трансляции, нужна предварительная регистрация. Она также даст возможность задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события.
⏭️ Смотрите полную программу и регистрируйтесь на deep tech night.
До встречи!
Подписывайтесь:
💬 @Yandex4Analytics
9 445
+5
⏬ Data Driven 2026: сначала AI-first-аналитика, потом — IT stand-up Акустики
В карточках знакомим с несколькими спикерами и темами конференции (полную программу смотрите на сайте). А здесь рассказываем про вишенку на юбилейном торте — IT stand-up Data Driven × Акустика.
На афтерпати C-level-руководители и лиды бигтехов превратятся в стендап-комиков с реальными историями про аналитику: почему все снова просят «ту самую табличку» или как так вышло, что дашборд, который так просили, никому не нужен?
👨💻 С иронией о том, что проживает каждый аналитик, выступят:
🔵 Роман Халкечев, CDO Поисковых сервисов и ИИ Яндекса
🔵 Евгений Прохоров, руководитель дата-платформы Max
🔵 Виктор Кантор, преподаватель МФТИ, владелец школы MLinside
🔵 Андрей Петрин, CDO (ex Делимобиль и Яндекс Плюс)
🔵 Владимир Абазов, директор по аналитике и росту нефинансовых сервисов Т-Банка
А до IT stand-up будем расслабленно нетворкать, есть вкусные закуски и пить вкусные напитки.
📆 Встретимся 26 сентября в Москве и онлайн.
⏭️ Регистрируйтесь, чтобы ничего не пропустить — как в докладах, так и в праздничной программе.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
+8
🧑💻 Left join через inner join. Часть 3 из 3: реализация для ttest и bootstrap
Наша коллега Диля Хакимова рассказала, как восстановить left join из inner join, если известно число всех пользователей в эксперименте. Это позволило почти в 2 раза сократить вычисления при анализе A/B-тестов.
В прошлом посте мы начали считать t-статистику для ratio-метрик. Сегодня доведём вычисления до конца — и покажем, как повторить для ttest и bootstrap.
♾ P. S. Для самых любопытных в первом комментарии показываем, как выводили формулы для пересчёта средних, дисперсий, ковариаций и дельт.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🔮 Как AI меняет аналитику
Искусственный интеллект и агенты — тема, обсуждать которую можно бесконечно. Пока одни спорят, как AI изменит аналитику в принципе, для кого-то это уже стало профессией. В этом выпуске в гостях у ведущих — Саша Исаков, руководитель группы разработки аналитических ИИ-решений в Яндекс Лавке. Разбираемся:
🔵 откуда берётся сопротивление AI-инструментам внутри команд и что с этим делать
🔵 реально ли построить AI-«суперкосмолёт», который решит все задачи разом — и что происходит, когда чуда не случается
🔵 почему с приходом агентов каждому аналитику приходится немного побыть руководителем
💻 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
+8
🧠 Реклама выстрелила. Но как именно она повлияла на цифры?
Всем привет, это Георгий Морозов, аналитик-разработчик в Финтехе Яндекса. Представим ситуацию: мы запустили акцию и после обороты пошли вверх. Но после не значит вследствие. Часть роста произошла бы и без акции и по разным причинам: сезон, праздники, общий тренд или разовый всплеск от вирусного поста с товаром. Как нам оценить эффект акции отдельно от этих факторов?
Наш сервис — партнёрский: мы запускаем промо на всём продукте партнёра и не управляем его витриной или трафиком. Поэтому ни A/B, ни геотест нам не подходят. Отключить рекламу для половины пользователей или отдельного региона не получится. Эффект акции приходится доставать из истории наблюдений.
👳 Чтобы отделить реальный вклад рекламной кампании от того, что случилось бы само собой, мы собрали внутренний инструмент — MILIF. А о том, как он устроен, рассказываем в карточках.
👍 Теперь благодаря этому инструменту мы понимаем честные эффекты наших кампаний, а значит, можем анализировать их эффективность. Это уже позволило нам забюджетировать 2026H2, и в будущем мы планируем оптимизировать наши рекламные кампании с опорой на честный замер.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
+5
⏬ AI для бизнеса и аналитики: в чём польза?
Наши аналитики всё чаще внедряют AI в свои рабочие процессы. Что-то ещё на стадии MVP и требует доработки, но в целом эффект уже заметен.
👳 Чем AI может помочь вам прямо сейчас — рассказывает Екатерина Анашкина, руководитель продуктовой аналитики Яндекс Недвижимости и Аренды.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
+8
🧑💻 Left join через inner join. Часть 2 из 3: основные метрики и как их считать
Продолжаем рассказывать о новом методе анализа A/B-тестов, который предложила наша коллега из Райдтеха Диля Хакимова.
В первом посте мы обсудили основную идею: результат для left join можно восстановить из inner join, если известно число всех пользователей в эксперименте. А сегодня зафиксируем базовую теорию, без которой не обойтись: метрики и статистики.
👳 Вспомним, из каких математических компонентов они состоят, чтобы понимать, что именно нам предстоит пересчитывать.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🧑💻 Data Driven 2026: как AI меняет аналитику прямо сейчас
Data Driven — флагманская конференция для аналитиков от бизнес-группы Поисковых сервисов и ИИ Яндекса. В этом году мы сделали акцент на AI-first-аналитике и будущем аналитиков в эпоху искусственного интеллекта.
В двух треках докладов обсудим:
🔵 Какие AI-инструменты реально экономят время аналитика
🔵 Как генеративный AI влияет на работу с данными
🔵 Как изменится роль аналитика в ближайшие годы
А ещё Data Driven в этом году исполняется десять лет. Мы выросли из небольшого митапа в масштабную конференцию. Аналитика и её роль в бизнесе менялась и росла буквально на наших глазах.
🎁 В честь дня рождения мы приготовили классную праздничную программу, о ней и докладах расскажем позже. А пока регистрируйтесь по ссылке и помните, что количество офлайн-мест ограничено.
⏭️ Подписывайтесь на канал конференции, чтобы следить за всеми новостями (их будет много).
📆 Встретимся 26 сентября в Москве и онлайн!
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🎙 Как превратить конфликт в пользу для продукта?
Конфликты на работе не всегда означают, что что-то пошло не так. Иногда именно благодаря разным взглядам на задачу получается лучше понять цели друг друга, найти сильное решение и договориться о новых правилах работы.
В этом выпуске вместе с Игорем Рубановым, руководителем аналитики в Яндекс Go, разбираемся, как договариваться с заказчиками и партнёрами, почему иногда правильный аргумент не работает, а когда стоит искать союзника или эскалировать проблему.
💎 А ещё обсуждаем, может ли сильный аналитик быть полностью бесконфликтным и как понять, что вы уже не защищаете качество решения, а просто хотите победить в споре.
⏭️ Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🔥 Делимся первыми спикерами на deep tech night
В карточках рассказываем, кто и на какие темы будет выступать на конференции 5 сентября. А чтобы получить доступ к эфиру, задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события, зарегистрируйтесь на сайте.
⏭️ Подробности о докладах и форма регистрации
Подписывайтесь:
💬 @Yandex4Analytics
9 445
⏬ Как мы ищем иголку в стоге из 5,5 млрд товаров (и зачем это вообще нужно)
Привет! Меня зовут Никита Симаков, я руководитель команды аналитики товарной базы в Яндексе. Наша задача — следить за тем, чтобы пользователь всегда видел актуальную информацию о товарах, а технологии под капотом поиска были удобными и качественными.
В этом посте на примере двух кейсов я расскажу, с какими вызовами мы сталкиваемся и как их решаем. Погнали!🈂️ Кейс № 1. Как не утонуть в 5,5 млрд оферов Представьте: один и тот же iPhone 17 продаётся на 50 разных сайтах. Чтобы пользователь мог сравнить цены на рынке, на нашей стороне нужно понять, что все эти оферы — один и тот же товар. Звучит просто, но когда в товарной базе хранятся 5,5 млрд предложений, попарно сравнивать их уже труднее. Для этого в нашем сервисе применяется технология под названием «Склейка», а моя команда занимается её оценкой. Мы придумываем, как размечать много, масштабируемо и желательно дёшево, а также пробуем разные варианты: разметку человеком, LLM, VLM и каскады нескольких моделей. Среди всех методов ищем самый эффективный и берём его. 🈂️ Кейс № 2. Почему вчерашняя цена сегодня уже не актуальна Кроме оферов, в нашей базе лежит 300 тыс. магазинов, и каждый может в любой момент изменить цену товара или статус о его наличии. Наша задача — оценивать, как парсятся сайты продавцов, чтобы система работала исправно, а пользователи видели максимально свежие данные. Изначально парсинг — это набор регулярок и правил, которые написаны людьми. Мы автоматизировали этот процесс: создали качественную разметку цен, наличия, названий и картинок на сайте. А потом научили AI писать парсеры самостоятельно. Такая система эффективно работает и легко масштабируется. 📆 О других наших кейсах, работе в команде и в целом о Яндексе я расскажу подробнее на Welcome Time 22 августа. Это неформальная офлайн-встреча для продуктовых и дата-аналитиков, где вы сможете: 🔵 Пообщаться со специалистами из Яндекс Поиска и Независимого Ecom 🔵 Обсудить технологии и задать вопросы о проектах 🔵 Если есть желание, пройти диагностику ваших навыков ⏭️ Ждём вас на Welcome Time! Подписывайтесь: 💬 @Yandex4Analytics
9 445
+5
🧑💻 Left join через inner join. Часть 1 из 3. Как мы анализируем влияние внедрений
Во время A/B-тестов мы обычно смотрим на метрики в двух срезах: по всем участникам эксперимента (left join) и только по активным пользователям (inner join). Проблема в том, что аудитория эксперимента может составлять миллионы человек, а целевые действия совершает лишь малая часть. Считать тяжёлые статистики по всем участникам в Spark — долго и дорого из-за огромного количества нулей.
⏭️ Наша коллега из Райдтеха Диля Хакимова нашла изящное математическое решение, как вообще не считать left join на кластере, а получать его за доли секунды из данных inner join.
👳 В карточках коротко описали суть проблемы и решения, а о реализации для
ttest и bootstrap расскажем в следующих постах.
Подписывайтесь:
💬 @Yandex4Analytics9 445
🎙 Как аналитики драйвят бизнес?
Один аналитик исследует поведение пользователей, дизайнит A/B-тесты и в партнёрстве с командой помогает принимать сложные решения. Другой — растит эффективность продукта: настраивает алгоритмы выдачи и мэтчинг курьеров, работает напрямую с продакшен-кодом. Обе роли напрямую драйвят P&L компании, но влияют на него по-разному.
⏭️ В этом выпуске наши ведущие вместе с Костей Бабаляном, руководителем отдела аналитики роста, ценообразования и технологий роста в Яндекс Еде, обсудили два разных подхода: аналитику эффективности и партнёрскую аналитику.
🔵 Есть ли принципиальная разница между ними и может ли аналитик быть визионером и лидером, оставаясь экспертом-одиночкой без команды?
🎁 А всем, кто досмотрит выпуск до конца, — бонус: тост с пожеланием для аналитиков от нашего гостя!
🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
👨💻 Пять советов соискателю, которые помогут на интервью
На собеседовании может быть интересно и спокойно, и тогда с большой вероятностью ваш результат будет лучше, а простой созвон станет классным опытом.
На связи Сослан Табуев, старший аналитик-разработчик в отделе аналитики Поиска и супераппа Поисковых сервисов и ИИ. Уже больше трёх лет я провожу лайфкодинг-собеседования на вакансии аналитиков, а до этого сам несколько раз менял работу. Поэтому знаю, как проходит процесс найма аналитиков с обеих сторон — соискателя и собеседующего.
👳 Свой опыт я собрал в карточках: в них я делюсь простыми советами, как кандидат может подготовиться к собеседованию и на что собеседующий обращает внимание во время интервью.
А вот два бесплатных курса на Stepik, которые помогут в решении задач:
🔵 Структуры данных
🔵 Методы
⏭️ Больше про аналитику, статистику, данные, AI и здравый смысл рассказываю в своём канале.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
⏬ Как от целей прийти к задачам
Карта гипотез — это технология, которая помогает собрать действенную стратегию для компании или продукта и выстроить логическую цепочку достижения целей. Проще говоря, это точка сборки всех идей в стратегию, которая оформляется в виде ментальной карты.
🈂️ Давайте разберёмся, из каких сущностей состоит карта гипотез и как с ней работать
🔵 Цель. Это то, чего мы хотим достичь. У цели должен быть нарратив («автоматизировать 80% регулярных отчётов к концу 2026 года») и балансирующие метрики (например, «не увеличивать время подготовки отчёта» или «не снижать точность прогнозной модели ниже 95%»), которые защищают от побочных эффектов и не дают схитрить и добиться цели за счёт ухудшения других параметров
🔵 Субъект. Это те, на чьё поведение нам нужно повлиять, чтобы достичь нашей цели. Субъектом может быть кто угодно: конкретный сегмент пользователей, руководитель вашего отдела или продакт, который принимает решение на основе аналитики. Чтобы изменить поведение субъекта, нужно воздействовать на его мотивацию: что он хочет получить и что ему мешает это получить
🔵 Гипотеза. Самое сердце карты — ключевые идеи, которые могут изменить поведение субъекта и приблизить нас к результату. Гипотеза состоит из трёх блоков: ЕСЛИ (наше воздействие), ТО (как именно субъект изменит своё поведение) и ПОТОМУ ЧТО (почему он должен изменить поведение). Гипотезу нужно сформулировать ясно, но не уходить в преждевременную конкретизацию. Воздействие должно влиять на желания субъекта так, чтобы он менял метрики в нашей цели
🔵 Задача. Это конкретные действия, которые необходимо выполнить, чтобы проверить или реализовать гипотезу. В отличие от цели, которая требует разработки стратегии и преодоления неопределённости, задача — это линейный план действий, где всё уже известно и осталось только реализовать его на практике
🈂️ Как это всё работает вместе
Суть карты гипотез в том, что все эти сущности связаны в строгую логическую цепочку:
ЦЕЛЬ достигается через изменение поведения СУБЪЕКТОВ, на которое мы влияем с помощью ГИПОТЕЗ, для проверки которых мы выполняем ЗАДАЧИ.
💎 Полезный приём: любую задачу, которая приходит в бэклог, стоит проверить — можно ли от неё выстроить цепочку до цели через субъект и гипотезу. Если нет, скорее всего, эта задача не приближает вас к результату и её стоит переформулировать или отложить.
Подписывайтесь:
💬 @Yandex4Analytics9 445
🦠 Как COVID-19 помог в продвижении DataLens
В разгар пандемии Яндекс выпустил коронаборд — публичный дашборд со статистикой по коронавирусу, который использовали и обычные пользователи, и бизнес, и госструктуры: например, одна ретейл-компания прогнозировала по нему больничные сотрудников.
Так внешние обстоятельства дали DataLens новую аудиторию и трафик. Сейчас похожий эффект даёт AI, но в масштабах целой индустрии, только он меняет BI-аналитику. Или дополняет?
⏭️ Об этом в новом выпуске подкаста «Доверительный интервал» рассказал Паша Дубинин, руководитель продуктового развития Yandex DataLens.
🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🚀 Погружаемся в технологии на deep tech night
5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о технологических вызовах, с которыми IT-индустрия сталкивается в эпоху AI: от изменений в разработке до новых требований к архитектуре и инфраструктуре.
Это событие для бэкендеров, фронтендеров, тимлидов, аналитиков, продактов и всех, кто работает в IT-индустрии, внедряет AI в процессы, проектирует сложные системы и ищет новые решения.
⏬ В программе доклады экспертов из Яндекса и международных IT-компаний:
🔵 Мо Гавдат, ex-Chief Business Officer, Google X
🔵 Алексей Гусаков, CTO Поисковых сервисов и ИИ
🔵 Сергей Мельник, руководитель сервиса Автономного транспорта и роботов
И другие спикеры (некоторые из них пока что секретные — расскажем о них в ближайшее время 🤫).
⏭️ Зарегистрироваться
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🥤 BI в эпоху AI
Классический BI-инструмент — это не просто набор графиков, а огромный пласт инфраструктуры, метаданных и регламентов. Всё это уже сейчас можно автоматизировать при помощи AI или дашборды ещё долго будут частью ручного труда?
⏭️ В этом выпуске подкаста «Доверительный интервал» наши ведущие вместе с руководителем продуктового развития Yandex DataLens Пашей Дубининым обсудили:
🔵 Как AI меняет визуализацию данных
🔵 Зачем в командах нужен «BI-губернатор»
🔵 Преимущества разработки собственных BI-систем, на примере DataLens
🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🤖 Как аналитику не писать документацию (самостоятельно)
Всем привет, это Роман Гриднев, технический менеджер в подразделении аналитики Поисковых сервисов и ИИ Яндекса.
В Яндексе объёмы данных исчисляются эксабайтами, а уникальных таблиц у нас порядка 30 миллионов. Времени на документацию такого масштаба у аналитиков просто нет.
Реальный случай: нам нужно было описать около 40 000 самых востребованных таблиц, а руками за год мы охватили только 500. Ситуация неутешительная: аналитики по-прежнему не находили нужные данные и при этом производили всё больше новых. Как быть?
На ум сразу пришла очевидная мысль: что, если использовать LLM? Но любой нейросети нужен контекст, а где взять его в пустой таблице, да ещё и с нетипичным внутренним жаргоном и традициями нейминга?
Тогда мы пришли к идее комплексного робота-автописателя, который собирает контекст, отправляет его LLM и генерирует черновики документации. Так задача «напиши с чистого листа» для аналитика превращается в «проверь и поправь» — психологически это проще и быстрее.
🈂️ Как работает робот
Сначала он собирает объективные данные: определяет путь к таблице, изучает её схему и берёт образцы данных, если к ним есть доступ. Затем робот обращается к глоссариям — словарям стандартных полей, которые всегда называются и описываются одинаково.
Следующий шаг — парсинг Вики, внутренней базы данных Яндекса. Робот ищет в корпоративных знаниях описания полей и контекст данных, чтобы использовать их в дальнейшей работе. Далее система анализирует граф связей через Memgraph: она выясняет, откуда берётся таблица и куда она идёт дальше в цепочке обработки данных.
Робот также учитывает «соседей по папке»: таблицы, расположенные в одной директории хранилища, часто имеют схожий контекст и назначение. Система анализирует совпадения названий и типов полей, но исключает служебные поля, например ID или дату.
После того как робот собрал и структурировал всю информацию, он передаёт её модели. LLM дописывает недостающие поля с учётом накопленного контекста — так получается полноценный черновик описания.
На следующем этапе система добавляет технические детали: анализирует SQL-код, с помощью которого формируется таблица, и на его основе поясняет логику каждой колонки. В результате в документации появляются блоки с активными ссылками на таблицы-источники.
Наконец, робот делает финальный запрос к LLM. Он передаёт модели собранное описание полей и техническую логику их формирования и просит сформулировать краткую характеристику таблицы — до 2000 знаков. Это очень полезно для внутреннего поиска по дата-каталогу.
🈂️ К каким метрикам мы пришли
🔵 Смысл описания, которое подготовил робот, с тем, которое ранее подготовил человек, совпал на 92%
🔵 Полей, в которые аналитики не вносили правок, — 71%
🔵 Наши аналитики довольны описанием таблицы на 93%, а описанием схемы данных — на 85%
🈂️ Что получилось в итоге
За 6 месяцев робот помог описать 15 000 таблиц вместо 500 за год ручной работы. На каждой сущности экономим в среднем 2 часа — итого около 5 лет рабочего времени аналитиков.
🈂️ К чему мы стремимся
🔵 Интегрировать систему с потоками регулярных данных, чтобы получать знания о графе формирования каждой колонки напрямую, а не из логов
🔵 Реализовать поколоночную проброску описания: отслеживать, как колонка перетекает из одной таблицы в другую
🔵 Сделать инструмент доступным по кнопке прямо в дата-каталоге — чтобы любой пользователь мог получить описание таблицы в один клик
Мы создаём технологии, которые меняют внутренние процессы: автоматизируют рутину, высвобождают время для творчества и сложных задач. Хотите так же? Попробуйте начать с малого: соберите контекст, дайте его LLM — и получите заготовку для документации. Уже первый черновик ускорит работу и запустит цепную реакцию: проверенные описания станут новым контекстом, качество вырастет, а люди будут участвовать в процессе.
⏭️ Кстати, в этом году я выступлю на Data Driven — конференции для аналитиков от Поисковых сервисов и ИИ Яндекса. Встретимся 26 сентября в Москве или онлайн.
Подписывайтесь:
💬 @Yandex4Analytics
9 445
🎙 Почему капча больше не про светофоры
В новом выпуске подкаста Podlodka Руслан Сабиргалиев, руководитель группы коммерческих проектов Антиробота, рассказал, как эволюционировала капча, зачем боты атакуют сервисы (и сколько это может стоить бизнесу), а также объяснил, что такое невидимые проверки и что делать, когда обычного пользователя система внезапно считает подозрительным.
💎 Ещё поговорили про хороших ботов, AI-агентов, DDoS, защиту логина, форм, SMS и API.
⏭️ Слушайте все подробности в подкасте на ютубе
Подписывайтесь:
💬 @Yandex4Analytics
