en
Feedback
Yandex for Analytics

Yandex for Analytics

Open in Telegram

Канал для аналитиков от Яндекса. Рассказываем о событиях, обсуждаем кейсы, знакомимся с командами и внимательно смотрим на данные. Чат: t.me/YandexDataDriven Вопросы: @Ekaterina_Lyagina Все каналы Яндекса по стекам: https://t.me/addlist/Hrq31w2p1vUyOGZi

Show more
9 445
Subscribers
+1224 hours
+527 days
+23530 days

Data loading in progress...

Attracting Subscribers
September '26
September '26
+82
in 0 channels
August '26
+277
in 5 channels
Get PRO
July '26
+277
in 1 channels
Get PRO
June '26
+281
in 2 channels
Get PRO
May '26
+243
in 1 channels
Get PRO
April '26
+453
in 2 channels
Get PRO
March '26
+330
in 6 channels
Get PRO
February '26
+452
in 4 channels
Get PRO
January '26
+354
in 2 channels
Get PRO
December '25
+1 149
in 8 channels
Get PRO
November '25
+1 350
in 14 channels
Get PRO
October '25
+819
in 5 channels
Get PRO
September '25
+245
in 5 channels
Get PRO
August '25
+227
in 2 channels
Get PRO
July '25
+390
in 4 channels
Get PRO
June '25
+205
in 0 channels
Get PRO
May '25
+196
in 1 channels
Get PRO
April '25
+513
in 2 channels
Get PRO
March '25
+139
in 2 channels
Get PRO
February '25
+2 262
in 6 channels
Date
Subscriber Growth
Mentions
Channels
09 September+6
08 September+5
07 September+11
06 September+8
05 September+7
04 September+14
03 September+8
02 September+17
01 September+6
Channel Posts
🚀 Погружаемся в технологии на deep tech night Уже 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса
🚀 Погружаемся в технологии на deep tech night Уже 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о технологических вызовах, с которыми IT-индустрия сталкивается в эпоху AI: от изменений в разработке до новых требований к архитектуре и инфраструктуре. Это событие для ML-разработчиков, бэкендеров, фронтендеров, тимлидов, аналитиков, продактов и всех, кто работает в IT-индустрии, внедряет AI в процессы, проектирует сложные системы и ищет новые решения. 🔥 Вас ждут темы от инфраструктуры и железа для нейросетей до AI-агентов и внедрения AI в разработку и два формата: 🔵 Hard — доклады о сложных и масштабных задачах для тех, кто хочет вдумчиво разобраться в технической стороне сферы. 🔵 Experiment — лайтнинги и интерактивные кейсы об экспериментах с AI-агентами, новых подходах и продуктовых находках. Для всех, кому интересно пробовать новое и следить за трендами. Среди спикеров — Мо Гавдат, десять лет руководивший бизнес-развитием в Google X, Алексей Гусаков, CTO Поисковых сервисов и ИИ, Сергей Мельник, руководитель сервиса Автономного транспорта и роботов, и другие эксперты из Яндекса и других IT-компаний. 🧑‍💻 Чтобы подключиться к онлайн-трансляции, нужна предварительная регистрация. Она также даст возможность задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события. ⏭️ Смотрите полную программу и регистрируйтесь на deep tech night. До встречи! Подписывайтесь: 💬 @Yandex4Analytics

2
⏬ Data Driven 2026: сначала AI-first-аналитика, потом — IT stand-up Акустики В карточках знакомим с несколькими спикерами и т+5
⏬ Data Driven 2026: сначала AI-first-аналитика, потом — IT stand-up Акустики В карточках знакомим с несколькими спикерами и темами конференции (полную программу смотрите на сайте). А здесь рассказываем про вишенку на юбилейном торте — IT stand-up Data Driven × Акустика. На афтерпати C-level-руководители и лиды бигтехов превратятся в стендап-комиков с реальными историями про аналитику: почему все снова просят «ту самую табличку» или как так вышло, что дашборд, который так просили, никому не нужен? 👨‍💻 С иронией о том, что проживает каждый аналитик, выступят: 🔵 Роман Халкечев, CDO Поисковых сервисов и ИИ Яндекса 🔵 Евгений Прохоров, руководитель дата-платформы Max 🔵 Виктор Кантор, преподаватель МФТИ, владелец школы MLinside 🔵 Андрей Петрин, CDO (ex Делимобиль и Яндекс Плюс) 🔵 Владимир Абазов, директор по аналитике и росту нефинансовых сервисов Т-Банка А до IT stand-up будем расслабленно нетворкать, есть вкусные закуски и пить вкусные напитки. 📆 Встретимся 26 сентября в Москве и онлайн. ⏭️ Регистрируйтесь, чтобы ничего не пропустить — как в докладах, так и в праздничной программе. Подписывайтесь: 💬 @Yandex4Analytics
1 882
3
🧑‍💻 Left join через inner join. Часть 3 из 3: реализация для ttest и bootstrap Наша коллега Диля Хакимова рассказала, как в+8
🧑‍💻 Left join через inner join. Часть 3 из 3: реализация для ttest и bootstrap Наша коллега Диля Хакимова рассказала, как восстановить left join из inner join, если известно число всех пользователей в эксперименте. Это позволило почти в 2 раза сократить вычисления при анализе A/B-тестов. В прошлом посте мы начали считать t-статистику для ratio-метрик. Сегодня доведём вычисления до конца — и покажем, как повторить для ttest и bootstrap. ♾ P. S. Для самых любопытных в первом комментарии показываем, как выводили формулы для пересчёта средних, дисперсий, ковариаций и дельт. Подписывайтесь: 💬 @Yandex4Analytics
2 184
4
🔮 Как AI меняет аналитику Искусственный интеллект и агенты — тема, обсуждать которую можно бесконечно. Пока одни спорят, как
🔮 Как AI меняет аналитику Искусственный интеллект и агенты — тема, обсуждать которую можно бесконечно. Пока одни спорят, как AI изменит аналитику в принципе, для кого-то это уже стало профессией. В этом выпуске в гостях у ведущих — Саша Исаков, руководитель группы разработки аналитических ИИ-решений в Яндекс Лавке. Разбираемся: 🔵 откуда берётся сопротивление AI-инструментам внутри команд и что с этим делать 🔵 реально ли построить AI-«суперкосмолёт», который решит все задачи разом — и что происходит, когда чуда не случается 🔵 почему с приходом агентов каждому аналитику приходится немного побыть руководителем 💻 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке. Подписывайтесь: 💬 @Yandex4Analytics
4 152
5
🧠 Реклама выстрелила. Но как именно она повлияла на цифры? Всем привет, это Георгий Морозов, аналитик-разработчик в Финтехе+8
🧠 Реклама выстрелила. Но как именно она повлияла на цифры? Всем привет, это Георгий Морозов, аналитик-разработчик в Финтехе Яндекса. Представим ситуацию: мы запустили акцию и после обороты пошли вверх. Но после не значит вследствие. Часть роста произошла бы и без акции и по разным причинам: сезон, праздники, общий тренд или разовый всплеск от вирусного поста с товаром. Как нам оценить эффект акции отдельно от этих факторов? Наш сервис — партнёрский: мы запускаем промо на всём продукте партнёра и не управляем его витриной или трафиком. Поэтому ни A/B, ни геотест нам не подходят. Отключить рекламу для половины пользователей или отдельного региона не получится. Эффект акции приходится доставать из истории наблюдений. 👳 Чтобы отделить реальный вклад рекламной кампании от того, что случилось бы само собой, мы собрали внутренний инструмент — MILIF. А о том, как он устроен, рассказываем в карточках. 👍 Теперь благодаря этому инструменту мы понимаем честные эффекты наших кампаний, а значит, можем анализировать их эффективность. Это уже позволило нам забюджетировать 2026H2, и в будущем мы планируем оптимизировать наши рекламные кампании с опорой на честный замер. Подписывайтесь: 💬 @Yandex4Analytics
2 887
6
⏬ AI для бизнеса и аналитики: в чём польза? Наши аналитики всё чаще внедряют AI в свои рабочие процессы. Что-то ещё на стадии+5
⏬ AI для бизнеса и аналитики: в чём польза? Наши аналитики всё чаще внедряют AI в свои рабочие процессы. Что-то ещё на стадии MVP и требует доработки, но в целом эффект уже заметен. 👳 Чем AI может помочь вам прямо сейчас — рассказывает Екатерина Анашкина, руководитель продуктовой аналитики Яндекс Недвижимости и Аренды. Подписывайтесь: 💬 @Yandex4Analytics
3 985
7
🧑‍💻 Left join через inner join. Часть 2 из 3: основные метрики и как их считать Продолжаем рассказывать о новом методе анал+8
🧑‍💻 Left join через inner join. Часть 2 из 3: основные метрики и как их считать Продолжаем рассказывать о новом методе анализа A/B-тестов, который предложила наша коллега из Райдтеха Диля Хакимова. В первом посте мы обсудили основную идею: результат для left join можно восстановить из inner join, если известно число всех пользователей в эксперименте. А сегодня зафиксируем базовую теорию, без которой не обойтись: метрики и статистики. 👳 Вспомним, из каких математических компонентов они состоят, чтобы понимать, что именно нам предстоит пересчитывать. Подписывайтесь: 💬 @Yandex4Analytics
2 907
8
🧑‍💻 Data Driven 2026: как AI меняет аналитику прямо сейчас Data Driven — флагманская конференция для аналитиков от бизнес-г
🧑‍💻 Data Driven 2026: как AI меняет аналитику прямо сейчас Data Driven — флагманская конференция для аналитиков от бизнес-группы Поисковых сервисов и ИИ Яндекса. В этом году мы сделали акцент на AI-first-аналитике и будущем аналитиков в эпоху искусственного интеллекта. В двух треках докладов обсудим: 🔵 Какие AI-инструменты реально экономят время аналитика 🔵 Как генеративный AI влияет на работу с данными 🔵 Как изменится роль аналитика в ближайшие годы А ещё Data Driven в этом году исполняется десять лет. Мы выросли из небольшого митапа в масштабную конференцию. Аналитика и её роль в бизнесе менялась и росла буквально на наших глазах. 🎁 В честь дня рождения мы приготовили классную праздничную программу, о ней и докладах расскажем позже. А пока регистрируйтесь по ссылке и помните, что количество офлайн-мест ограничено. ⏭️ Подписывайтесь на канал конференции, чтобы следить за всеми новостями (их будет много). 📆 Встретимся 26 сентября в Москве и онлайн! Подписывайтесь: 💬 @Yandex4Analytics
3 232
9
🎙 Как превратить конфликт в пользу для продукта? Конфликты на работе не всегда означают, что что-то пошло не так. Иногда име
🎙 Как превратить конфликт в пользу для продукта? Конфликты на работе не всегда означают, что что-то пошло не так. Иногда именно благодаря разным взглядам на задачу получается лучше понять цели друг друга, найти сильное решение и договориться о новых правилах работы. В этом выпуске вместе с Игорем Рубановым, руководителем аналитики в Яндекс Go, разбираемся, как договариваться с заказчиками и партнёрами, почему иногда правильный аргумент не работает, а когда стоит искать союзника или эскалировать проблему. 💎 А ещё обсуждаем, может ли сильный аналитик быть полностью бесконфликтным и как понять, что вы уже не защищаете качество решения, а просто хотите победить в споре. ⏭️ Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке. Подписывайтесь: 💬 @Yandex4Analytics
2 548
10
🔥 Делимся первыми спикерами на deep tech night В карточках рассказываем, кто и на какие темы будет выступать на конференции+5
🔥 Делимся первыми спикерами на deep tech night В карточках рассказываем, кто и на какие темы будет выступать на конференции 5 сентября. А чтобы получить доступ к эфиру, задать вопросы экспертам в прямом эфире и первыми посмотреть запись после события, зарегистрируйтесь на сайте. ⏭️ Подробности о докладах и форма регистрации Подписывайтесь: 💬 @Yandex4Analytics
2 788
11
⏬ Как мы ищем иголку в стоге из 5,5 млрд товаров (и зачем это вообще нужно) Привет! Меня зовут Никита Симаков, я руководитель
⏬ Как мы ищем иголку в стоге из 5,5 млрд товаров (и зачем это вообще нужно) Привет! Меня зовут Никита Симаков, я руководитель команды аналитики товарной базы в Яндексе. Наша задача — следить за тем, чтобы пользователь всегда видел актуальную информацию о товарах, а технологии под капотом поиска были удобными и качественными. В этом посте на примере двух кейсов я расскажу, с какими вызовами мы сталкиваемся и как их решаем. Погнали! 🈂️ Кейс № 1. Как не утонуть в 5,5 млрд оферов Представьте: один и тот же iPhone 17 продаётся на 50 разных сайтах. Чтобы пользователь мог сравнить цены на рынке, на нашей стороне нужно понять, что все эти оферы — один и тот же товар. Звучит просто, но когда в товарной базе хранятся 5,5 млрд предложений, попарно сравнивать их уже труднее. Для этого в нашем сервисе применяется технология под названием «Склейка», а моя команда занимается её оценкой. Мы придумываем, как размечать много, масштабируемо и желательно дёшево, а также пробуем разные варианты: разметку человеком, LLM, VLM и каскады нескольких моделей. Среди всех методов ищем самый эффективный и берём его. 🈂️ Кейс № 2. Почему вчерашняя цена сегодня уже не актуальна Кроме оферов, в нашей базе лежит 300 тыс. магазинов, и каждый может в любой момент изменить цену товара или статус о его наличии. Наша задача — оценивать, как парсятся сайты продавцов, чтобы система работала исправно, а пользователи видели максимально свежие данные. Изначально парсинг — это набор регулярок и правил, которые написаны людьми. Мы автоматизировали этот процесс: создали качественную разметку цен, наличия, названий и картинок на сайте. А потом научили AI писать парсеры самостоятельно. Такая система эффективно работает и легко масштабируется. 📆 О других наших кейсах, работе в команде и в целом о Яндексе я расскажу подробнее на Welcome Time 22 августа. Это неформальная офлайн-встреча для продуктовых и дата-аналитиков, где вы сможете: 🔵 Пообщаться со специалистами из Яндекс Поиска и Независимого Ecom 🔵 Обсудить технологии и задать вопросы о проектах 🔵 Если есть желание, пройти диагностику ваших навыков ⏭️ Ждём вас на Welcome Time! Подписывайтесь: 💬 @Yandex4Analytics
3 218
12
🧑‍💻 Left join через inner join. Часть 1 из 3. Как мы анализируем влияние внедрений Во время A/B-тестов мы обычно смотрим на+5
🧑‍💻 Left join через inner join. Часть 1 из 3. Как мы анализируем влияние внедрений Во время A/B-тестов мы обычно смотрим на метрики в двух срезах: по всем участникам эксперимента (left join) и только по активным пользователям (inner join). Проблема в том, что аудитория эксперимента может составлять миллионы человек, а целевые действия совершает лишь малая часть. Считать тяжёлые статистики по всем участникам в Spark — долго и дорого из-за огромного количества нулей. ⏭️ Наша коллега из Райдтеха Диля Хакимова нашла изящное математическое решение, как вообще не считать left join на кластере, а получать его за доли секунды из данных inner join. 👳 В карточках коротко описали суть проблемы и решения, а о реализации для ttest и bootstrap расскажем в следующих постах. Подписывайтесь: 💬 @Yandex4Analytics
3 353
13
🎙 Как аналитики драйвят бизнес? Один аналитик исследует поведение пользователей, дизайнит A/B-тесты и в партнёрстве с команд
🎙 Как аналитики драйвят бизнес? Один аналитик исследует поведение пользователей, дизайнит A/B-тесты и в партнёрстве с командой помогает принимать сложные решения. Другой — растит эффективность продукта: настраивает алгоритмы выдачи и мэтчинг курьеров, работает напрямую с продакшен-кодом. Обе роли напрямую драйвят P&L компании, но влияют на него по-разному. ⏭️ В этом выпуске наши ведущие вместе с Костей Бабаляном, руководителем отдела аналитики роста, ценообразования и технологий роста в Яндекс Еде, обсудили два разных подхода: аналитику эффективности и партнёрскую аналитику. 🔵 Есть ли принципиальная разница между ними и может ли аналитик быть визионером и лидером, оставаясь экспертом-одиночкой без команды? 🎁 А всем, кто досмотрит выпуск до конца, — бонус: тост с пожеланием для аналитиков от нашего гостя! 🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке. Подписывайтесь: 💬 @Yandex4Analytics
3 951
14
👨‍💻 Пять советов соискателю, которые помогут на интервью На собеседовании может быть интересно и спокойно, и тогда с большо+5
👨‍💻 Пять советов соискателю, которые помогут на интервью На собеседовании может быть интересно и спокойно, и тогда с большой вероятностью ваш результат будет лучше, а простой созвон станет классным опытом. На связи Сослан Табуев, старший аналитик-разработчик в отделе аналитики Поиска и супераппа Поисковых сервисов и ИИ. Уже больше трёх лет я провожу лайфкодинг-собеседования на вакансии аналитиков, а до этого сам несколько раз менял работу. Поэтому знаю, как проходит процесс найма аналитиков с обеих сторон — соискателя и собеседующего. 👳 Свой опыт я собрал в карточках: в них я делюсь простыми советами, как кандидат может подготовиться к собеседованию и на что собеседующий обращает внимание во время интервью. А вот два бесплатных курса на Stepik, которые помогут в решении задач: 🔵 Структуры данных 🔵 Методы ⏭️ Больше про аналитику, статистику, данные, AI и здравый смысл рассказываю в своём канале. Подписывайтесь: 💬 @Yandex4Analytics
3 815
15
⏬ Как от целей прийти к задачам Карта гипотез — это технология, которая помогает собрать действенную стратегию для компании и
⏬ Как от целей прийти к задачам Карта гипотез — это технология, которая помогает собрать действенную стратегию для компании или продукта и выстроить логическую цепочку достижения целей. Проще говоря, это точка сборки всех идей в стратегию, которая оформляется в виде ментальной карты. 🈂️ Давайте разберёмся, из каких сущностей состоит карта гипотез и как с ней работать 🔵 Цель. Это то, чего мы хотим достичь. У цели должен быть нарратив («автоматизировать 80% регулярных отчётов к концу 2026 года») и балансирующие метрики (например, «не увеличивать время подготовки отчёта» или «не снижать точность прогнозной модели ниже 95%»), которые защищают от побочных эффектов и не дают схитрить и добиться цели за счёт ухудшения других параметров 🔵 Субъект. Это те, на чьё поведение нам нужно повлиять, чтобы достичь нашей цели. Субъектом может быть кто угодно: конкретный сегмент пользователей, руководитель вашего отдела или продакт, который принимает решение на основе аналитики. Чтобы изменить поведение субъекта, нужно воздействовать на его мотивацию: что он хочет получить и что ему мешает это получить 🔵 Гипотеза. Самое сердце карты — ключевые идеи, которые могут изменить поведение субъекта и приблизить нас к результату. Гипотеза состоит из трёх блоков: ЕСЛИ (наше воздействие), ТО (как именно субъект изменит своё поведение) и ПОТОМУ ЧТО (почему он должен изменить поведение). Гипотезу нужно сформулировать ясно, но не уходить в преждевременную конкретизацию. Воздействие должно влиять на желания субъекта так, чтобы он менял метрики в нашей цели 🔵 Задача. Это конкретные действия, которые необходимо выполнить, чтобы проверить или реализовать гипотезу. В отличие от цели, которая требует разработки стратегии и преодоления неопределённости, задача — это линейный план действий, где всё уже известно и осталось только реализовать его на практике 🈂️ Как это всё работает вместе Суть карты гипотез в том, что все эти сущности связаны в строгую логическую цепочку: ЦЕЛЬ достигается через изменение поведения СУБЪЕКТОВ, на которое мы влияем с помощью ГИПОТЕЗ, для проверки которых мы выполняем ЗАДАЧИ. 💎 Полезный приём: любую задачу, которая приходит в бэклог, стоит проверить — можно ли от неё выстроить цепочку до цели через субъект и гипотезу. Если нет, скорее всего, эта задача не приближает вас к результату и её стоит переформулировать или отложить. Подписывайтесь: 💬 @Yandex4Analytics
3 301
16
🦠 Как COVID-19 помог в продвижении DataLens В разгар пандемии Яндекс выпустил коронаборд — публичный дашборд со статистикой
🦠 Как COVID-19 помог в продвижении DataLens В разгар пандемии Яндекс выпустил коронаборд — публичный дашборд со статистикой по коронавирусу, который использовали и обычные пользователи, и бизнес, и госструктуры: например, одна ретейл-компания прогнозировала по нему больничные сотрудников. Так внешние обстоятельства дали DataLens новую аудиторию и трафик. Сейчас похожий эффект даёт AI, но в масштабах целой индустрии, только он меняет BI-аналитику. Или дополняет? ⏭️ Об этом в новом выпуске подкаста «Доверительный интервал» рассказал Паша Дубинин, руководитель продуктового развития Yandex DataLens. 🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке. Подписывайтесь: 💬 @Yandex4Analytics
3 348
17
🚀 Погружаемся в технологии на deep tech night 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о т
🚀 Погружаемся в технологии на deep tech night 5 сентября пройдёт deep tech night — масштабная онлайн-конференция Яндекса о технологических вызовах, с которыми IT-индустрия сталкивается в эпоху AI: от изменений в разработке до новых требований к архитектуре и инфраструктуре. Это событие для бэкендеров, фронтендеров, тимлидов, аналитиков, продактов и всех, кто работает в IT-индустрии, внедряет AI в процессы, проектирует сложные системы и ищет новые решения. ⏬ В программе доклады экспертов из Яндекса и международных IT-компаний: 🔵 Мо Гавдат, ex-Chief Business Officer, Google X 🔵 Алексей Гусаков, CTO Поисковых сервисов и ИИ 🔵 Сергей Мельник, руководитель сервиса Автономного транспорта и роботов И другие спикеры (некоторые из них пока что секретные — расскажем о них в ближайшее время 🤫). ⏭️ Зарегистрироваться Подписывайтесь: 💬 @Yandex4Analytics
3 269
18
🥤 BI в эпоху AI Классический BI-инструмент — это не просто набор графиков, а огромный пласт инфраструктуры, метаданных и рег
🥤 BI в эпоху AI Классический BI-инструмент — это не просто набор графиков, а огромный пласт инфраструктуры, метаданных и регламентов. Всё это уже сейчас можно автоматизировать при помощи AI или дашборды ещё долго будут частью ручного труда? ⏭️ В этом выпуске подкаста «Доверительный интервал» наши ведущие вместе с руководителем продуктового развития Yandex DataLens Пашей Дубининым обсудили: 🔵 Как AI меняет визуализацию данных 🔵 Зачем в командах нужен «BI-губернатор» 🔵 Преимущества разработки собственных BI-систем, на примере DataLens 🎧 Смотрите на ютубе и в VK Видео, слушайте в Яндекс Музыке. Подписывайтесь: 💬 @Yandex4Analytics
3 943
19
🤖 Как аналитику не писать документацию (самостоятельно) Всем привет, это Роман Гриднев, технический менеджер в подразделении
🤖 Как аналитику не писать документацию (самостоятельно) Всем привет, это Роман Гриднев, технический менеджер в подразделении аналитики Поисковых сервисов и ИИ Яндекса. В Яндексе объёмы данных исчисляются эксабайтами, а уникальных таблиц у нас порядка 30 миллионов. Времени на документацию такого масштаба у аналитиков просто нет. Реальный случай: нам нужно было описать около 40 000 самых востребованных таблиц, а руками за год мы охватили только 500. Ситуация неутешительная: аналитики по-прежнему не находили нужные данные и при этом производили всё больше новых. Как быть? На ум сразу пришла очевидная мысль: что, если использовать LLM? Но любой нейросети нужен контекст, а где взять его в пустой таблице, да ещё и с нетипичным внутренним жаргоном и традициями нейминга? Тогда мы пришли к идее комплексного робота-автописателя, который собирает контекст, отправляет его LLM и генерирует черновики документации. Так задача «напиши с чистого листа» для аналитика превращается в «проверь и поправь» — психологически это проще и быстрее. 🈂️ Как работает робот Сначала он собирает объективные данные: определяет путь к таблице, изучает её схему и берёт образцы данных, если к ним есть доступ. Затем робот обращается к глоссариям — словарям стандартных полей, которые всегда называются и описываются одинаково. Следующий шаг — парсинг Вики, внутренней базы данных Яндекса. Робот ищет в корпоративных знаниях описания полей и контекст данных, чтобы использовать их в дальнейшей работе. Далее система анализирует граф связей через Memgraph: она выясняет, откуда берётся таблица и куда она идёт дальше в цепочке обработки данных. Робот также учитывает «соседей по папке»: таблицы, расположенные в одной директории хранилища, часто имеют схожий контекст и назначение. Система анализирует совпадения названий и типов полей, но исключает служебные поля, например ID или дату. После того как робот собрал и структурировал всю информацию, он передаёт её модели. LLM дописывает недостающие поля с учётом накопленного контекста — так получается полноценный черновик описания. На следующем этапе система добавляет технические детали: анализирует SQL-код, с помощью которого формируется таблица, и на его основе поясняет логику каждой колонки. В результате в документации появляются блоки с активными ссылками на таблицы-источники. Наконец, робот делает финальный запрос к LLM. Он передаёт модели собранное описание полей и техническую логику их формирования и просит сформулировать краткую характеристику таблицы — до 2000 знаков. Это очень полезно для внутреннего поиска по дата-каталогу. 🈂️ К каким метрикам мы пришли 🔵 Смысл описания, которое подготовил робот, с тем, которое ранее подготовил человек, совпал на 92% 🔵 Полей, в которые аналитики не вносили правок, — 71% 🔵 Наши аналитики довольны описанием таблицы на 93%, а описанием схемы данных — на 85% 🈂️ Что получилось в итоге За 6 месяцев робот помог описать 15 000 таблиц вместо 500 за год ручной работы. На каждой сущности экономим в среднем 2 часа — итого около 5 лет рабочего времени аналитиков. 🈂️ К чему мы стремимся 🔵 Интегрировать систему с потоками регулярных данных, чтобы получать знания о графе формирования каждой колонки напрямую, а не из логов 🔵 Реализовать поколоночную проброску описания: отслеживать, как колонка перетекает из одной таблицы в другую 🔵 Сделать инструмент доступным по кнопке прямо в дата-каталоге — чтобы любой пользователь мог получить описание таблицы в один клик Мы создаём технологии, которые меняют внутренние процессы: автоматизируют рутину, высвобождают время для творчества и сложных задач. Хотите так же? Попробуйте начать с малого: соберите контекст, дайте его LLM — и получите заготовку для документации. Уже первый черновик ускорит работу и запустит цепную реакцию: проверенные описания станут новым контекстом, качество вырастет, а люди будут участвовать в процессе. ⏭️ Кстати, в этом году я выступлю на Data Driven — конференции для аналитиков от Поисковых сервисов и ИИ Яндекса. Встретимся 26 сентября в Москве или онлайн. Подписывайтесь: 💬 @Yandex4Analytics
4 315
20
🎙 Почему капча больше не про светофоры В новом выпуске подкаста Podlodka Руслан Сабиргалиев, руководитель группы коммерчески
🎙 Почему капча больше не про светофоры В новом выпуске подкаста Podlodka Руслан Сабиргалиев, руководитель группы коммерческих проектов Антиробота, рассказал, как эволюционировала капча, зачем боты атакуют сервисы (и сколько это может стоить бизнесу), а также объяснил, что такое невидимые проверки и что делать, когда обычного пользователя система внезапно считает подозрительным. 💎 Ещё поговорили про хороших ботов, AI-агентов, DDoS, защиту логина, форм, SMS и API. ⏭️ Слушайте все подробности в подкасте на ютубе Подписывайтесь: 💬 @Yandex4Analytics
3 252
Yandex for Analytics - Statistics & analytics of Telegram channel @yandexforanalytics