Блог о Data Science 💻
Відкрити в Telegram
Работаю аналитиком в Яндексе, учусь NLP в Вышке и веду этот канал про применение Data Science в компаниях, новости индустрии, рынок труда, мероприятия и другие активности вокруг науки о данных Чат канала: t.me/notedatasciencechat Автор: @travelwithtagir
Показати більше4 170
Підписники
Немає даних24 години
-47 днів
+6130 день
Триває завантаження даних...
Схожі канали
Хмара тегів
Немає даних
Виникли проблеми? Будь ласка, оновіть сторінку або зверніться до нашого support-менеджера.
Вхідні та вихідні згадування
---
---
---
---
---
---
Залучення підписників
серпень '25
серпень '25
+34
в 1 каналах
липень '25
+107
в 2 каналах
Get PRO
червень '25
+46
в 0 каналах
Get PRO
травень '25
+29
в 0 каналах
Get PRO
квітень '25
+64
в 1 каналах
Get PRO
березень '25
+25
в 0 каналах
Get PRO
лютий '25
+36
в 0 каналах
Get PRO
січень '25
+38
в 1 каналах
Get PRO
грудень '24
+27
в 1 каналах
Get PRO
листопад '24
+51
в 1 каналах
Get PRO
жовтень '24
+76
в 1 каналах
Get PRO
вересень '24
+192
в 3 каналах
Get PRO
серпень '24
+85
в 1 каналах
Get PRO
липень '24
+108
в 2 каналах
Get PRO
червень '24
+42
в 0 каналах
Get PRO
травень '24
+45
в 0 каналах
Get PRO
квітень '24
+39
в 0 каналах
Get PRO
березень '24
+66
в 0 каналах
Get PRO
лютий '24
+36
в 1 каналах
Get PRO
січень '24
+143
в 0 каналах
Get PRO
грудень '23
+4 331
в 0 каналах
Get PRO
листопад '23
+58
в 0 каналах
Get PRO
жовтень '23
+72
в 0 каналах
Get PRO
вересень '23
+100
в 0 каналах
Get PRO
серпень '23
+137
в 0 каналах
Get PRO
липень '23
+477
в 0 каналах
Get PRO
червень '23
+203
в 0 каналах
Get PRO
травень '23
+1 603
в 0 каналах
Get PRO
квітень '23
+87
в 0 каналах
Get PRO
березень '23
+215
в 0 каналах
Get PRO
лютий '23
+323
в 0 каналах
Get PRO
січень '23
+470
в 0 каналах
Get PRO
грудень '22
+179
в 0 каналах
Get PRO
листопад '22
+133
в 0 каналах
Get PRO
жовтень '22
+110
в 0 каналах
Get PRO
вересень '22
+211
в 0 каналах
Get PRO
серпень '22
+394
в 0 каналах
Get PRO
липень '22
+143
в 0 каналах
Get PRO
червень '22
+223
в 0 каналах
| Дата | Залучення підписників | Згадування | Канали | |
| 27 серпня | 0 | |||
| 26 серпня | +2 | |||
| 25 серпня | +3 | |||
| 24 серпня | +1 | |||
| 23 серпня | +2 | |||
| 22 серпня | +1 | |||
| 21 серпня | 0 | |||
| 20 серпня | 0 | |||
| 19 серпня | 0 | |||
| 18 серпня | 0 | |||
| 17 серпня | 0 | |||
| 16 серпня | 0 | |||
| 15 серпня | +2 | |||
| 14 серпня | +2 | |||
| 13 серпня | +2 | |||
| 12 серпня | +2 | |||
| 11 серпня | 0 | |||
| 10 серпня | +3 | |||
| 09 серпня | +2 | |||
| 08 серпня | +2 | |||
| 07 серпня | +2 | |||
| 06 серпня | 0 | |||
| 05 серпня | 0 | |||
| 04 серпня | +2 | |||
| 03 серпня | 0 | |||
| 02 серпня | +1 | |||
| 01 серпня | +5 |
Дописи каналу
Repost from РИСЕРЧОШНАЯ
💬 Yet another dataset?
Сегодня — честный обзор на уже захайпленный датасет.
Если вы когда-либо занимались ресерчем в рексисе, то точно сталкивались с проблемами датасетов.
(Можно вспомнить классическую статью Are We Really Making Much Progress?)
Сначала — немного боли из прошлого:
— гигантский гэп между train и test
— однотипный фидбек
— отсутствие разнообразия пользовательских паттернов
И это всё — на фоне постоянных споров в академии про то, что вообще считается хорошим датасетом.
Даже если вы соберёте SOTA-модель — она может просто не «прокраситься» на кривом сете.
Ну серьёзно, в том же MovieLens test отстоит от train на несколько лет.
И вот — датасет от Яндекс Музыки.
Огромный:
⭐ 4.78 млрд взаимодействий
⭐ 9.39 млн треков
⭐ 1 млн пользователей
⭐ и впервые — флаг is_organic, который показывает:
пришёл ли пользователь к треку сам или его привёл алгоритм
С одной стороны — это прям must-have для исследовательского пула.
Многоуровневый фидбек:
⭐ implicit (прослушивания)
⭐ explicit (лайки, дизлайки, отмены)
Даже эмбеддинги спектрограмм есть.
А ещё — продуманный split:
⭐ leave-one-last
⭐ temporal global
(приложу картинку в комментах — очень в тему для продовой оценки)
По сравнению с Netflix, Steam и прочими — это реально большой и комплексный датасет.
Я бы еще упомянул о бенчмарках и красивом коде куда на мой взгляд легко интегрировать свои решения.
Один момент, о котором почти никто не говорит — это домен.
Яндекс Музыка — это, как и TikTok, продукт с ярко выраженными короткими и длинными предпочтениями.
Здесь трансформеры можно не просто тестировать — здесь они раскрываются.
Но. Доверяй, но проверяй.
👀 Насколько честно размечена органика?
👀 Подходит ли датасет для cold-start задач?
👀 Для многих экспериментов вокруг LLM, мне бы хотелось увидеть больше фичей о пользователях, да и в целом фичей. (btw я понимаю, из-за чего их не включают)
Спасибо ребятам из Яндекса за такой летний подгон.
Реально мощный вклад в сообщество, действительно мало компаний могут себе это позволить.
➡️ Hugging Face и arxiv
| 2 | NVIDIA научила гуманоидных роботов двигаться, как люди - но при нулевом дообучении после переключения из симуляции на реальный мир
Если коротко, десять лет обучения сжали в две часа симуляции-тренировки
А еще, оказалось, что маленькая модель прекрасно справляется с движениями кожаных:
«В модели полтора миллиона параметров, а не миллиард, чтобы повторить подсознительные процессы человеческого тела» | 0 |
| 3 | 🤖 TidyBot++: применение, статья, код
Ребята написали довольно хороший абстракт с документацией для своего проекта, можно хорошенько залипнуть на целый вечер (и собрать своего робота)
Вот они, слева направо: сайт, статья, GitHub
@notedatascience | 0 |
| 4 | Тик-так! Конференция уже совсем скоро ⏰
Начинаем рассказывать о самых интересных событиях на Data Fusion 2025. Время планировать программу: сделать это можно, например, в нашем чат-боте @Data_Fusion_bot.
16 апреля рекомендуем посетить сессию «О науке и жизни: неформальный разговор с известными учеными». Трое хорошо вам знакомых ученых — Константин Вячеславович Воронцов, Андрей Михайлович Райгородский и Иван Валерьевич Оселедец — соберутся на одной площадке, чтобы ответить на все, даже самые каверзные, вопросы.
‼️Вопросы собираем прямо здесь — в комментариях. Задавайте вопрос и указывайте, кому он адресован.
🕑 16 апреля, 14:10
📍Зал «Атом» или онлайн-трансляция на платформе VK Видео
За актуальной программой и временем начала сессии следите на сайте 💙 | 0 |
| 5 | 👀 ML подходы, которые используют в Купере
Нашел для вас способ провести вечер 22 апреля. Ребята из Купера проводят у себя в офисе Data Science митап. Можно пообщаться с интересными людьми из индустрии или просто послушать хорошие доклады 🏃
Команда ML-инженеров поделится опытом решения своих нетривиальных задач:
🔥 Как мы делали матчинг в Купере: как автоматизировать процесс добавления новых товаров и ускорить расширение ассортимента.
🔥 Uplift Space Oddity, или как запустить ML-космолёт и не упасть: как создавать и внедрять Uplift-модели, оптимизируя маркетинговые затраты и сокращая TTM.
🔥 Как делать рекомендации не с нуля: что делать после запуска базовых моделей, чтобы система росла вместе с продуктом.
Митап пройдет 22 апреля в 19:00 в офисе Купера в Москве. Если не сможете посетить очно, после регистрации вам направят ссылку на трансляцию. Количество мест ограничено – подавай заявку по этой ссылке 😁
@notedatascience | 0 |
| 6 | 🧝♂️ Апрель: разборы, соревнования, Data Fusion
Каждый год примерно в это время в каналах выходят разборы решений победителей Data Fusion. Здесь этого точно не будет 🧙♂️
Желающие послушать разбор решений и узнать имена победителей могут на самой конференции, посетив ее ногами или подключившись онлайн 🐲
Помимо этого можно собраться (как человечек с картинки) послушать доклады про тренды в NLP, system design, ML в физике и многое другое 🍎
🐟 Save the date: 16-17 апреля, Москва, кластер Ломоносов | 0 |
| 7 | ⌨️ Change of plans: OpenAI edition
Альтман написал, что o3 и o4-mini выйдут через пару недель, а GPT-5 – через несколько месяцев
И это после объявлении об их промо-кампании по раздаче подписок Plus американским и канадским студентам. Выпросили!
Стоит ли ждать релиза за день до LlamaCon, то есть 28 апреля? 😭
@notedatascience | 0 |
| 8 | 🚀Avito ML Cup 2025: соревнование на 1.200.000 рублей
Нашел для вас активность на ближайший месяц. Авито запускает ML соревнование с двумя интересными задачами и хорошим призовым фондом 😀
Предусмотрено 2 трека:
1️⃣Персональные рекомендации — предскажи, какие товары вызовут интерес у миллионов пользователей → ссылка на регистрацию
2️⃣Поиск дублей — как с помощью CV находить похожие объявления даже при разных текстах и ракурсах фото → ссылка на регистрацию.
Участвовать можно как индивидуально, так и в команде до 4 человек. Подобные активности – это огромная прокачка навыков, общение с единомышленниками и хороший кейс для резюме, а если повезет – призовые деньги и ачивка победителя 🔥
🕚Регистрация уже открыта! Подробности по ссылкам выше | 0 |
| 9 | 🧿 Live: Introduction to Operator & Agents
Только что началась трансляция на YouTube канале OpenAI про фичу оператора.
Трансляция: https://www.youtube.com/watch?v=CSE77wAdDLg
Статья: https://openai.com/index/computer-using-agent/
Reddit: https://www.reddit.com/r/singularity/comments/1i88v45/introduction_to_operator_agents/
@notedatascience | 0 |
| 10 | 🧿 Live: Introduction to Operator & Agents
Только что началась трансляция на YouTube канале OpenAI про фичу оператора.
Трансляция: https://www.youtube.com/watch?v=CSE77wAdDLg
Статья: https://openai.com/index/computer-using-agent/
Reddit: https://www.reddit.com/r/singularity/comments/1i88v45/introduction_to_operator_agents/
@notedatascience | 0 |
| 11 | 📸 Paragraphica: context-to-image camera
Недавно наткнулся на один интересный арт-проект. Paragraphica — это камера, которая использует данные о местоположении и другие показатели для генерации "фото" места и момента. Вот ключевые моменты:
🖍️Принцип работы: камера анализирует данные о местоположении — адрес, погоду, время суток и близлежащие объекты. На основе этих данных она генерирует текстовое описание текущего места.
🖍️Технология: с помощью AI image synthesis, текстовое описание преобразуется в визуальное изображение. Это не обычное фото, а визуализация данных, отражающая сущность момента и место, в котором вы находитесь.
🖍️ Оборудование: Raspberry Pi 4, 15-дюймовый сенсорный экран, 3D-печатный корпус, индивидуальная электроника.
🖍️Программное обеспечение: Noodl, Python, API Stable Diffusion.
Получился супер любопытный проект. По ссылке можно ознакомиться с подробной статьей в картинках с производства, схемах и других деталях
@notedatascience | 0 |
| 12 | 🫦 Видео: 7 вещей, которые я понял, работая в ML
Ребята из ML-команды Купера рассказали о главных инсайтах, которые они извлекли за время работы, дали советы начинающим специалистам, разобрали, как справляться с вызовами этой профессии.
🔘 Какими компетенциями обладает ML-специалист?
🔘 Как помнить про цель и искать свой путь?
🔘 Какие вызовы могут возникнуть при смене карьерного трека?
🔘 Почему важно думать про бизнес и решать правильные задачи?
Ответы на эти и другие вопросы вы найдете в ролике на YouTube и в VK Видео!
Возможно, вы узнаете себя в этих историях и получите вдохновение для новых карьерных свершений в новом году 🤝
Реклама. ООО «ИНСТАМАРТ СЕРВИС», ИНН: 9705118142. Ерид: 2W5zFJiu8SC | 0 |
| 13 | 😃 Kaggle x Child Mind Institute: произошел шейкап
Пару дней назад подвели результаты Kaggle соревнования Child Mind Institute – Problematic Internet Use. Задача – предсказать уровень проблемного использования интернета детьми и подростками, основываясь на их физической активности 😡
Здесь мог бы быть пост о том, как я заслал паблик решение и (чудом) получил серебряную медальку, но получилось еще интереснее: произошел жесткий шейкап. Никогда ведь такого не было – вот тут дискуссия с подобными случаями за 2024 год 🤡
Средний шейкап у людей с призовых мест получился +1750 позиций, а на 2 месте так вовсе есть зеленый гусь из Индии с 2 саббмитами, который по приколу залетел в сореву, отправил пару решений и забил за пару месяцев до конца соревнования 🔘
Решение зеленого гуся из Индии можно посмотреть здесь. Получились довольно легкие $10.000, да? 😇
@notedatascience | 0 |
| 14 | Разбираем тестовое задание на позицию Junior Аналитика в Яндекс
Чтобы найти работу, мало пройти курс и сделать классное резюме. На практике, чтобы выделиться на собеседовании, нужно понимать, что лежит под капотом каждого инструмента, а не следовать конкретному заученному алгоритму.
Чтобы попрактиковаться в этом, приходите на бесплатный вебинар, где будем разбирать реальное тестовое задание, которое дают аналитикам в подразделении Яндекс Картинки.
Что будет на вебинаре:
🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла
🟠Найдём закономерности и отличия использования сервиса на мобильных устройствах и компьютерах
🟠Разберём фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др.
Вебинар проведет Андрон Алексанян, CEO Simulative
🕗Встречаемся 24 декабря в 19:00
🎁Обязательно приходите смотреть вебинар в прямом эфире - в лайве будут дарить подарки, которые сильно бустанут старт карьеры в аналитике!
Зарегистрироваться на бесплатный вебинар | 0 |
| 15 | 🤝 Результаты эксперимента «AI Art Turing Test»
В блоге Astral Codex Ten недавно опубликовали результаты эксперимента «AI Art Turing Test». Участникам предлагалось отличить произведения искусства, созданные человеком, от изображений, сгенерированных искусственным интеллектом
Вот некоторые цифры из результатов:
🤝 Средняя точность ответов участников составила примерно 60%
🤝 Только около 5% участников смогли правильно идентифицировать более 75% изображений.
🤝 Примерно 25% участников показали точность ниже 50%
🤝 Некоторые изображения вводили в заблуждение особенно часто: одно из AI generated изображений было идентифицировано как человеческое более чем в 70% случаев.
Подробнее об эксперименте и его выводах можно узнать в оригинальной статье: How Did You Do On The AI Art Turing Test?
@notedatascience | 0 |
| 16 | 💵 Хакатон: 21 трек и призовой фонд в 6.000.000₽
В октябре я участвовал в одном ML соревновании. Участники решали интересную задачу, общались друг с другом и боролись за большой призовой фонд. Мне было интересно и полезно порешать задачи, отличные от рабочей деятельности
До 26 ноября вы можете зарегистрироваться на Всероссийский Хакатон ФИЦ 2024. Там представлен 21 различный трек, а призовой фонд – 6.000.000 рублей 💸
Направлений много, но вот мои любимые:
📌 Учет личных финансов
📌 Оценка уровня экспертности по резюме
📌 Контекстный перевод названий научных работ
📌 Разработка сервиса печати этикеток для производителей одежды
📌 Формирование фото и видео контента с использованием нейросетей на основе биографии и фото персоны
Хакатон проходит в 2 этапа – онлайн отборочный этап пройдет с 29 ноября по 2 декабря, а оффлайн финальный этап пройдет с 3 по 4 декабря
📝 Успей зарегистрироваться по этой ссылке до 26 ноября 23:59, а в комментариях можно найти себе команду | 0 |
| 17 | 🎵 Как Spotify ускорил разметку данных для ML в 10 раз
Spotify недавно рассказал, как они ускорили разметку данных для ML-моделей в 10 раз. Главный секрет — использование LLM в сочетании с работой аннотаторов. Модели берут на себя первичную разметку, а люди дорабатывают и проверяют сложные случаи, что дает трехкратный прирост производительности
В стриминговом сервисе, который очень быстро растет, важно уметь создавать масштабируемые решения для снижения костов. Например, этот способ используется для выявления нарушений политики платформы
Их стратегия разметки строится на трех столпах:
⚡️ Масштабирование человеческой экспертизы: аннотаторы проверяют и уточняют результаты, чтобы повысить точность данных.
⚡️ Инструменты для аннотации: создание эффективных инструментов, которые упрощают работу аннотаторов и позволяют быстрее интегрировать модели в процесс.
⚡️ Фундаментальная инфраструктура и интеграция: платформа разработана так, чтобы обрабатывать большие объемы данных параллельно и запускать десятки проектов одновременно.
Этот подход позволил Spotify запускать десятки проектов одновременно, снизить затраты и сохранить высокую точность. Подробнее узнать об их решении можно в статье на их сайте 🎵
@notedatascience | 0 |
| 18 | 🌟 Нейросеть для генерации вокала по тексту
Я активно слежу за тем, что происходит в технологиях вокруг музыкальной индустрии. А еще я очень люблю соревнования, связанные с этой сферой 📎
С 2 по 17 ноября пройдет хакатон XLabs AI, участникам которого предстоит разработать нейросеть для генерации вокала по текстовому запросу 🎵
Тебя ждут:
👉 Уникальная задача и 2 недели на разработку решения совместно с экспертами AI индустрии
👉 Призовой фонд 2 миллиона рублей
👉 Возможность стать сотрудником в передовой AI-лаборатории и выступить на международной конференции в Минске
Скорее собирай команду до 5 человек и регистрируйся. Если у тебя нет команды, то тебе помогут ее найти ✌️
Успей зарегистрироваться до 1 ноября по этой ссылке 🔥 | 0 |
| 19 | 📱 Illuminate by Google: paper to podcast service
Google запустил в экспериментальном формате проект Illuminate – text-to-speech сервис, который превращает научные статьи по computer science в подкаст 🎧
Сначала создаются краткие резюме статей и вопросы-ответы, а потом два сгенерированных AI-голоса — интервьюер и эксперт — разворачивают вокруг статьи короткое интервью (3-7 минут), объясняющее суть работы 🤫
На сайте Google Illuminate уже можно послушать несколько примеров. Можно записаться в waitlist, чтобы получить доступ к самостоятельным генерациям. Я уже там как несколько недель, но доступа еще нет 🤗
Вот несколько примеров генераций:
⚡️Attention Is All You Need: audio, paper
⚡️Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: audio, paper
⚡️Efficient Estimation of Word Representations in Vector Space: audio, paper
Если сервис будет развиваться, мы, вероятно, получим возможность генерировать свой контент без привязки к источникам – сейчас можно загружать статьи только с arXiv. Но и сейчас это отличная возможность получать в понятном формате статьи для прослушивания – например, во время тренировок 🤔
@notedatascience | 0 |
| 20 | 🔄 Зачем тестировать ML-системы?
Помните, как ребята из Microsoft в 2016 году запустили чат-бота по имени Тау, который обучался в реальном времени, анализируя ответы пользователей и генерируя собственные ответы? 🪟
Вы наверняка помните, что в течение 16 часов после запуска Tay начал генерировать оскорбительные и неприемлемые сообщения, что привело к значительным репутационным потерям для Microsoft. Наверное, на графиках можно отследить снижение капитализации 🔥
Если не хотите быть как Microsoft, рекомендую прочитать Хабр статью о тестировании ML систем — с подводкой, примерами кейсов, мемами, кодом и объяснением различных видов тестов 😵
@notedatascience | 0 |
