Блог о Data Science 💻
رفتن به کانال در Telegram
Работаю аналитиком в Яндексе, учусь NLP в Вышке и веду этот канал про применение Data Science в компаниях, новости индустрии, рынок труда, мероприятия и другие активности вокруг науки о данных Чат канала: t.me/notedatasciencechat Автор: @travelwithtagir
نمایش بیشتر4 170
مشترکین
اطلاعاتی وجود ندارد24 ساعت
-47 روز
+6130 روز
آرشیو پست ها
Repost from РИСЕРЧОШНАЯ
💬 Yet another dataset?
Сегодня — честный обзор на уже захайпленный датасет.
Если вы когда-либо занимались ресерчем в рексисе, то точно сталкивались с проблемами датасетов.
(Можно вспомнить классическую статью Are We Really Making Much Progress?)
Сначала — немного боли из прошлого:
— гигантский гэп между train и test
— однотипный фидбек
— отсутствие разнообразия пользовательских паттернов
И это всё — на фоне постоянных споров в академии про то, что вообще считается хорошим датасетом.
Даже если вы соберёте SOTA-модель — она может просто не «прокраситься» на кривом сете.
Ну серьёзно, в том же MovieLens test отстоит от train на несколько лет.
И вот — датасет от Яндекс Музыки.
Огромный:
⭐ 4.78 млрд взаимодействий
⭐ 9.39 млн треков
⭐ 1 млн пользователей
⭐ и впервые — флаг is_organic, который показывает:
пришёл ли пользователь к треку сам или его привёл алгоритм
С одной стороны — это прям must-have для исследовательского пула.
Многоуровневый фидбек:
⭐ implicit (прослушивания)
⭐ explicit (лайки, дизлайки, отмены)
Даже эмбеддинги спектрограмм есть.
А ещё — продуманный split:
⭐ leave-one-last
⭐ temporal global
(приложу картинку в комментах — очень в тему для продовой оценки)
По сравнению с Netflix, Steam и прочими — это реально большой и комплексный датасет.
Я бы еще упомянул о бенчмарках и красивом коде куда на мой взгляд легко интегрировать свои решения.
Один момент, о котором почти никто не говорит — это домен.
Яндекс Музыка — это, как и TikTok, продукт с ярко выраженными короткими и длинными предпочтениями.
Здесь трансформеры можно не просто тестировать — здесь они раскрываются.
Но. Доверяй, но проверяй.
👀 Насколько честно размечена органика?
👀 Подходит ли датасет для cold-start задач?
👀 Для многих экспериментов вокруг LLM, мне бы хотелось увидеть больше фичей о пользователях, да и в целом фичей. (btw я понимаю, из-за чего их не включают)
Спасибо ребятам из Яндекса за такой летний подгон.
Реально мощный вклад в сообщество, действительно мало компаний могут себе это позволить.
➡️ Hugging Face и arxiv
Repost from Denis Sexy IT 🤖
NVIDIA научила гуманоидных роботов двигаться, как люди - но при нулевом дообучении после переключения из симуляции на реальный мир
Если коротко, десять лет обучения сжали в две часа симуляции-тренировки
А еще, оказалось, что маленькая модель прекрасно справляется с движениями кожаных:
«В модели полтора миллиона параметров, а не миллиард, чтобы повторить подсознительные процессы человеческого тела»
🤖 TidyBot++: применение, статья, код
Ребята написали довольно хороший абстракт с документацией для своего проекта, можно хорошенько залипнуть на целый вечер (и собрать своего робота)
Вот они, слева направо: сайт, статья, GitHub
@notedatascience
Repost from Data Fusion
Тик-так! Конференция уже совсем скоро ⏰
Начинаем рассказывать о самых интересных событиях на Data Fusion 2025. Время планировать программу: сделать это можно, например, в нашем чат-боте @Data_Fusion_bot.
16 апреля рекомендуем посетить сессию «О науке и жизни: неформальный разговор с известными учеными». Трое хорошо вам знакомых ученых — Константин Вячеславович Воронцов, Андрей Михайлович Райгородский и Иван Валерьевич Оселедец — соберутся на одной площадке, чтобы ответить на все, даже самые каверзные, вопросы.
‼️Вопросы собираем прямо здесь — в комментариях. Задавайте вопрос и указывайте, кому он адресован.
🕑 16 апреля, 14:10
📍Зал «Атом» или онлайн-трансляция на платформе VK Видео
За актуальной программой и временем начала сессии следите на сайте 💙
👀 ML подходы, которые используют в Купере
Нашел для вас способ провести вечер 22 апреля. Ребята из Купера проводят у себя в офисе Data Science митап. Можно пообщаться с интересными людьми из индустрии или просто послушать хорошие доклады 🏃
Команда ML-инженеров поделится опытом решения своих нетривиальных задач:
🔥 Как мы делали матчинг в Купере: как автоматизировать процесс добавления новых товаров и ускорить расширение ассортимента.
🔥 Uplift Space Oddity, или как запустить ML-космолёт и не упасть: как создавать и внедрять Uplift-модели, оптимизируя маркетинговые затраты и сокращая TTM.
🔥 Как делать рекомендации не с нуля: что делать после запуска базовых моделей, чтобы система росла вместе с продуктом.
Митап пройдет 22 апреля в 19:00 в офисе Купера в Москве. Если не сможете посетить очно, после регистрации вам направят ссылку на трансляцию. Количество мест ограничено – подавай заявку по этой ссылке 😁
@notedatascience
🧝♂️ Апрель: разборы, соревнования, Data Fusion
Каждый год примерно в это время в каналах выходят разборы решений победителей Data Fusion. Здесь этого точно не будет 🧙♂️
Желающие послушать разбор решений и узнать имена победителей могут на самой конференции, посетив ее ногами или подключившись онлайн 🐲
Помимо этого можно собраться (как человечек с картинки) послушать доклады про тренды в NLP, system design, ML в физике и многое другое 🍎
🐟 Save the date: 16-17 апреля, Москва, кластер Ломоносов
⌨️ Change of plans: OpenAI edition
Альтман написал, что o3 и o4-mini выйдут через пару недель, а GPT-5 – через несколько месяцев
И это после объявлении об их промо-кампании по раздаче подписок Plus американским и канадским студентам. Выпросили!
Стоит ли ждать релиза за день до LlamaCon, то есть 28 апреля? 😭
@notedatascience
🚀Avito ML Cup 2025: соревнование на 1.200.000 рублей
Нашел для вас активность на ближайший месяц. Авито запускает ML соревнование с двумя интересными задачами и хорошим призовым фондом 😀
Предусмотрено 2 трека:
1️⃣Персональные рекомендации — предскажи, какие товары вызовут интерес у миллионов пользователей → ссылка на регистрацию
2️⃣Поиск дублей — как с помощью CV находить похожие объявления даже при разных текстах и ракурсах фото → ссылка на регистрацию.
Участвовать можно как индивидуально, так и в команде до 4 человек. Подобные активности – это огромная прокачка навыков, общение с единомышленниками и хороший кейс для резюме, а если повезет – призовые деньги и ачивка победителя 🔥
🕚Регистрация уже открыта! Подробности по ссылкам выше
🧿 Live: Introduction to Operator & Agents
Только что началась трансляция на YouTube канале OpenAI про фичу оператора.
Трансляция: https://www.youtube.com/watch?v=CSE77wAdDLg
Статья: https://openai.com/index/computer-using-agent/
Reddit: https://www.reddit.com/r/singularity/comments/1i88v45/introduction_to_operator_agents/
@notedatascience
📸 Paragraphica: context-to-image camera
Недавно наткнулся на один интересный арт-проект. Paragraphica — это камера, которая использует данные о местоположении и другие показатели для генерации "фото" места и момента. Вот ключевые моменты:
🖍️Принцип работы: камера анализирует данные о местоположении — адрес, погоду, время суток и близлежащие объекты. На основе этих данных она генерирует текстовое описание текущего места.
🖍️Технология: с помощью AI image synthesis, текстовое описание преобразуется в визуальное изображение. Это не обычное фото, а визуализация данных, отражающая сущность момента и место, в котором вы находитесь.
🖍️ Оборудование: Raspberry Pi 4, 15-дюймовый сенсорный экран, 3D-печатный корпус, индивидуальная электроника.
🖍️Программное обеспечение: Noodl, Python, API Stable Diffusion.
Получился супер любопытный проект. По ссылке можно ознакомиться с подробной статьей в картинках с производства, схемах и других деталях
@notedatascience
🫦 Видео: 7 вещей, которые я понял, работая в ML
Ребята из ML-команды Купера рассказали о главных инсайтах, которые они извлекли за время работы, дали советы начинающим специалистам, разобрали, как справляться с вызовами этой профессии.
🔘 Какими компетенциями обладает ML-специалист?
🔘 Как помнить про цель и искать свой путь?
🔘 Какие вызовы могут возникнуть при смене карьерного трека?
🔘 Почему важно думать про бизнес и решать правильные задачи?
Ответы на эти и другие вопросы вы найдете в ролике на YouTube и в VK Видео!
Возможно, вы узнаете себя в этих историях и получите вдохновение для новых карьерных свершений в новом году 🤝
Реклама. ООО «ИНСТАМАРТ СЕРВИС», ИНН: 9705118142. Ерид: 2W5zFJiu8SC
+1
😃 Kaggle x Child Mind Institute: произошел шейкап
Пару дней назад подвели результаты Kaggle соревнования Child Mind Institute – Problematic Internet Use. Задача – предсказать уровень проблемного использования интернета детьми и подростками, основываясь на их физической активности 😡
Здесь мог бы быть пост о том, как я заслал паблик решение и (чудом) получил серебряную медальку, но получилось еще интереснее: произошел жесткий шейкап. Никогда ведь такого не было – вот тут дискуссия с подобными случаями за 2024 год 🤡
Средний шейкап у людей с призовых мест получился +1750 позиций, а на 2 месте так вовсе есть зеленый гусь из Индии с 2 саббмитами, который по приколу залетел в сореву, отправил пару решений и забил за пару месяцев до конца соревнования 🔘
Решение зеленого гуся из Индии можно посмотреть здесь. Получились довольно легкие $10.000, да? 😇
@notedatascience
Разбираем тестовое задание на позицию Junior Аналитика в Яндекс
Чтобы найти работу, мало пройти курс и сделать классное резюме. На практике, чтобы выделиться на собеседовании, нужно понимать, что лежит под капотом каждого инструмента, а не следовать конкретному заученному алгоритму.
Чтобы попрактиковаться в этом, приходите на бесплатный вебинар, где будем разбирать реальное тестовое задание, которое дают аналитикам в подразделении Яндекс Картинки.
Что будет на вебинаре:
🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла
🟠Найдём закономерности и отличия использования сервиса на мобильных устройствах и компьютерах
🟠Разберём фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др.
Вебинар проведет Андрон Алексанян, CEO Simulative
🕗Встречаемся 24 декабря в 19:00
🎁Обязательно приходите смотреть вебинар в прямом эфире - в лайве будут дарить подарки, которые сильно бустанут старт карьеры в аналитике!
Зарегистрироваться на бесплатный вебинар
🤝 Результаты эксперимента «AI Art Turing Test»
В блоге Astral Codex Ten недавно опубликовали результаты эксперимента «AI Art Turing Test». Участникам предлагалось отличить произведения искусства, созданные человеком, от изображений, сгенерированных искусственным интеллектом
Вот некоторые цифры из результатов:
🤝 Средняя точность ответов участников составила примерно 60%
🤝 Только около 5% участников смогли правильно идентифицировать более 75% изображений.
🤝 Примерно 25% участников показали точность ниже 50%
🤝 Некоторые изображения вводили в заблуждение особенно часто: одно из AI generated изображений было идентифицировано как человеческое более чем в 70% случаев.
Подробнее об эксперименте и его выводах можно узнать в оригинальной статье: How Did You Do On The AI Art Turing Test?
@notedatascience
💵 Хакатон: 21 трек и призовой фонд в 6.000.000₽
В октябре я участвовал в одном ML соревновании. Участники решали интересную задачу, общались друг с другом и боролись за большой призовой фонд. Мне было интересно и полезно порешать задачи, отличные от рабочей деятельности
До 26 ноября вы можете зарегистрироваться на Всероссийский Хакатон ФИЦ 2024. Там представлен 21 различный трек, а призовой фонд – 6.000.000 рублей 💸
Направлений много, но вот мои любимые:
📌 Учет личных финансов
📌 Оценка уровня экспертности по резюме
📌 Контекстный перевод названий научных работ
📌 Разработка сервиса печати этикеток для производителей одежды
📌 Формирование фото и видео контента с использованием нейросетей на основе биографии и фото персоны
Хакатон проходит в 2 этапа – онлайн отборочный этап пройдет с 29 ноября по 2 декабря, а оффлайн финальный этап пройдет с 3 по 4 декабря
📝 Успей зарегистрироваться по этой ссылке до 26 ноября 23:59, а в комментариях можно найти себе команду
🎵 Как Spotify ускорил разметку данных для ML в 10 раз
Spotify недавно рассказал, как они ускорили разметку данных для ML-моделей в 10 раз. Главный секрет — использование LLM в сочетании с работой аннотаторов. Модели берут на себя первичную разметку, а люди дорабатывают и проверяют сложные случаи, что дает трехкратный прирост производительности
В стриминговом сервисе, который очень быстро растет, важно уметь создавать масштабируемые решения для снижения костов. Например, этот способ используется для выявления нарушений политики платформы
Их стратегия разметки строится на трех столпах:
⚡️ Масштабирование человеческой экспертизы: аннотаторы проверяют и уточняют результаты, чтобы повысить точность данных.
⚡️ Инструменты для аннотации: создание эффективных инструментов, которые упрощают работу аннотаторов и позволяют быстрее интегрировать модели в процесс.
⚡️ Фундаментальная инфраструктура и интеграция: платформа разработана так, чтобы обрабатывать большие объемы данных параллельно и запускать десятки проектов одновременно.
Этот подход позволил Spotify запускать десятки проектов одновременно, снизить затраты и сохранить высокую точность. Подробнее узнать об их решении можно в статье на их сайте 🎵
@notedatascience
🌟 Нейросеть для генерации вокала по тексту
Я активно слежу за тем, что происходит в технологиях вокруг музыкальной индустрии. А еще я очень люблю соревнования, связанные с этой сферой 📎
С 2 по 17 ноября пройдет хакатон XLabs AI, участникам которого предстоит разработать нейросеть для генерации вокала по текстовому запросу 🎵
Тебя ждут:
👉 Уникальная задача и 2 недели на разработку решения совместно с экспертами AI индустрии
👉 Призовой фонд 2 миллиона рублей
👉 Возможность стать сотрудником в передовой AI-лаборатории и выступить на международной конференции в Минске
Скорее собирай команду до 5 человек и регистрируйся. Если у тебя нет команды, то тебе помогут ее найти ✌️
Успей зарегистрироваться до 1 ноября по этой ссылке 🔥
📱 Illuminate by Google: paper to podcast service
Google запустил в экспериментальном формате проект Illuminate – text-to-speech сервис, который превращает научные статьи по computer science в подкаст 🎧
Сначала создаются краткие резюме статей и вопросы-ответы, а потом два сгенерированных AI-голоса — интервьюер и эксперт — разворачивают вокруг статьи короткое интервью (3-7 минут), объясняющее суть работы 🤫
На сайте Google Illuminate уже можно послушать несколько примеров. Можно записаться в waitlist, чтобы получить доступ к самостоятельным генерациям. Я уже там как несколько недель, но доступа еще нет 🤗
Вот несколько примеров генераций:
⚡️Attention Is All You Need: audio, paper
⚡️Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: audio, paper
⚡️Efficient Estimation of Word Representations in Vector Space: audio, paper
Если сервис будет развиваться, мы, вероятно, получим возможность генерировать свой контент без привязки к источникам – сейчас можно загружать статьи только с arXiv. Но и сейчас это отличная возможность получать в понятном формате статьи для прослушивания – например, во время тренировок 🤔
@notedatascience
🔄 Зачем тестировать ML-системы?
Помните, как ребята из Microsoft в 2016 году запустили чат-бота по имени Тау, который обучался в реальном времени, анализируя ответы пользователей и генерируя собственные ответы? 🪟
Вы наверняка помните, что в течение 16 часов после запуска Tay начал генерировать оскорбительные и неприемлемые сообщения, что привело к значительным репутационным потерям для Microsoft. Наверное, на графиках можно отследить снижение капитализации 🔥
Если не хотите быть как Microsoft, рекомендую прочитать Хабр статью о тестировании ML систем — с подводкой, примерами кейсов, мемами, кодом и объяснением различных видов тестов 😵
@notedatascience
🔄Практикуем математику в формате LeetCode
На некоторых проектах или позициях часто происходит так, что после собеседования необходимость в постоянной тренировке математического аппарата отпадает. Одно дело — заботать задачи к собесу, другое — добровольно решать это, когда нет дедлайна и требований🖍️
Но практиковаться надо. Я нашел парочку сайтов, где в формате LeetCode дают задачи на линейную алгебру, DL и ML, а также теорию вероятности и математическую статистику. Первые 3 блока можно решать здесь, последние два — здесь 📥
На сайтах очень приятный интерфейс с оглядкой на LeetCode — есть деление по категориям сложности [Easy, Medium, Hard]. А еще можно самому коммитить свои задачи 📁
Не уверен, что такие сайты будут пользоваться популярностью, пока математика не станет повсеместным однотипным этапом отбора, как это произошло с алгоритмами и систем дизайном. А что считаете вы? 🖼️
