ar
Feedback
Блог о Data Science 💻

Блог о Data Science 💻

الذهاب إلى القناة على Telegram

Работаю аналитиком в Яндексе, учусь NLP в Вышке и веду этот канал про применение Data Science в компаниях, новости индустрии, рынок труда, мероприятия и другие активности вокруг науки о данных Чат канала: t.me/notedatasciencechat Автор: @travelwithtagir

إظهار المزيد
4 170
المشتركون
لا توجد بيانات24 ساعات
-47 أيام
+6130 أيام
أرشيف المشاركات
💬 Yet another dataset? Сегодня — честный обзор на уже захайпленный датасет. Если вы когда-либо занимались ресерчем в рексисе, то точно сталкивались с проблемами датасетов. (Можно вспомнить классическую статью Are We Really Making Much Progress?) Сначала — немного боли из прошлого: — гигантский гэп между train и test — однотипный фидбек — отсутствие разнообразия пользовательских паттернов И это всё — на фоне постоянных споров в академии про то, что вообще считается хорошим датасетом. Даже если вы соберёте SOTA-модель — она может просто не «прокраситься» на кривом сете. Ну серьёзно, в том же MovieLens test отстоит от train на несколько лет. И вот — датасет от Яндекс Музыки. Огромный: ⭐ 4.78 млрд взаимодействий ⭐ 9.39 млн треков ⭐ 1 млн пользователей ⭐ и впервые — флаг is_organic, который показывает: пришёл ли пользователь к треку сам или его привёл алгоритм С одной стороны — это прям must-have для исследовательского пула. Многоуровневый фидбек: ⭐ implicit (прослушивания) ⭐ explicit (лайки, дизлайки, отмены) Даже эмбеддинги спектрограмм есть. А ещё — продуманный split: ⭐ leave-one-last ⭐ temporal global (приложу картинку в комментах — очень в тему для продовой оценки) По сравнению с Netflix, Steam и прочими — это реально большой и комплексный датасет. Я бы еще упомянул о бенчмарках и красивом коде куда на мой взгляд легко интегрировать свои решения. Один момент, о котором почти никто не говорит — это домен. Яндекс Музыка — это, как и TikTok, продукт с ярко выраженными короткими и длинными предпочтениями. Здесь трансформеры можно не просто тестировать — здесь они раскрываются. Но. Доверяй, но проверяй. 👀 Насколько честно размечена органика? 👀 Подходит ли датасет для cold-start задач? 👀 Для многих экспериментов вокруг LLM, мне бы хотелось увидеть больше фичей о пользователях, да и в целом фичей. (btw я понимаю, из-за чего их не включают) Спасибо ребятам из Яндекса за такой летний подгон. Реально мощный вклад в сообщество, действительно мало компаний могут себе это позволить. ➡️ Hugging Face и arxiv

Repost from Denis Sexy IT 🤖
NVIDIA научила гуманоидных роботов двигаться, как люди - но при нулевом дообучении после переключения из симуляции на реальный мир Если коротко, десять лет обучения сжали в две часа симуляции-тренировки А еще, оказалось, что маленькая модель прекрасно справляется с движениями кожаных: «В модели полтора миллиона параметров, а не миллиард, чтобы повторить подсознительные процессы человеческого тела»

🤖 TidyBot++: применение, статья, код Ребята написали довольно хороший абстракт с документацией для своего проекта, можно хорошенько залипнуть на целый вечер (и собрать своего робота) Вот они, слева направо: сайт, статья, GitHub @notedatascience

Repost from Data Fusion
Тик-так! Конференция уже совсем скоро ⏰ Начинаем рассказывать о самых интересных событиях на Data Fusion 2025. Время планиров
Тик-так! Конференция уже совсем скоро Начинаем рассказывать о самых интересных событиях на Data Fusion 2025. Время планировать программу: сделать это можно, например, в нашем чат-боте @Data_Fusion_bot. 16 апреля рекомендуем посетить сессию «О науке и жизни: неформальный разговор с известными учеными». Трое хорошо вам знакомых ученых — Константин Вячеславович Воронцов, Андрей Михайлович Райгородский и Иван Валерьевич Оселедец — соберутся на одной площадке, чтобы ответить на все, даже самые каверзные, вопросы. ‼️Вопросы собираем прямо здесь — в комментариях. Задавайте вопрос и указывайте, кому он адресован. 🕑 16 апреля, 14:10 📍Зал «Атом» или онлайн-трансляция на платформе VK Видео За актуальной программой и временем начала сессии следите на сайте 💙

👀 ML подходы, которые используют в Купере Нашел для вас способ провести вечер 22 апреля. Ребята из Купера проводят у себя в
👀 ML подходы, которые используют в Купере Нашел для вас способ провести вечер 22 апреля. Ребята из Купера проводят у себя в офисе Data Science митап. Можно пообщаться с интересными людьми из индустрии или просто послушать хорошие доклады 🏃 Команда ML-инженеров поделится опытом решения своих нетривиальных задач: 🔥 Как мы делали матчинг в Купере: как автоматизировать процесс добавления новых товаров и ускорить расширение ассортимента. 🔥 Uplift Space Oddity, или как запустить ML-космолёт и не упасть: как создавать и внедрять Uplift-модели, оптимизируя маркетинговые затраты и сокращая TTM. 🔥 Как делать рекомендации не с нуля: что делать после запуска базовых моделей, чтобы система росла вместе с продуктом. Митап пройдет 22 апреля в 19:00 в офисе Купера в Москве. Если не сможете посетить очно, после регистрации вам направят ссылку на трансляцию. Количество мест ограничено – подавай заявку по этой ссылке 😁 @notedatascience

🧝‍♂️ Апрель: разборы, соревнования, Data Fusion Каждый год примерно в это время в каналах выходят разборы решений победителе
🧝‍♂️ Апрель: разборы, соревнования, Data Fusion Каждый год примерно в это время в каналах выходят разборы решений победителей Data Fusion. Здесь этого точно не будет 🧙‍♂️ Желающие послушать разбор решений и узнать имена победителей могут на самой конференции, посетив ее ногами или подключившись онлайн 🐲 Помимо этого можно собраться (как человечек с картинки) послушать доклады про тренды в NLP, system design, ML в физике и многое другое 🍎 🐟 Save the date: 16-17 апреля, Москва, кластер Ломоносов

⌨️ Change of plans: OpenAI edition Альтман написал, что o3 и o4-mini выйдут через пару недель, а GPT-5 – через несколько меся
⌨️ Change of plans: OpenAI edition Альтман написал, что o3 и o4-mini выйдут через пару недель, а GPT-5 – через несколько месяцев И это после объявлении об их промо-кампании по раздаче подписок Plus американским и канадским студентам. Выпросили! Стоит ли ждать релиза за день до LlamaCon, то есть 28 апреля? 😭 @notedatascience

🚀Avito ML Cup 2025: соревнование на 1.200.000 рублей Нашел для вас активность на ближайший месяц. Авито запускает ML соревно
🚀Avito ML Cup 2025: соревнование на 1.200.000 рублей Нашел для вас активность на ближайший месяц. Авито запускает ML соревнование с двумя интересными задачами и хорошим призовым фондом 😀 Предусмотрено 2 трека: 1️⃣Персональные рекомендации — предскажи, какие товары вызовут интерес у миллионов пользователей → ссылка на регистрацию 2️⃣Поиск дублей — как с помощью CV находить похожие объявления даже при разных текстах и ракурсах фото → ссылка на регистрацию. Участвовать можно как индивидуально, так и в команде до 4 человек. Подобные активности – это огромная прокачка навыков, общение с единомышленниками и хороший кейс для резюме, а если повезет – призовые деньги и ачивка победителя 🔥 🕚Регистрация уже открыта! Подробности по ссылкам выше

🧿 Live: Introduction to Operator & Agents Только что началась трансляция на YouTube канале OpenAI про фичу оператора. Трансляция: https://www.youtube.com/watch?v=CSE77wAdDLg Статья: https://openai.com/index/computer-using-agent/ Reddit: https://www.reddit.com/r/singularity/comments/1i88v45/introduction_to_operator_agents/ @notedatascience

📸 Paragraphica: context-to-image camera Недавно наткнулся на один интересный арт-проект. Paragraphica — это камера, которая использует данные о местоположении и другие показатели для генерации "фото" места и момента. Вот ключевые моменты: 🖍️Принцип работы: камера анализирует данные о местоположении — адрес, погоду, время суток и близлежащие объекты. На основе этих данных она генерирует текстовое описание текущего места. 🖍️Технология: с помощью AI image synthesis, текстовое описание преобразуется в визуальное изображение. Это не обычное фото, а визуализация данных, отражающая сущность момента и место, в котором вы находитесь. 🖍️ Оборудование: Raspberry Pi 4, 15-дюймовый сенсорный экран, 3D-печатный корпус, индивидуальная электроника. 🖍️Программное обеспечение: Noodl, Python, API Stable Diffusion. Получился супер любопытный проект. По ссылке можно ознакомиться с подробной статьей в картинках с производства, схемах и других деталях @notedatascience

🫦 Видео: 7 вещей, которые я понял, работая в ML Ребята из ML-команды Купера рассказали о главных инсайтах, которые они извле
🫦 Видео: 7 вещей, которые я понял, работая в ML Ребята из ML-команды Купера рассказали о главных инсайтах, которые они извлекли за время работы, дали советы начинающим специалистам, разобрали, как справляться с вызовами этой профессии. 🔘 Какими компетенциями обладает ML-специалист?  🔘 Как помнить про цель и искать свой путь?  🔘 Какие вызовы могут возникнуть при смене карьерного трека? 🔘 Почему важно думать про бизнес и решать правильные задачи?  Ответы на эти и другие вопросы вы найдете в ролике на YouTube и в VK Видео! Возможно, вы узнаете себя в этих историях и получите вдохновение для новых карьерных свершений в новом году 🤝 Реклама. ООО «ИНСТАМАРТ СЕРВИС», ИНН: 9705118142. Ерид: 2W5zFJiu8SC

😃 Kaggle x Child Mind Institute: произошел шейкап Пару дней назад подвели результаты Kaggle соревнования Child Mind Institut
+1
😃 Kaggle x Child Mind Institute: произошел шейкап Пару дней назад подвели результаты Kaggle соревнования Child Mind Institute – Problematic Internet Use. Задача – предсказать уровень проблемного использования интернета детьми и подростками, основываясь на их физической активности 😡 Здесь мог бы быть пост о том, как я заслал паблик решение и (чудом) получил серебряную медальку, но получилось еще интереснее: произошел жесткий шейкап. Никогда ведь такого не было – вот тут дискуссия с подобными случаями за 2024 год 🤡 Средний шейкап у людей с призовых мест получился +1750 позиций, а на 2 месте так вовсе есть зеленый гусь из Индии с 2 саббмитами, который по приколу залетел в сореву, отправил пару решений и забил за пару месяцев до конца соревнования 🔘 Решение зеленого гуся из Индии можно посмотреть здесь. Получились довольно легкие $10.000, да? 😇 @notedatascience

Разбираем тестовое задание на позицию Junior Аналитика в Яндекс Чтобы найти работу, мало пройти курс и сделать классное резюм
Разбираем тестовое задание на позицию Junior Аналитика в Яндекс Чтобы найти работу, мало пройти курс и сделать классное резюме. На практике, чтобы выделиться на собеседовании, нужно понимать, что лежит под капотом каждого инструмента, а не следовать конкретному заученному алгоритму. Чтобы попрактиковаться в этом, приходите на бесплатный вебинар, где будем разбирать реальное тестовое задание, которое дают аналитикам в подразделении Яндекс Картинки. Что будет на вебинаре: 🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла 🟠Найдём закономерности и отличия использования сервиса на мобильных устройствах и компьютерах 🟠Разберём фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др. Вебинар проведет Андрон Алексанян, CEO Simulative 🕗Встречаемся 24 декабря в 19:00 🎁Обязательно приходите смотреть вебинар в прямом эфире - в лайве будут дарить подарки, которые сильно бустанут старт карьеры в аналитике! Зарегистрироваться на бесплатный вебинар

🤝 Результаты эксперимента «AI Art Turing Test» В блоге Astral Codex Ten недавно опубликовали результаты эксперимента «AI Art
🤝 Результаты эксперимента «AI Art Turing Test» В блоге Astral Codex Ten недавно опубликовали результаты эксперимента «AI Art Turing Test». Участникам предлагалось отличить произведения искусства, созданные человеком, от изображений, сгенерированных искусственным интеллектом Вот некоторые цифры из результатов: 🤝 Средняя точность ответов участников составила примерно 60% 🤝 Только около 5% участников смогли правильно идентифицировать более 75% изображений. 🤝 Примерно 25% участников показали точность ниже 50% 🤝 Некоторые изображения вводили в заблуждение особенно часто: одно из AI generated изображений было идентифицировано как человеческое более чем в 70% случаев. Подробнее об эксперименте и его выводах можно узнать в оригинальной статье: How Did You Do On The AI Art Turing Test? @notedatascience

💵 Хакатон: 21 трек и призовой фонд в 6.000.000₽ В октябре я участвовал в одном ML соревновании. Участники решали интересную
💵 Хакатон: 21 трек и призовой фонд в 6.000.000₽ В октябре я участвовал в одном ML соревновании. Участники решали интересную задачу, общались друг с другом и боролись за большой призовой фонд. Мне было интересно и полезно порешать задачи, отличные от рабочей деятельности До 26 ноября вы можете зарегистрироваться на Всероссийский Хакатон ФИЦ 2024. Там представлен 21 различный трек, а призовой фонд – 6.000.000 рублей 💸 Направлений много, но вот мои любимые: 📌 Учет личных финансов 📌 Оценка уровня экспертности по резюме 📌 Контекстный перевод названий научных работ 📌 Разработка сервиса печати этикеток для производителей одежды 📌 Формирование фото и видео контента с использованием нейросетей на основе биографии и фото персоны Хакатон проходит в 2 этапа – онлайн отборочный этап пройдет с 29 ноября по 2 декабря, а оффлайн финальный этап пройдет с 3 по 4 декабря 📝 Успей зарегистрироваться по этой ссылке до 26 ноября 23:59, а в комментариях можно найти себе команду

🎵 Как Spotify ускорил разметку данных для ML в 10 раз Spotify недавно рассказал, как они ускорили разметку данных для ML-мод
🎵 Как Spotify ускорил разметку данных для ML в 10 раз Spotify недавно рассказал, как они ускорили разметку данных для ML-моделей в 10 раз. Главный секрет — использование LLM в сочетании с работой аннотаторов. Модели берут на себя первичную разметку, а люди дорабатывают и проверяют сложные случаи, что дает трехкратный прирост производительности В стриминговом сервисе, который очень быстро растет, важно уметь создавать масштабируемые решения для снижения костов. Например, этот способ используется для выявления нарушений политики платформы Их стратегия разметки строится на трех столпах: ⚡️ Масштабирование человеческой экспертизы: аннотаторы проверяют и уточняют результаты, чтобы повысить точность данных. ⚡️ Инструменты для аннотации: создание эффективных инструментов, которые упрощают работу аннотаторов и позволяют быстрее интегрировать модели в процесс. ⚡️ Фундаментальная инфраструктура и интеграция: платформа разработана так, чтобы обрабатывать большие объемы данных параллельно и запускать десятки проектов одновременно. Этот подход позволил Spotify запускать десятки проектов одновременно, снизить затраты и сохранить высокую точность. Подробнее узнать об их решении можно в статье на их сайте 🎵 @notedatascience

🌟 Нейросеть для генерации вокала по тексту Я активно слежу за тем, что происходит в технологиях вокруг музыкальной индустрии. А еще я очень люблю соревнования, связанные с этой сферой 📎 С 2 по 17 ноября пройдет хакатон XLabs AI, участникам которого предстоит разработать нейросеть для генерации вокала по текстовому запросу 🎵 Тебя ждут: 👉 Уникальная задача и 2 недели на разработку решения совместно с экспертами AI индустрии 👉 Призовой фонд 2 миллиона рублей 👉 Возможность стать сотрудником в передовой AI-лаборатории и выступить на международной конференции в Минске Скорее собирай команду до 5 человек и регистрируйся. Если у тебя нет команды, то тебе помогут ее найти ✌️ Успей зарегистрироваться до 1 ноября по этой ссылке 🔥

📱 Illuminate by Google: paper to podcast service Google запустил в экспериментальном формате проект Illuminate – text-to-spe
📱 Illuminate by Google: paper to podcast service Google запустил в экспериментальном формате проект Illuminatetext-to-speech сервис, который превращает научные статьи по computer science в подкаст 🎧 Сначала создаются краткие резюме статей и вопросы-ответы, а потом два сгенерированных AI-голоса — интервьюер и эксперт — разворачивают вокруг статьи короткое интервью (3-7 минут), объясняющее суть работы 🤫 На сайте Google Illuminate уже можно послушать несколько примеров. Можно записаться в waitlist, чтобы получить доступ к самостоятельным генерациям. Я уже там как несколько недель, но доступа еще нет 🤗 Вот несколько примеров генераций: ⚡️Attention Is All You Need: audio, paper ⚡️Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: audio, paper ⚡️Efficient Estimation of Word Representations in Vector Space: audio, paper Если сервис будет развиваться, мы, вероятно, получим возможность генерировать свой контент без привязки к источникам – сейчас можно загружать статьи только с arXiv. Но и сейчас это отличная возможность получать в понятном формате статьи для прослушивания – например, во время тренировок 🤔 @notedatascience

🔄 Зачем тестировать ML-системы? Помните, как ребята из Microsoft в 2016 году запустили чат-бота по имени Тау, который обучал
🔄 Зачем тестировать ML-системы? Помните, как ребята из Microsoft в 2016 году запустили чат-бота по имени Тау, который обучался в реальном времени, анализируя ответы пользователей и генерируя собственные ответы? 🪟 Вы наверняка помните, что в течение 16 часов после запуска Tay начал генерировать оскорбительные и неприемлемые сообщения, что привело к значительным репутационным потерям для Microsoft. Наверное, на графиках можно отследить снижение капитализации 🔥 Если не хотите быть как Microsoft, рекомендую прочитать Хабр статью о тестировании ML систем — с подводкой, примерами кейсов, мемами, кодом и объяснением различных видов тестов 😵 @notedatascience

🔄Практикуем математику в формате LeetCode На некоторых проектах или позициях часто происходит так, что после собеседования н
🔄Практикуем математику в формате LeetCode На некоторых проектах или позициях часто происходит так, что после собеседования необходимость в постоянной тренировке математического аппарата отпадает. Одно дело — заботать задачи к собесу, другое — добровольно решать это, когда нет дедлайна и требований🖍️ Но практиковаться надо. Я нашел парочку сайтов, где в формате LeetCode дают задачи на линейную алгебру, DL и ML, а также теорию вероятности и математическую статистику. Первые 3 блока можно решать здесь, последние два — здесь 📥 На сайтах очень приятный интерфейс с оглядкой на LeetCode — есть деление по категориям сложности [Easy, Medium, Hard]. А еще можно самому коммитить свои задачи 📁 Не уверен, что такие сайты будут пользоваться популярностью, пока математика не станет повсеместным однотипным этапом отбора, как это произошло с алгоритмами и систем дизайном. А что считаете вы? 🖼️