Блог о Data Science 💻
Відкрити в Telegram
Работаю аналитиком в Яндексе, учусь NLP в Вышке и веду этот канал про применение Data Science в компаниях, новости индустрии, рынок труда, мероприятия и другие активности вокруг науки о данных Чат канала: t.me/notedatasciencechat Автор: @travelwithtagir
Показати більше4 170
Підписники
Немає даних24 години
-47 днів
+6130 днів
Архів дописів
🔄Практикуем математику в формате LeetCode
На некоторых проектах или позициях часто происходит так, что после собеседования необходимость в постоянной тренировке математического аппарата отпадает. Одно дело — заботать задачи к собесу, другое — добровольно решать это, когда нет дедлайна и требований🖍️
Но практиковаться надо. Я нашел парочку сайтов, где в формате LeetCode дают задачи на линейную алгебру, DL и ML, а также теорию вероятности и математическую статистику. Первые 3 блока можно решать здесь, последние два — здесь 📥
На сайтах очень приятный интерфейс с оглядкой на LeetCode — есть деление по категориям сложности [Easy, Medium, Hard]. А еще можно самому коммитить свои задачи 📁
Не уверен, что такие сайты будут пользоваться популярностью, пока математика не станет повсеместным однотипным этапом отбора, как это произошло с алгоритмами и систем дизайном. А что считаете вы? 🖼️
📌Получаем оффер на аналитика-разработчика за 1 день
Я очень люблю One Day Offer’ы — за один день можно пройти все этапы собеседований, не растягивая этот процесс на 3 недели. Особенно классно это работает как личный челлендж длиною в день — а смогу ли я получить оффер? 🚀
Уже 10 августа можно будет попробовать свои силы на собеседованиях в команду GigaChat. В 11:00 предусмотрено знакомство, потом будет 2 технические секции, а далее — финалы и выставление оффера 📊
GigaChat — мультимодальная языковая модель, которая отвечает на вопросы, сочиняет тексты, пишет код и рисует картинки 🤖
Вот, какие задачи решает эта команда:
🖥Research: исследование и реализация перспективных подходов обучения, синтеза и фильтрации данных, конструирование метрик и бенчмарков LLM, разработка пайплайнов для решения продуктовых кейсов с помощью больших языковых моделей
🖥Code: реализация prod-ready кода по работе с LLM, БД, API
🖥Markup: формирование и контроль пайплайнов разметки данных
🖥Pretrain: повышение качества pretrain набора данных
🖥RL: эксперименты с RL, Reward и DPO подходами
Оставляйте отклик здесь — One Day Offer пройдет уже 10 августа 🔥
🔄Главный миф, который стоит за Leetcode
Вчера я рассказал про аналог Литкода от Яндекса и задумался о том, как люди вообще воспринимают эту площадку. Я часто слышу, как людям, которые хотят заботать алгоритмы, советуют просто решать задачки на Литкоде. Но правильно ли это? 👋
У нас в Вышке был полноценный курс по алгоритмам, на котором мы все разбирали. А насколько вообще эффективно нарешивать задачи, когда у человека нет теоретической базы? 💺
Конечно, можно пару часов посидеть над задачей, заглянуть в обсуждения и еще на полгода забить на Литкод. А можно подойти более фундаментально и набраться теоретической базы 👓
Ведь изначально алгоритмические секции делаются не для того, чтобы проверить, как человек запомнил решение задачи и сколько их он прорешал — компания хочет понимать, что человек будет писать оптимальный код 💃
Можно прослушать на ютубе курс лекций и параллельно решать задачи. А можно воспользоваться хэндбуком от Яндекса — там в формате интерактивного учебника в правильном порядке подаются темы по алгоритмам 💻
Еще можно параллельно смотреть на neetcode.io, где есть подробный роадмэп по задачам — без теории, но хотя бы порядок решения задач/тем будет верным 🔍
Пишите в комментариях, что думаете про необходимость алгоритмических секций на собесах — а нужно ли это вообще? Кто-то пользовался этим хэндбуком от Яндекса? 👀
@notedatascience
✅ Магистратура по Data Science и машинному обучению
В прошлом году ко мне приходили с предложением поступить в магистратуру и учиться параллельно с бакалавриатом на третьем курсе. Я отказался, потому что фуллтайм работы и учебы мне хватало, но магистратура интересная — об этом и пост 🖥
Центральный университет — современный вуз, созданный при поддержке ведущих технологичных компаний России: Т-Банка, Авито, Сбера и других. Идея в том, чтобы адаптировать высшее образование к потребностям рынка 🚙
После выпуска студенты получают диплом магистра в области математики и компьютерных наук. Обучение проходит на основе реальных кейсов ведущих IT-компаний у профессоров из МГУ, МФТИ, РЭШ и практиков из индустрии 👉
Пары проходят вечером и на выходных. Помимо возможности начать учиться на третьем курсе бакалавриата, при наличии опыта в DS и ML можно пропустить блок базового обучения и закончить магистратуру за 3 семестра 🙀
У каждого студента будет:
🗣Личный ментор по траектории обучения
🗣Доступ к карьерному центру с коучами и консультантами
🗣Опыт работы в проектах партнеров уже во время обучения
Помимо программы по Data Science и машинному обучению там есть направления продуктовой аналитики, продакт менеджмента и Backend-разработки. А еще есть возможность получить один из 150 грантов на обучение до 1.200.000р 💲
Больше подробностей про университет, программу и гранты по этой ссылке 🖱
Реклама. АНО ВО «Центральный университет». ИНН 7743418023. Erid: 2VtzqxmMBY7
🔄Новый портал для тренировки алгоритмов
У Яндекса все свое. Не Jira, а Трекер. Не Zoom, а Телемост. Ребята даже свой SQL изобрели. А еще недавно они выпустили CodeRun — тренажер для решения алгоритмов вдобавок к своему хэндбуку по алгоритмам, о котором я писал здесь 📒
Это аналог Leetcode, который делают наши коллеги из Яндекса. Из плюсов — там есть подборки по машинному обучению, анализу данных и других областей. Еще там есть авторские подборки от сотрудников — от руководителя ШАДа, от чемпиона мира ICPC 2023, от СТО Поиска и других людей 🖥
А еще до 27 августа проходит контест среди участников, где лучшим подарят какие-то призы и фаст-трек на собесы. Очевидно, что такие вещи делаются для найма — если хотите в Яндекс, то можно что-то порешать для тренировки 💻
Из минусов — некоторые люди пишут, что заходят в Easy задачки, ничего не понимают и выходят. Сам я еще не решал, но добавил себе в копилку ресурсов для момента, когда буду снова ботать алгоритмы 🕷
А вы уже решали задачки на CodeRun? Там правда такие сложные задачи? Ставьте реакции китов 🐳 — нас обязательно заметят и сделают еще один сервис под названием Яндекс Кит ✉️
@notedatascience
🔄Подборка зарубежных мероприятий по Data Science
Принес вам подборку зарубежных школ и мероприятий в аналитике и Data Science. Взял подборку в канале моего товарища @computerscienceabroad, где публикуются подобные подборки об иностранных возможностях – PhD, cтажировки, работы и курсы🌐
Участие в подобных мероприятиях позволяет глубже погрузиться в сферу, обрасти полезными контактами и просто отдохнуть, а может – съездить в командировку🖼
Computational Linguistics Fall School
📌Где: University of Passau, Германия
🕐Когда: September 16 - 27
Data 2030 Summit 2024
📌Где: Стокгольм, Швеция/Онлайн
🕒Когда: 25-26 сентября 2024
Lambda World
📌Где: Кадис, Испания
🕓Когда: 2-4 октября 2024
Machine Learning Week Europe
📌Где: Мюнхен, Германия
🕐Когда: 18-19 ноября 2024
International Workshop on Adaptable, Reliable, and Responsible Learning
📌Где: Абу-Даби, ОАЭ
🕑Когда: 9 декабря 2024
Advanced Language Processing Winter School
📌Где: Centre Paul-Langevin, Франция
🕑Когда: 30 марта - 4 апреля 2025
Подавайте заявки, оформляйте командировки, ставьте реакции китов и записывайтесь на визу, если она вам нужна😁
🔄Обучаем нейросеть проходить змейку в терминале
Вы когда-нибудь хотели обучить модель проходить змейку? Я — нет, а вот некий Bones-ai в двух проектах показал, как это работает. С помощью генетического алгоритма модель достигает идеальных результатов в змейке, а видео к посту — наглядная визуализация процесса обучения 🪩
В архитектуре нейросети используется 24 инпута. Эти инпуты предоставляют информацию о состоянии окружающей среды и самой змейки, что позволяет модели принимать решения о следующем движении📀
Обучение модели занимает около 30 минут и осуществляется через генетический алгоритм, который эволюционирует популяцию из 1000 агентов, каждый из которых представляет уникальную конфигурацию весов нейросети:
🔗Инициализация популяции: Начальная популяция агентов создаётся с случайными весами.
🔗Оценка производительности: Каждый агент оценивается по его способности собирать пищу и избегать столкновений.
🔗Отбор: Лучшие агенты выбираются для размножения на основе их "приспособленности" — чем дольше агент выживает и чем больше собирает пищи, тем выше его шансы быть выбранным для следующего поколения.
🔗Кроссовер и мутации: Веса выбранных агентов комбинируются и мутируют с небольшой вероятностью (0.1), создавая новое поколение агентов, которое потенциально наследует успешные стратегии своих предшественников.
Если хотите подробнее ознакомиться с проектом, то здесь можно найти его первую версию, здесь — вторую, а вот тут находится тред на Reddit, где автор отвечает на вопросы🖼️
Рассказывайте в комментариях, что вы думаете о таких проектах? Как вы думаете, для чего автору это нужно?🎬
✅ Магистратура по Data Science и машинному обучению
В прошлом году ко мне приходили с предложением поступить в магистратуру и учиться параллельно с бакалавриатом на третьем курсе. Я отказался, потому что фуллтайм работы и учебы мне хватало, но магистратура интересная — об этом и пост 🖥
Центральный университет — современный вуз, созданный при поддержке ведущих технологичных компаний России: Т-Банка, Авито, Сбера и других. Идея в том, чтобы адаптировать высшее образование к потребностям рынка 🚙
После выпуска студенты получают диплом магистра в области математики и компьютерных наук. Обучение проходит на основе реальных кейсов ведущих IT-компаний у профессоров из МГУ, МФТИ, РЭШ и практиков из индустрии 👉
Пары проходят вечером и на выходных. Помимо возможности начать учиться на третьем курсе бакалавриата, при наличии опыта в DS и ML можно пропустить блок базового обучения и закончить магистратуру за 3 семестра 🙀
У каждого студента будет:
🗣Личный ментор по траектории обучения
🗣Доступ к карьерному центру с коучами и консультантами
🗣Опыт работы в проектах партнеров уже во время обучения
Помимо программы по Data Science и машинному обучению там есть направления продуктовой аналитики, продакт менеджмента и Backend-разработки. А еще есть возможность получить один из 150 грантов на обучение до 1.200.000р 💲
Больше подробностей про университет, программу и гранты по этой ссылке 🖱
Реклама, АНО ВО «Центральный университет», ИНН 7743418023, erid:2VtzquyGP6Y
✅ Статья, которая чуть не осталась за кулисами
Недавно статья авторов Ravid Shwartz-Ziv и Amitai Armon "Tabular Data: Deep Learning is Not All You Need" достигла более 1000 цитирований. По такому поводу Ravid написал пост, в котором рассказал, как они чуть НЕ не опубликовали статью 🐱
Статья показала, что традиционные методы машинного обучения, такие как XGBoost, часто работают лучше для табличных данных, чем сложные модели глубокого обучения. Авторы столкнулись с проблемой: их выводы казались слишком очевидными, поэтому несколько воркшопов отклонили их работу из-за "недостатка новизны" 😌
Тем не менее, в 2021 году они решили разместить статью на arXiv. Само собой, дальше к ним посыпались предложения от изданий опубликовать их исследование, и статья получила широкое признаний 🐱
В конце поста Ravid отмечает, что даже "очевидные" результаты могут быть важны. Важно делиться всем, что вы находите в своей работе, даже если это кажется простым или уже известным 🙏
Что думаете про этот случай? Часто ли вы бракуете свои идеи из-за того, что они уже были реализованы? 😴😴
✅ Графы в рекомендательных системах [часть 1]
Недавно Даня Картушов писал научную статью с AIRI по графовым рекомендательным системам. В процессе исследования он записывал небольшие черновики про графы, которые теперь хочет превратить в серию статей 💡
Сегодня на Хабре вышла первая статья из этой серии, в которой он рассматривает базовые понятия, концепции и простые модели с их ключевыми особенностями 🙂
Вторую часть напишут ребята из WildRecSys, где они расскажут о lightGCN и поделятся своим опытом использования этой модели 🚀
В статье мне особенно понравились три вещи: отсылка к человеку-пауку, красивые визуализации и супер приятные объяснения – какие-то концепции вообще раскрываются на примере World of Warcraft 😊
Заваривайте чай и переходите читать статью по этой ссылке 🧠
✅ Самый главный пост. Что это за канал?
Привет! Я Тагир Хайрутдинов, аналитик в Яндекс Плюс ⚡️, студент НИУ ВШЭ программы «Компьютерная лингвистика» и автор каналов Тагир Анализирует и Журнал «Зарплатник». Раньше я делал аналитику в Альфа-Банке🐤 и в Ozon💙
Раньше этот канал вел Даня Картушов, который теперь пишет много интересного в @persecond300k, а я с недавнего времени — новый владелец и автор этого канала. Сейчас канал проходит этап перестройки, но уже скоро здесь будет интересный регулярный контент
🗣Для кого этот канал?
Вам стоит подписаться, если вы интересуетесь Data Science и технологиями вокруг этой сферы. В канале будут публиковаться посты про применение DS в компаниях, новости индустрии, рынок труда, мероприятия и другие активности вокруг науки о данных
Уже скоро в канале выйдут посты про собеседования в FAANG, использование AI для научных работ, realtime-матчинг в одном маркетплейсе и тематические подкасты
🗣Ссылки на соседние каналы
@tagir_analyzes – аналитика, датавиз и новости индустрии
@zarplatnik_analytics – анонимные истории с зарплатами специалистов из аналитики и Data Science
@persecond300k – релизы и новости из AI вместе с обзорами на статьи по RecSys, LLM, System Design
🔄Активные денежные соревнования на Kaggle
Собрал для вас подборку из 9 соревнований на Kaggle, к которым еще можно присоединиться. Призовой фонд в каждом из них — от $50.000 до $1.100.000. Некоторые соревнования заканчиваются уже совсем скоро, а некоторые запустили пару дней назад 🤡
Вот сами соревнования с ссылками:
🗣Learning Agency Lab - Automated Essay Scoring 2.0 | ссылка
Цель: Улучшение алгоритмов оценки эссе для повышения образовательных результатов студентов.
Количество команд: 2694.
Дата завершения: 1 июля 2024.
🗣NeurIPS 2024 - Predict New Medicines with BELKA | ссылка
Цель: Прогнозирование взаимодействий малых молекул с белками с использованием BELKA.
Количество команд: 1835.
Дата завершения: 9 июля 2024.
🗣LEAP - Atmospheric Physics using AI (ClimSim) | ссылка
Цель: Симуляция высокого разрешения атмосферных процессов с использованием климатической модели.
Количество команд: 449.
Дата завершения: 16 июля 2024.
🗣USPTO - Explainable AI for Patent Professionals | ссылка
Цель: Помощь патентным специалистам в понимании результатов ИИ через привычный язык запросов.
Количество команд: 315.
Дата завершения: 25 июля 2024.
🗣LMSYS - Chatbot Arena Human Preference Predictions | ссылка
Цель: Прогнозирование предпочтений пользователей.
Количество команд: 929.
Дата завершения: 29 июля 2024.
🗣LLM 20 Questions | ссылка
Цель: Угадать секретное слово в сотрудничестве.
Количество команд: 362.
Дата завершения: 29 июля 2024.
🗣ISIC 2024 - Skin Cancer Detection with 3D-TBP | ссылка
Цель: Определение рака кожи на обрезанных фотографиях из 3D-снимков всего тела.
Количество команд: 129.
Дата завершения: 29 августа 2024.
🗣RSNA 2024 Lumbar Spine Degenerative Classification | ссылка
Цель: Классификация дегенеративных состояний поясничного отдела позвоночника.
Количество команд: 519.
Дата завершения: 29 сентября 2024.
🗣ARC Prize 2024 | ссылка
Цель: Разработка ИИ-систем, способных эффективно осваивать новые навыки и решать открытые задачи без полагания исключительно на обширные наборы данных.
Количество команд: 315.
Дата завершения: 29 октября 2024.
Пишите в комментариях, планируете ли вы участвовать в каком-то из соревнований. Если у вас есть интерес к какому-то из соревнований, я готов подробнее рассказать о нем в отдельном посте. С вас — реакции 🐳
Repost from Заскуль питона (DA/DS/ML) 🐸
VWE (Variance Weighted Estimator) - как еще один метод снижения дисперсии.
🚙 Зачем это нужно?
Мы хотим по-прежнему снизить дисперсию для преобразования метрики к более чувствительной. Как следствие - снижение длительности эксперимента.
💡 Основная идея
Дать пользователям с меньшей дисперсией метрики больший вес для снижения общей дисперсии эффекта.
🖥 Как реализовать?
Предположим, мы хотим оценить ARPU и применить к выручке на пользователя для того чтобы снизить дисперсию. Основная реализация заключается в том, что мы смотрим на то, как изменялась метрика в предпериоде и тем самым мы знаем ее дисперсию и как следствие вес. Затем, мы берем вес для метрики на пользователя, равный 1 / дисперсию, тем самым становится очевидно, что при больших дисперсиях вес становится меньше и затем рассчитываем среднее в группе A и группе B. Код который можно реализовать у себя ниже при сплите 50 / 50 с историей в 21 день (это также можно поресерчить, например, если у нас есть бОльшая история по пользователям, будет меньшее смещение, как мне кажется). Чем-то похоже на стратификацию, где каждой страте мы присваиваем вес, только здесь вес рассчитывается на истории пользователя:
import numpy as np
import pandas as pd
n_users = 1000
days = 21
pre_experiment_revenue = np.random.normal(loc=5, scale=2, size=(n_users, days))
control_group_revenue = np.random.normal(loc=5, scale=2, size=500)
treatment_group_revenue = np.random.normal(loc=5.5, scale=2, size=500)
pre_experiment_df = pd.DataFrame(pre_experiment_revenue, columns=[f'day_{i+1}' for i in range(days)])
pre_experiment_df['user_id'] = np.arange(n_users)
experiment_df = pd.DataFrame({
'user_id': np.arange(n_users),
'group': ['control'] * (n_users // 2) + ['treatment'] * (n_users - n_users // 2),
'revenue': np.concatenate([control_group_revenue, treatment_group_revenue])
})
data = pd.merge(experiment_df, pre_experiment_df, on='user_id')
data['user_variance'] = data[[f'day_{i+1}' for i in range(days)]].var(axis=1)
data['weight'] = 1 / data['user_variance']
data['weighted_revenue'] = data['revenue'] * data['weight']
👎 Минусы VWE:
Аномалии могут поломать оценку
Метод может быть чувствителен к аномальным значениям в предэкспериментальных данных, что может привести к некорректным оценкам весов
Необходима история по пользователям, должна быть богатая история по действиям, например, когда замеряем CTR
VWE требует значительного объема предэкспериментальных данных для точного расчета дисперсий и весов. В случае недостатка данных, результаты могут быть менее надежными
Может давать смещение
При расчете в оценке среднего мы можем получить небольшое смещение из-за перевзвешивания. Другая задача - это получение несмещенной оценки (например, как корректировка средним значением в преэкспериментальной группе при CUPED
Можно использовать с CUPED с уже перевзвешенными значениями. В статье от Facebook удалось добиться следующих результатов по снижению дисперсии в %.
CUPED only - 37,24%
VWE only - 17,31%
CUPED + VWE - 48,38%
На стратификации не смотрели, как я понимаю, но можно было бы еще, наверное снизить либо есть какие-то ограничения про которые я не знаю. А с Ratio-метрикой так вообще прикол: линеаризируем, VWE, CUPED, стратификацию
Этот метод еще освещался на Avito Analytics Meetup + был разбор статьи на YouTube
😉 Ставьте реакции, если пост был полезен, пишите комментарии. Дальше разберем стратификацию и линеаризиацию🔄Рекомендации аудиокниг в Spotify
Недавно Spotify представил пользователям аудиокниги. Новый тип контента требует новых алгоритмов персонализированных рекомендаций. В своей новой статье AI рисерчеры из компании рассказывают о том, как они решали эту задачу 🎵
Аудиокниги, в отличие от музыки и подкастов, требуют более точных рекомендаций, так как пользователи не могут прослушать их перед покупкой. Здесь же возникает еще больше проблем с данными, потому что большинство пользователей ещё не знакомы с аудиокнигами на платформе 👋
В Spotify разработали систему рекомендаций 2T-HGNN. Используя гетерогенные графовые нейронные сети и Two Tower model, они улучшили точность рекомендаций. Этот подход уменьшает сложность модели и повышает её скорость 🙂
Текущие результаты: +46% к числу новых запусков аудиокниг и +23% к общему времени прослушивания. Более того, модель положительно повлияла и на уже знакомые пользователям подкасты 🤣
Пишите в комментариях, что вы думаете о таком подходе? Какие сложности вы видите при работе с рекомендациями аудиокниг? Ставьте реакции китов 🐳
@notedatascience
Repost from РИСЕРЧОШНАЯ
🦜 Сегодня в 12:00
➡️ Как подключиться:
Страница https://app.spatial.chat/s/ods
Пароль: festfinaleparrot
Repost from РИСЕРЧОШНАЯ
🦜 2 июня 2024 с 12:00 до 12:30 мск онлайн-секция Reliabe ML
На треке @Reliable ML Иры и Димы, я поделюсь нашим опытом использования дизайн-документов. Рассмотрим, почему важно заполнять дизайн-документы, их преимущества, а также наш опыт их составления. Также расскажу о нашем вкладе в шаблон дизайн-документа, созданный ребятами из @Reliable ML.
Хочется немного прорекламировать, что проект о котором я буду рассказывать был создан в рамках Симулятора МЛ, и заполнение дизайн документа является неотъемлемой часть любого проекта. Это систематизация от хаотичного движения к какой-то структуре.
В прошлый раз другая команда из SimML, рассказывала про свой дизайн-документ на их треке. Проект так-же проходил ревью в AI Tallent Hub, поэтому рассказать есть о чем. А я буду очень рад вас видеть и ответить на ваши вопросы!
Из книги Валеры и Арсения:
It s safe to say that close to 100% of ML projects which hadn’t had a well-written design document failed, whereas a sweeping majority of those systems that had been thoroughly planned found success.➡️ Когда? 2 июня 2024 с 12:00 до 12:30 ➡️ Как подключиться: Страница https://app.spatial.chat/s/ods Пароль: festfinaleparrot
Repost from Сиолошная
Вместе с Данилом с канала @persecond300k подготовили для себя и для вас Бинго-карточку для предстоящей трансляции OpenAI, чтоб было интереснее наблюдать!
Некоторые факты субъективные (например, что такое «существенные улучшения»?), но мы постараемся судить объективно! 👍
Правила такие:
1. Когда случается то, что написано — вычёркиваем или обводим
2. Когда выбиваем линию — выпиваете (алкоголь, содовую или сок)
3. Если закрыто 3 линии — то повторяем «Ну Сама, ну даёт!»
Заполненные карточки по ходу трансляции можно скидывать в чат или в комментарии к этому посту!
(файл в оригинальном разрешении скину в комментарии)
Repost from BOGDANISSSIMO
вы бы лучше репостец сделали https://www.linkedin.com/feed/update/urn:li:activity:7194763232916516864/
