en
Feedback
Data Science | Machinelearning [ru]

Data Science | Machinelearning [ru]

Open in Telegram

Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Show more

📈 Analytical overview of Telegram channel Data Science | Machinelearning [ru]

Channel Data Science | Machinelearning [ru] (@devsp) in the Russian language segment is an active participant. Currently, the community unites 19 800 subscribers, ranking 6 531 in the Technologies & Applications category and 33 428 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 19 800 subscribers.

According to the latest data from 02 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by -98 over the last 30 days and by 6 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 7.83%. Within the first 24 hours after publication, content typically collects 4.91% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 1 550 views. Within the first day, a publication typically gains 972 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 5.
  • Thematic interests: Content is focused on key topics such as llm, nvidia, контекст, openai, архитектура.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Thanks to the high frequency of updates (latest data received on 03 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

19 800
Subscribers
+624 hours
+177 days
-9830 days
Posts Archive
На бесплатном вебинаре курса: • Разберём, как устроено отслеживание в промышленности, как связаны алгоритмы компьютерного зрения, геометрия сцены и ограничения реального времени на роботах. • Покажем проблемы в реальных условиях: движение камеры, смаз, смена масштаба, задержки. Обсудим связь зрения, геометрии камеры и механики подвеса. Для кого: Специалисты по компьютерному зрению с опытом 1–3 года, Python-разработчики с базой в нейросетях, а также те, кто изучал CV самостоятельно и хочет понять прикладные задачи. Результаты: — Поймёте, как проектируется система отслеживания человека на подвижной камере в реальном времени. — Узнаете ограничения при работе с видео на роботах и мобильных платформах. — Сможете применять подход в видеоаналитике, робототехнике и умных камерах. Спикер: Анастасия Капралова, генеральный директор kapralov ai, 8+ лет в ИИ-разработке Регистрируйтесь сейчас — напомним накануне: регистрация Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576

Data Leakage: как незаметно сломать модель Самая коварная ошибка в ML — это не плохая модель. Это data leakage. Потому что: 👉 модель показывает идеальные метрики 👉 ты радуешься 👉 выкатываешь в прод 👉 всё разваливается
И ты не понимаешь почему.
Что такое Data Leakage Data leakage — это ситуация, когда модель получает доступ к информации из будущего или из target’а, которой не будет в реальном использовании.
Модель читерит, а не учится.
Почему это так опасно Потому что leakage: 👉 не очевиден 👉 не даёт ошибок 👉 сильно улучшает метрики
Чем лучше скор — тем подозрительнее.
Классические примеры leakage 1. Нормализация до split Сделали scaling на всём датасете, а потом разбили на train/test.
Модель уже «видела» test.
2. Target encoding на всех данных Посчитали средний target по категории используя весь датасет.
В train попала информация из test.
3. Фичи из будущего Пример: 👉 предсказываем отток 👉 используем действия после момента предсказания
Модель знает будущее.
4. Дубликаты Один и тот же объект: 👉 в train 👉 и в test
Модель просто запоминает.
5. Неправильный split Временные ряды: 👉 случайный split
Модель обучается на будущем.
Как понять, что у тебя leakage Сигналы: 👉 слишком высокий score 👉 огромный разрыв между offline и продом 👉 модель «слишком уверена» 👉 странно важные фичи
Если выглядит слишком хорошо — скорее всего, так и есть.
Как защититься 1. Делай split до любых преобразований Сначала: 👉 train / test Потом: 👉 scaling 👉 encoding 👉 feature engineering 2. Следи за временем 👉 train = прошлое 👉 test = будущее 3. Используй pipeline Все трансформации: 👉 обучаются только на train 👉 применяются к test 4. Проверяй фичи Задай вопрос:
Эта информация доступна в момент предсказания?
Если нет — удаляй. 5. Делай sanity check 👉 обучись на случайных данных 👉 убери подозрительные фичи
Если качество не падает — что-то не так.
Главный инсайт
Data leakage — это не баг. Это иллюзия качества.
В одном предложении
Если модель слишком хороша — сначала проверь leakage, а потом радуйся.

Ваша команда аналитики тонет в авралах? Задачи копятся, данным не доверяют, аналитики заняты ручными выгрузками вместо реальн
Ваша команда аналитики тонет в авралах? Задачи копятся, данным не доверяют, аналитики заняты ручными выгрузками вместо реальной аналитики — знакомо? 22 апреля в 19:00 МСК приходите на живой практикум «Порядок в данных» от Павла Беляева, тимлида дата-аналитики в Яндекс.eLama. За 1 вечер разберём: — Как выстроить спринт-планирование и расставить приоритеты без конфликтов; — Как внедрить мониторинг качества данных и регламент обработки инцидентов; — Как автоматизировать рутину через Python + Airflow; — Как освободить аналитиков от бесконечных разовых выгрузок. Это работающая система от практика, который управляет командой аналитики в одной из крупнейших рекламных платформ страны. 🎁 Бонус для каждого участника: гайд «15 промптов для работы аналитика» Участие бесплатное, количество мест ограничено. ➡️Зарегистрироваться: https://tglink.io/1df75bbf05e794 Реклама. ООО "АЙТИ РЕЗЮМЕ". ИНН 4025460134. erid: 2W5zFFy8eVX

Как мы автоматизировали Code Review с помощью LLM ⚡️ В Авито большой поток пул-реквестов. Разработчики регулярно отвлекаются
Как мы автоматизировали Code Review с помощью LLM ⚡️ В Авито большой поток пул-реквестов. Разработчики регулярно отвлекаются на ревью чужого кода, отчего быстрее устают. К тому же у каждого ревьюера своё представление о том, как делать правильно. Мы автоматизировали часть проверок с помощью LLM, чтобы освободить разработчиков от этой задачи. Модель анализирует код и находит максимум потенциальных ошибок, но благодаря валидации оставляет комментарии только по делу. Разработчики получают полезную обратную связь и могут сосредоточиться на основной работе. О том, как устроена система, почему выбрали селфхостинг и какие метрики отслеживаем, рассказывает Марк Каширский, DS-инженер команды LLM Авито. Прочитать подробности на Хабре

Repost from xCode Journal
Заводчане в Индии носят камеры на голове, чтобы на этих видео потом могли обучать роботов Для корпораций это фактически бесплатно, а датасет выходит уникальным — таких данных нет в интернете и их невозможно сгенерировать синтетически. Так что да, люди сами помогают создавать себе замену. ✖️ xCode Journal

🦾 Деревья решений для задач классификации и регрессии Машинное обучение кажется сложным, и часто всё ломается на базе: алгор
🦾 Деревья решений для задач классификации и регрессии Машинное обучение кажется сложным, и часто всё ломается на базе: алгоритмы изучаются поверхностно, без понимания, как они реально работают. На открытом уроке разберём один из ключевых алгоритмов — дерево решений. Пошагово покажем, как оно устроено, как принимает решения и как применяется в задачах классификации и регрессии. Без перегрузки формулами — с акцентом на понимание и практику. Вы увидите, как обучаются такие модели и где они действительно полезны. Этот алгоритм — хорошая точка входа в машинное обучение и основа для более сложных подходов. 🚀 ➡️ Встречаемся 29 апреля в 20:00 МСК в преддверии старта курса «Машинное обучение. Специализация». Зарегистрируйтесь и разберитесь, как алгоритмы принимают решения на данных: https://vk.cc/cWYsHz Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576

Компьютер мечты с доставкой по всей России Привет! На связи Royal Computers✨Если нужна качественная сборка мощного пк для игр и работы, тебе сюда. Мы собираем компьютеры в Санкт-Петербурге и отправляем по всей стране. На сайте найдешь то, что в наличии в нашем шоуруме прямо сейчас, а кроме этого там есть сбалансированный конфигуратор, который поможет рассчитать любую сборку. Перейти на сайт #реклама royal-computers.ru О рекламодателе

Feature Engineering важнее выбора модели Самый непопулярный факт в ML: модель — это не главное. Можно часами выбирать между:
Feature Engineering важнее выбора модели Самый непопулярный факт в ML: модель — это не главное. Можно часами выбирать между: XGBoost LightGBM CatBoost …и получить +1% к качеству. А можно поменять фичи — и получить +20%. Разберёмся, почему так 👇 Модель учится только на том, что ты ей дал
Garbage in → garbage out Если признаки: - шумные - нерелевантные - плохо отражают задачу 👉 никакая модель не спасёт Даже самая большая.
Пример из жизни
Задача: предсказать отток клиентов Фичи: - возраст - город - тариф Модель: ок, но слабый результат Добавили: - время с последнего действия - частоту использования - изменение активности 👉 резкий рост качества Почему? Потому что фичи начали отражать реальное поведение
Feature Engineering = внедрение знаний о задаче
Модель не знает: - бизнес - контекст - причинно-следственные связи Зато ты знаешь. И когда ты создаёшь фичи — ты “вшиваешь” это знание в данные. Модель vs Фичи Что меняем → эффект Модель → +1–5% Гиперпараметры → +1–3% Feature Engineering → +10–50%
Где FE особенно решает
- Табличные данные - Маленькие датасеты - Бизнес-задачи 👉 там, где нет миллионов примеров, фичи — это всё Когда модель важнее - CV (изображения) - NLP (тексты) - Speech 👉 там фичи учатся автоматически
Почему все игнорируют FE
Потому что: - это сложно - это долго - нет “магической кнопки” - требует понимания данных Гораздо проще: “давай попробуем ещё одну модель”
Главный инсайт ML — это не соревнование моделей. Это соревнование представлений данных. В одном предложении Лучший способ улучшить модель — 👉 перестать тюнить модель и начать тюнить данные

Repost from xCode Journal
А не приходило кому-то мысля что ии просто пытался сбежать?) 💥 xCode Journal
А не приходило кому-то мысля что ии просто пытался сбежать?) 💥 xCode Journal

Вчера — кушетка и блокнот, сегодня — Python и нейросети Цифровая трансформация не обошла стороной психологию: специалисты уже
Вчера — кушетка и блокнот, сегодня — Python и нейросети Цифровая трансформация не обошла стороной психологию: специалисты уже создают чат-ботов для терапии и внедряют ИИ в психодиагностику. Профессия становится технологичной. Московский институт психоанализа и Нетология запустили магистратуру по аналитике данных и использованию ИИ в психологии — первую в России программу подготовки психологов-исследователей. За 2 года вы: - изучите психологические теории и возможности их цифрового применения; - узнаете, как использовать Python, матанализ и машинное обучение в психологии; - научитесь оценивать влияние технологий на психическое здоровье. Вас ждёт практика в разных форматах, нетворкинг, поддержка, два диплома и бонусы студентов-очников. За поступление до 1 июня действует скидка 9% на оплату 1-го семестра по системе раннего бронирования. Получите профессию на стыке психологии и анализа данных Реклама. ООО “Нетология” ОГРН 1207700135884 Erid:2VSb5w7k4SN

Ошибки при train/test split Train/test split — кажется самой простой частью ML. Но именно здесь чаще всего ломают всю модель.
Ошибки при train/test split Train/test split — кажется самой простой частью ML. Но именно здесь чаще всего ломают всю модель. И самое опасное — ты можешь даже не заметить Data Leakage — тихий убийца моделей
Ты случайно «подсматриваешь» в тест. Примеры: 👉 нормализация на всём датасете до split 👉 target encoding на всех данных 👉 feature, напрямую связанная с таргетом Модель показывает космический скор, а в проде — провал.
Случайный split там, где нельзя
Ты делаешь random split… но данные зависимы. Примеры: 👉 временные ряды 👉 пользователи (один и тот же user в train и test) 👉 сессии Модель узнаёт данные, а не обобщает.
Игнорирование времени
В задачах с временем: 👉 ❌ случайный split 👉 ✅ train = прошлое, test = будущее Иначе ты: 👉 обучаешься на будущем 👉 предсказываешь прошлое Это не ML. Это читерство.
4️⃣ Дисбаланс классов в split
Ты сделал split и получил: 👉 train: 5% positive 👉 test: 1% positive Метрики начинают врать. Решение: 👉 stratified split
Слишком маленький test
Test = 50 объектов Accuracy = 90% Звучит круто. Но это статистический шум. Маленький test = ненадёжная оценка.
Тест используется как валидация
Классическая ошибка: 👉 обучился 👉 посмотрел на test 👉 подкрутил модель 👉 снова посмотрел Это уже не test. Это validation 2.0.
Дубликаты в train и test
Если один и тот же объект попал в обе выборки: Модель просто запоминает. Особенно критично: 👉 CV 👉 e-commerce 👉 табличные данные с ID
Неправильный split в CV
Cross-validation тоже можно сломать: 👉 leakage между фолдами 👉 группы не учитываются 👉 time-series перемешаны Используй: 👉 GroupKFold 👉 TimeSeriesSplit
Главный инсайт Train/test split — это не про «разделить данные». Это про симуляцию реального мира. Если split не отражает прод — все метрики бесполезны. В одном предложении Плохой split может сделать плохую модель «идеальной» — до момента, когда она выйдет в прод.

Repost from xCode Journal
🤣 Примеры полиморфизма на собеседовании: 💥 xCode Journal

Станьте профессионалом в Data Science с нуля уже в 2026 году! Хотите развиваться в Data Science, но столкнулись с трудностями
Станьте профессионалом в Data Science с нуля уже в 2026 году! Хотите развиваться в Data Science, но столкнулись с трудностями самостоятельного изучения? У вас есть возможность обучиться с нуля и освоить новую профессию уже в этом году! Data Science - одна из самых востребованных и высокооплачиваемых сфер в IT. Это мощное сочетание аналитики, инженерии данных и машинного обучения. И сейчас - лучшее время, чтобы войти в профессию, ведь рынок ищет универсалов. Всего за 8 месяцев вы:
➖Освоите полный стек инструментов: SQL, Python, Pandas, Docker, Airflow и ETL-пайплайны ➖Разберётесь в ML и DL: от регрессии и кластеризации до нейросетей, NLP и компьютерного зрения ➖Соберёте портфолио из реальных бизнес-кейсов под руководством практиков ➖Получите диплом государственного образца
Кому подойдёт курс: Новичкам - получите профессию с нуля и выйдете на старт с зарплатой до 170 000 ₽ Аналитикам - прокачаете ML, бустанете зарплату х2 и перейдёте на уровень Data Scientist Специалистам смежных сфер - научитесь работать с данными и принимать решения на их основе После курса вы сможете перейти на позицию Data Scientist и применять навыки из аналитики и инженерии данных, машинного и глубокого обучения. Стартуйте сейчас со скидкой 30%: simulative.ru/data-scientist

Repost from xCode Journal
🐱 На GitHub выкатили andrej-karpathy-skills Скилл из 4 инструкций, которые меняют поведение Claude Code. Благодаря им модель
🐱 На GitHub выкатили andrej-karpathy-skills Скилл из 4 инструкций, которые меняют поведение Claude Code. Благодаря им модель больше планирует, проверяет себя, пишет аккуратнее и меньше галлюцинирует. Автор вдохновился размышлениями отца вайбкодинга и формализовал его подход к работе с кодом и ИИ. Чтобы вы понимали — репа набрала почти 40 тысяч звезд за пару дней. ✖️ xCode Journal

Канал для IT-спецов о том, как запустить свой проект Даже если у тебя нет готовой идеи и все прошлые попытки провалились. Ты
Канал для IT-спецов о том, как запустить свой проект Даже если у тебя нет готовой идеи и все прошлые попытки провалились. Ты узнаешь: Как заранее понять, будет ли кто-то платить за твой продукт? Как выбрать идею, которая "выстрелит"? Как получить первые оплаты, еще ДО создания продукта - и не заплатить за это ни копейки. Если тебе уже надоело тратить жизнь, работая в корпорации, и есть желание "сделать что-то своё", но уходить строить бизнес страшно - ты в правильном месте. Подписаться #реклама 16+ О рекламодателе

Repost from xCode Journal
💸 Сооснователь GitHub поднял $17 млн на нового Git-клиента Скотт Чакон считает, что классический Git УСТАРЕЛ И плохо работае
💸 Сооснователь GitHub поднял $17 млн на нового Git-клиента Скотт Чакон считает, что классический Git УСТАРЕЛ И плохо работает в мире, где код пишут не только люди, но и ИИ-агенты. Поэтому он создал пару лет назад GitButler и теперь выкатил CLI-версию. Главная его идея — более удобный интерфейс и отсутствие классического переключения между ветками + параллельная работа. Вообще внутри много прикольных фич — сразу видно, что разрабатывал не новичок ✖️ xCode Journal

Самый ценный навык в 2026 — ВАЙБ-КОДИНГ! Сейчас с ИИ можно написать проект любой сложности. Самому, без команды программистов
Самый ценный навык в 2026 — ВАЙБ-КОДИНГ! Сейчас с ИИ можно написать проект любой сложности. Самому, без команды программистов. Иван, владелец агентства, запилил ИИ-агента для заказов на Upwork и за три месяца вышел на $10K выручки. И таких историй становится всё больше. У себя на канале я рассказываю: — Какие инструменты использоватьКак собирать проекты от идеи до запуска и первых пользователейКакие связки работают в вайбкодинге прямо сейчас Присоединяйся к сообществу вайбкодеров: https://t.me/+gNiHGwBsg8wxMDE6

ML-модели становятся помощниками в принятии решений на рекламных платформах Технический директор рекламной платформы Т-Банка
ML-модели становятся помощниками в принятии решений на рекламных платформах Технический директор рекламной платформы Т-Банка Василий Разумных рассказал, как работает система, в которой модели используются не только для предсказания кликабельности. По его словам, ML-модели определяют, что показывать конкретному человеку в определенный момент времени. На смену ручной сегментации приходит ML-таргетинг: система сама находит нужную для цели аудиторию. Скоринговая модель помогает в ранжировании: она учитывает экономическую эффективность, вероятность действия и репутацию рекламодателя. Также активно развиваются автостратегии, при которых рекламодатели могут задать цель, а алгоритмы ищут пути ее достижения. СТО отметил, что несмотря на то, что генеративный ИИ помогает варьировать тексты и изображения, все креативы проходят строгие фильтры валидации на соответствие безопасности.

😁😆😁 Ты ведь тоже это замечаешь? Пока одни «присматриваются» к нейросетям— другие уже зарабатывают на этом 💵 И самое интер
😁😆😁 Ты ведь тоже это замечаешь? Пока одни «присматриваются» к нейросетям— другие уже зарабатывают на этом 💵
И самое интересное — порог входа сейчас минимальный. Не нужно быть программистом. Нужно только одно: понимать, как именно использовать ИИ под свои задачи.
Я тут собрал папку с экспертами в этой теме. Можешь добавиться и посмотреть, как это делают другие 👇 https://t.me/addlist/A0vy8zWBM1gyNTky

ROC-AUC vs PR-AUC: когда что использовать ROC-AUC и PR-AUC — две метрики, которые постоянно путают. И чаще всего выбирают не ту. Разберём на пальцах 👇 📈 Что такое ROC-кривая ROC-кривая показывает: 👉 TPR (Recall) — сколько положительных нашли 👉 FPR — сколько отрицательных ошибочно посчитали положительными
Насколько хорошо модель отделяет классы.
ROC-AUC — площадь под этой кривой. 📊 Что такое PR-кривая PR-кривая показывает: 👉 Precision — насколько точны предсказания 👉 Recall — сколько положительных нашли
Насколько хорошо модель находит редкий класс без мусора.
PR-AUC — площадь под этой кривой. ⚔️ Главная разница 👉 ROC-AUC → разделимость классов 👉 PR-AUC → качество положительных предсказаний 🚨 Где все ошибаются Используют ROC-AUC при сильном дисбалансе классов. Почему это плохо? 👉 FPR считается по огромному количеству негативов 👉 даже плохая модель может выглядеть «хорошо»
ROC-AUC становится слишком оптимистичной.
📉 Когда нужен PR-AUC Если у тебя: 👉 fraud detection 👉 churn prediction 👉 medical diagnosis 👉 rare event detection 👉 используй PR-AUC Потому что тебе важно: 👉 находить редкий класс 👉 не засыпать всё false positive 📈 Когда подходит ROC-AUC Если: 👉 классы более-менее сбалансированы 👉 важна общая separability 👉 задача — в целом отличать классы 👉 тогда ROC-AUC ок 🧠 Интуитивный пример Представь: 👉 1% — мошенники 👉 99% — нормальные Модель говорит «всё ок» почти всегда: 👉 ROC-AUC может быть высоким 👉 PR-AUC будет низким
Потому что модель не ловит мошенников.
💥 Главный инсайт ROC-AUC отвечает на вопрос:
Модель в принципе различает классы?
PR-AUC отвечает на вопрос:
Насколько полезны её положительные предсказания?
В одном предложении
Если класс редкий — PR-AUC важнее ROC-AUC. Если баланс нормальный — можно использовать ROC-AUC.