Data Science | Machinelearning [ru]
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD
Больше📈 Аналитический обзор Telegram-канала Data Science | Machinelearning [ru]
Канал Data Science | Machinelearning [ru] (@devsp) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 19 795 подписчиков, занимая 6 510 место в категории Технологии и приложения и 33 305 место в регионе Россия.
📊 Показатели аудитории и динамика
С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 19 795 подписчиков.
Согласно последним данным от 30 августа, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило -152, а за последние 24 часа — -11, при этом общий охват остаётся высоким.
- Статус верификации: Не верифицирован
- Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 7.98%. В первые 24 часа после публикации контент обычно набирает 4.93% реакций от общего числа подписчиков.
- Охват публикаций: В среднем каждый пост получает 1 578 просмотров. В течение первых суток публикация набирает 974 просмотров.
- Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 6.
- Тематические интересы: Контент сосредоточен на ключевых темах, таких как llm, nvidia, контекст, openai, архитектура.
📝 Описание и контентная политика
Автор описывает ресурс как площадку для выражения субъективного мнения:
“Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD”
Благодаря высокой частоте обновлений (последние данные получены 31 августа, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.
«Я пользователь GitHub под номером 1299, присоединился в феврале 2008 года. Я заходил на GitHub почти каждый день в течение более 18 лет. Для меня никогда не было вопроса, куда размещать свои проекты: всегда GitHub. Мне очень грустно это говорить, но пришло время уходить», — пишет он.✖️ xCode Journal
Ответ, который никто не любит: зависит от задачи.Но давай разберёмся по-честному, без мифов. Что такое Random Forest Это ансамбль деревьев, где: 👉 каждое дерево обучается независимо 👉 используются случайные подвыборки данных и фич
Идея: уменьшить variance за счёт усреднения.Что такое Gradient Boosting Это ансамбль деревьев, где: 👉 каждое следующее дерево исправляет ошибки предыдущего 👉 обучение идёт последовательно
Идея: минимизировать ошибку шаг за шагом.Главное отличие 👉 Random Forest → деревья независимы 👉 Gradient Boosting → деревья зависят друг от друга 👉 RF = параллель 👉 GB = последовательность Качество модели В большинстве задач: 👉 Gradient Boosting выигрывает Почему: 👉 лучше улавливает сложные зависимости 👉 оптимизирует ошибку напрямую Поэтому: 👉 XGBoost 👉 LightGBM 👉 CatBoost
Стали стандартом индустрии.Переобучение Random Forest: 👉 устойчив к переобучению 👉 работает «из коробки» Gradient Boosting: 👉 легко переобучается 👉 требует настройки
GB мощнее, но опаснее.Скорость Обучение: 👉 RF → быстрее и параллелится 👉 GB → медленнее (последовательность) Инференс: 👉 часто сопоставим Чувствительность к данным Random Forest: 👉 менее чувствителен к шуму 👉 проще в использовании Gradient Boosting: 👉 чувствителен к: 👉 шуму 👉 выбросам 👉 плохим фичам
Зато раскрывает хороший feature engineering.Когда выбирать Random Forest 👉 нужен быстрый baseline 👉 мало времени на тюнинг 👉 данные шумные 👉 нужна стабильность
«Запустил и работает».Когда выбирать Gradient Boosting 👉 нужна максимальная точность 👉 есть время на тюнинг 👉 данные относительно чистые 👉 важен результат
«Выжать максимум».Главный инсайт
Random Forest — надёжный середняк. Gradient Boosting — инструмент для победы.В одном предложении
Хочешь быстро и стабильно → Random Forest. Хочешь максимум качества → Gradient Boosting.
И ты не понимаешь почему.Что такое Data Leakage Data leakage — это ситуация, когда модель получает доступ к информации из будущего или из target’а, которой не будет в реальном использовании.
Модель читерит, а не учится.Почему это так опасно Потому что leakage: 👉 не очевиден 👉 не даёт ошибок 👉 сильно улучшает метрики
Чем лучше скор — тем подозрительнее.Классические примеры leakage 1. Нормализация до split Сделали scaling на всём датасете, а потом разбили на train/test.
Модель уже «видела» test.2. Target encoding на всех данных Посчитали средний target по категории используя весь датасет.
В train попала информация из test.3. Фичи из будущего Пример: 👉 предсказываем отток 👉 используем действия после момента предсказания
Модель знает будущее.4. Дубликаты Один и тот же объект: 👉 в train 👉 и в test
Модель просто запоминает.5. Неправильный split Временные ряды: 👉 случайный split
Модель обучается на будущем.Как понять, что у тебя leakage Сигналы: 👉 слишком высокий score 👉 огромный разрыв между offline и продом 👉 модель «слишком уверена» 👉 странно важные фичи
Если выглядит слишком хорошо — скорее всего, так и есть.Как защититься 1. Делай split до любых преобразований Сначала: 👉 train / test Потом: 👉 scaling 👉 encoding 👉 feature engineering 2. Следи за временем 👉 train = прошлое 👉 test = будущее 3. Используй pipeline Все трансформации: 👉 обучаются только на train 👉 применяются к test 4. Проверяй фичи Задай вопрос:
Эта информация доступна в момент предсказания?Если нет — удаляй. 5. Делай sanity check 👉 обучись на случайных данных 👉 убери подозрительные фичи
Если качество не падает — что-то не так.Главный инсайт
Data leakage — это не баг. Это иллюзия качества.В одном предложении
Если модель слишком хороша — сначала проверь leakage, а потом радуйся.
XGBoost
LightGBM
CatBoost
…и получить +1% к качеству.
А можно поменять фичи — и получить +20%.
Разберёмся, почему так 👇
Модель учится только на том, что ты ей дал
Garbage in → garbage out Если признаки: - шумные - нерелевантные - плохо отражают задачу 👉 никакая модель не спасёт Даже самая большая.Пример из жизни
Задача: предсказать отток клиентов Фичи: - возраст - город - тариф Модель: ок, но слабый результат Добавили: - время с последнего действия - частоту использования - изменение активности 👉 резкий рост качества Почему? Потому что фичи начали отражать реальное поведениеFeature Engineering = внедрение знаний о задаче
Модель не знает: - бизнес - контекст - причинно-следственные связи Зато ты знаешь. И когда ты создаёшь фичи — ты “вшиваешь” это знание в данные. Модель vs Фичи Что меняем → эффект Модель → +1–5% Гиперпараметры → +1–3% Feature Engineering → +10–50%Где FE особенно решает
- Табличные данные - Маленькие датасеты - Бизнес-задачи 👉 там, где нет миллионов примеров, фичи — это всё Когда модель важнее - CV (изображения) - NLP (тексты) - Speech 👉 там фичи учатся автоматическиПочему все игнорируют FE
Потому что: - это сложно - это долго - нет “магической кнопки” - требует понимания данных Гораздо проще: “давай попробуем ещё одну модель”Главный инсайт ML — это не соревнование моделей. Это соревнование представлений данных. В одном предложении Лучший способ улучшить модель — 👉 перестать тюнить модель и начать тюнить данные
