ru
Feedback
Data Science | Machinelearning [ru]

Data Science | Machinelearning [ru]

Открыть в Telegram

Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Больше

📈 Аналитический обзор Telegram-канала Data Science | Machinelearning [ru]

Канал Data Science | Machinelearning [ru] (@devsp) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 19 795 подписчиков, занимая 6 510 место в категории Технологии и приложения и 33 305 место в регионе Россия.

📊 Показатели аудитории и динамика

С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 19 795 подписчиков.

Согласно последним данным от 30 августа, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило -152, а за последние 24 часа — -11, при этом общий охват остаётся высоким.

  • Статус верификации: Не верифицирован
  • Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 7.98%. В первые 24 часа после публикации контент обычно набирает 4.93% реакций от общего числа подписчиков.
  • Охват публикаций: В среднем каждый пост получает 1 578 просмотров. В течение первых суток публикация набирает 974 просмотров.
  • Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 6.
  • Тематические интересы: Контент сосредоточен на ключевых темах, таких как llm, nvidia, контекст, openai, архитектура.

📝 Описание и контентная политика

Автор описывает ресурс как площадку для выражения субъективного мнения:
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Благодаря высокой частоте обновлений (последние данные получены 31 августа, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.

19 795
Подписчики
-1124 часа
-287 дней
-15230 день
Архив постов
GPU в облаке: RTX 4090, A100, H100, 6000 Blackwell Рендеринг в Blender, CAD-модели и обучение LLM — задачи разные, но упирают
GPU в облаке: RTX 4090, A100, H100, 6000 Blackwell Рендеринг в Blender, CAD-модели и обучение LLM — задачи разные, но упираются в одно: нужный GPU не всегда стоит на рабочей машине. Облачная аренда позволяет взять подходящую карту на час или на длительность проекта, без покупки железа. В Cloud4Y доступна линейка NVIDIA под любые задачи: - RTX 4090 и 5090 — для рендера, моушна и инференса небольших моделей; - A100 (40/80 GB) и H100 (80 GB) — для обучения и инференса LLM; - RTX 6000 Blackwell — для нагрузок следующего поколения. CUDA, PyTorch и TensorFlow уже стоят, удалённый доступ — через RDP, Parsec, NICE DCV. ЦОД уровня Tier III в Москве, Стамбуле и Новосибирске, почасовой биллинг в рублях, инфраструктура соответствует ФЗ-152. Новым клиентам — скидка 20% на GPU NVIDIA, 30 дней бесплатного доступа юридическим лицам. Попробовать #реклама 16+ cloud4y.ru О рекламодателе

Repost from xCode Journal
🐱 GitHub покидают разрабы и опенсорс проекты Разработчик Митчелл Хашимото, создатель популярного эмулятора терминала Ghostty
🐱 GitHub покидают разрабы и опенсорс проекты Разработчик Митчелл Хашимото, создатель популярного эмулятора терминала Ghostty, переносит проект из-за проблем со стабильностью платформы.
«Я пользователь GitHub под номером 1299, присоединился в феврале 2008 года. Я заходил на GitHub почти каждый день в течение более 18 лет. Для меня никогда не было вопроса, куда размещать свои проекты: всегда GitHub. Мне очень грустно это говорить, но пришло время уходить», — пишет он.
✖️ xCode Journal

⚡️Я долго собирал IT-каналы вручную. Добавлял, удалял, снова искал. В итоге понял одно: проблема не в каналах. Проблема в том
⚡️Я долго собирал IT-каналы вручную. Добавлял, удалял, снова искал. В итоге понял одно: проблема не в каналах. Проблема в том, что хорошие раскиданы, а плохие занимают место. Сделал IT Base - папку где только то, что реально читаю сам. Разработка, продукт, стартапы, tech-карьера. Одно касание и ты внутри. 👉🏻 Забирай

Random Forest vs Gradient Boosting — реальное сравнение Самый частый вопрос в табличных данных: что выбрать — Random Forest или Gradient Boosting?
Ответ, который никто не любит: зависит от задачи.
Но давай разберёмся по-честному, без мифов. Что такое Random Forest Это ансамбль деревьев, где: 👉 каждое дерево обучается независимо 👉 используются случайные подвыборки данных и фич
Идея: уменьшить variance за счёт усреднения.
Что такое Gradient Boosting Это ансамбль деревьев, где: 👉 каждое следующее дерево исправляет ошибки предыдущего 👉 обучение идёт последовательно
Идея: минимизировать ошибку шаг за шагом.
Главное отличие 👉 Random Forest → деревья независимы 👉 Gradient Boosting → деревья зависят друг от друга 👉 RF = параллель 👉 GB = последовательность Качество модели В большинстве задач: 👉 Gradient Boosting выигрывает Почему: 👉 лучше улавливает сложные зависимости 👉 оптимизирует ошибку напрямую Поэтому: 👉 XGBoost 👉 LightGBM 👉 CatBoost
Стали стандартом индустрии.
Переобучение Random Forest: 👉 устойчив к переобучению 👉 работает «из коробки» Gradient Boosting: 👉 легко переобучается 👉 требует настройки
GB мощнее, но опаснее.
Скорость Обучение: 👉 RF → быстрее и параллелится 👉 GB → медленнее (последовательность) Инференс: 👉 часто сопоставим Чувствительность к данным Random Forest: 👉 менее чувствителен к шуму 👉 проще в использовании Gradient Boosting: 👉 чувствителен к: 👉 шуму 👉 выбросам 👉 плохим фичам
Зато раскрывает хороший feature engineering.
Когда выбирать Random Forest 👉 нужен быстрый baseline 👉 мало времени на тюнинг 👉 данные шумные 👉 нужна стабильность
«Запустил и работает».
Когда выбирать Gradient Boosting 👉 нужна максимальная точность 👉 есть время на тюнинг 👉 данные относительно чистые 👉 важен результат
«Выжать максимум».
Главный инсайт
Random Forest — надёжный середняк. Gradient Boosting — инструмент для победы.
В одном предложении
Хочешь быстро и стабильно → Random Forest. Хочешь максимум качества → Gradient Boosting.

Станьте специалистом по Data Science высокого уровня на программе от ФКН НИУ ВШЭ Хотите не просто теоретически разбираться в
Станьте специалистом по Data Science высокого уровня на программе от ФКН НИУ ВШЭ Хотите не просто теоретически разбираться в устройстве нейросетях, а и уметь создавать их самостоятельно? Центр непрерывного образования ФКН НИУ ВШЭ запускает полный цикл обучения: от нуля до профессионального уровня. Профессиональная переподготовка «Специалист по Data Science»: 🟣Первая программа профессиональной переподготовки, получившая аккредитацию Альянса в сфере искусственного интеллекта.  🟣Вы пройдете весь путь: от высшей математики и программирования до нейросетей и работы с большими данными. Программа включает курсы по ключевым дисциплинам: 🟣Математика для анализа данных 🟣Алгоритмы и структуры данных 🟣Python для автоматизации 🟣Прикладная статистика для машинного обучения 🟣Машинное и глубинное обучение По окончании обучения вы получите диплом о профессиональной переподготовке от НИУ ВШЭ. Старт: 19 мая. Подробнее о программе 📍

Repost from xCode Journal
😁 Они просто обеспечивают себе рабочие места 💥 xCode Journal
😁 Они просто обеспечивают себе рабочие места 💥 xCode Journal

🤔Как создать автономного ИИ-агента для анализа трендов и поиска точек роста? 📅6 мая в 20:00 приглашаем на открытый вебинар
🤔Как создать автономного ИИ-агента для анализа трендов и поиска точек роста? 📅6 мая в 20:00 приглашаем на открытый вебинар курса «Разработка ИИ-агентов» с Артёмом Ревой. На занятии разберём, как с помощью LangGraph выстраивать сценарий работы агента с несколькими этапами анализа, подключать протокол взаимодействия моделей (MCP) в среде разработки Cursor и расширять возможности интеллектуального помощника. Покажем, как собрать агента для работы с Google Trends: находить аномалии, сравнивать запросы и выявлять перспективные темы. Вы узнаете, как превращать сырые данные в понятные рекомендации и использовать их для выбора направлений с высоким потенциалом роста. 💡Участие бесплатное — регистрируйтесь: https://vk.cc/cXdK5S Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru, erid: 2VtzqvE1tfh

Repost from xCode Journal
👀 Нашли быстрый единый вход во все LLM сразу — GoModel Этот сервис на Go даёт OpenAI-совместимый API поверх всего зоопарка: от OpenAI и Claude до Groq и Ollama. По сути это уже API-шлюз для LLM, как nginx когда-то для веба. Главный кайф — двухслойный кэш ✖️ xCode Journal

Большие данные требуют порядка, а платформа — инструментов, которые этот порядок поддерживают. Такой вывод можно сделать после митапа YTsaurus, посвященного трехлетию выхода платформы в опенсорс. Максим Бабенко — руководитель команды, преподаватель ШАДа и ВШЭ, кандидат физико-математических наук — рассказал о развитии платформы и её возможностях для ML. В Яндексе YTsaurus активно используется как основная инфраструктура для запуска GPU-вычислений. Все обучение моделей и batch-инференс делается при помощи YTsaurus. Команда активно развивает платформу, появились разные вспомогательные инструменты и микросервисы, за последний год вышло много обновлений.

Repost from xCode Journal
🤩 Claude Code можно юзать бесплатно На GitHub появился прокси, который подменяет API и гоняет запросы через бесплатные или л
🤩 Claude Code можно юзать бесплатно На GitHub появился прокси, который подменяет API и гоняет запросы через бесплатные или локальные модели. Запросы перенаправляются к NVIDIA NIM (~40 запросов в минуту бесплатно), OpenRouter, где более 100 моделей, а также через LM Studio или llama.cpp. Весь остальной функционал на месте — агентский режим, работа с файлами и другие фичи будут доступны. ✖️ xCode Journal

Роскошный максимум: получить приглашение в команду SberAds за один день! 😉 Сделать это можно на One Day Offer* для Data Anal
Роскошный максимум: получить приглашение в команду SberAds за один день! 😉 Сделать это можно на One Day Offer* для Data Analyst**, который пройдёт уже 25 апреля. Сбер ждёт специалистов, которые готовы: ✔️ создавать и улучшать модели для real-time аукционов ✔️ трансформировать SberAds — вывести на пик эффективности, качества и релевантности рекламы ✔️ стать частью команды из 8000+ коллег (это вау! 🤩) Занимай место в проекте мечты! * One Day Offer — предложение о работе за один день. ** Data Analyst — аналитик данных.

Repost from xCode Journal
😁 Даёшь опенсорс 💥 xCode Journal
😁 Даёшь опенсорс 💥 xCode Journal

На бесплатном вебинаре курса: • Разберём, как устроено отслеживание в промышленности, как связаны алгоритмы компьютерного зрения, геометрия сцены и ограничения реального времени на роботах. • Покажем проблемы в реальных условиях: движение камеры, смаз, смена масштаба, задержки. Обсудим связь зрения, геометрии камеры и механики подвеса. Для кого: Специалисты по компьютерному зрению с опытом 1–3 года, Python-разработчики с базой в нейросетях, а также те, кто изучал CV самостоятельно и хочет понять прикладные задачи. Результаты: — Поймёте, как проектируется система отслеживания человека на подвижной камере в реальном времени. — Узнаете ограничения при работе с видео на роботах и мобильных платформах. — Сможете применять подход в видеоаналитике, робототехнике и умных камерах. Спикер: Анастасия Капралова, генеральный директор kapralov ai, 8+ лет в ИИ-разработке Регистрируйтесь сейчас — напомним накануне: регистрация Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576

Data Leakage: как незаметно сломать модель Самая коварная ошибка в ML — это не плохая модель. Это data leakage. Потому что: 👉 модель показывает идеальные метрики 👉 ты радуешься 👉 выкатываешь в прод 👉 всё разваливается
И ты не понимаешь почему.
Что такое Data Leakage Data leakage — это ситуация, когда модель получает доступ к информации из будущего или из target’а, которой не будет в реальном использовании.
Модель читерит, а не учится.
Почему это так опасно Потому что leakage: 👉 не очевиден 👉 не даёт ошибок 👉 сильно улучшает метрики
Чем лучше скор — тем подозрительнее.
Классические примеры leakage 1. Нормализация до split Сделали scaling на всём датасете, а потом разбили на train/test.
Модель уже «видела» test.
2. Target encoding на всех данных Посчитали средний target по категории используя весь датасет.
В train попала информация из test.
3. Фичи из будущего Пример: 👉 предсказываем отток 👉 используем действия после момента предсказания
Модель знает будущее.
4. Дубликаты Один и тот же объект: 👉 в train 👉 и в test
Модель просто запоминает.
5. Неправильный split Временные ряды: 👉 случайный split
Модель обучается на будущем.
Как понять, что у тебя leakage Сигналы: 👉 слишком высокий score 👉 огромный разрыв между offline и продом 👉 модель «слишком уверена» 👉 странно важные фичи
Если выглядит слишком хорошо — скорее всего, так и есть.
Как защититься 1. Делай split до любых преобразований Сначала: 👉 train / test Потом: 👉 scaling 👉 encoding 👉 feature engineering 2. Следи за временем 👉 train = прошлое 👉 test = будущее 3. Используй pipeline Все трансформации: 👉 обучаются только на train 👉 применяются к test 4. Проверяй фичи Задай вопрос:
Эта информация доступна в момент предсказания?
Если нет — удаляй. 5. Делай sanity check 👉 обучись на случайных данных 👉 убери подозрительные фичи
Если качество не падает — что-то не так.
Главный инсайт
Data leakage — это не баг. Это иллюзия качества.
В одном предложении
Если модель слишком хороша — сначала проверь leakage, а потом радуйся.

Ваша команда аналитики тонет в авралах? Задачи копятся, данным не доверяют, аналитики заняты ручными выгрузками вместо реальн
Ваша команда аналитики тонет в авралах? Задачи копятся, данным не доверяют, аналитики заняты ручными выгрузками вместо реальной аналитики — знакомо? 22 апреля в 19:00 МСК приходите на живой практикум «Порядок в данных» от Павла Беляева, тимлида дата-аналитики в Яндекс.eLama. За 1 вечер разберём: — Как выстроить спринт-планирование и расставить приоритеты без конфликтов; — Как внедрить мониторинг качества данных и регламент обработки инцидентов; — Как автоматизировать рутину через Python + Airflow; — Как освободить аналитиков от бесконечных разовых выгрузок. Это работающая система от практика, который управляет командой аналитики в одной из крупнейших рекламных платформ страны. 🎁 Бонус для каждого участника: гайд «15 промптов для работы аналитика» Участие бесплатное, количество мест ограничено. ➡️Зарегистрироваться: https://tglink.io/1df75bbf05e794 Реклама. ООО "АЙТИ РЕЗЮМЕ". ИНН 4025460134. erid: 2W5zFFy8eVX

Как мы автоматизировали Code Review с помощью LLM ⚡️ В Авито большой поток пул-реквестов. Разработчики регулярно отвлекаются
Как мы автоматизировали Code Review с помощью LLM ⚡️ В Авито большой поток пул-реквестов. Разработчики регулярно отвлекаются на ревью чужого кода, отчего быстрее устают. К тому же у каждого ревьюера своё представление о том, как делать правильно. Мы автоматизировали часть проверок с помощью LLM, чтобы освободить разработчиков от этой задачи. Модель анализирует код и находит максимум потенциальных ошибок, но благодаря валидации оставляет комментарии только по делу. Разработчики получают полезную обратную связь и могут сосредоточиться на основной работе. О том, как устроена система, почему выбрали селфхостинг и какие метрики отслеживаем, рассказывает Марк Каширский, DS-инженер команды LLM Авито. Прочитать подробности на Хабре

Repost from xCode Journal
Заводчане в Индии носят камеры на голове, чтобы на этих видео потом могли обучать роботов Для корпораций это фактически бесплатно, а датасет выходит уникальным — таких данных нет в интернете и их невозможно сгенерировать синтетически. Так что да, люди сами помогают создавать себе замену. ✖️ xCode Journal

🦾 Деревья решений для задач классификации и регрессии Машинное обучение кажется сложным, и часто всё ломается на базе: алгор
🦾 Деревья решений для задач классификации и регрессии Машинное обучение кажется сложным, и часто всё ломается на базе: алгоритмы изучаются поверхностно, без понимания, как они реально работают. На открытом уроке разберём один из ключевых алгоритмов — дерево решений. Пошагово покажем, как оно устроено, как принимает решения и как применяется в задачах классификации и регрессии. Без перегрузки формулами — с акцентом на понимание и практику. Вы увидите, как обучаются такие модели и где они действительно полезны. Этот алгоритм — хорошая точка входа в машинное обучение и основа для более сложных подходов. 🚀 ➡️ Встречаемся 29 апреля в 20:00 МСК в преддверии старта курса «Машинное обучение. Специализация». Зарегистрируйтесь и разберитесь, как алгоритмы принимают решения на данных: https://vk.cc/cWYsHz Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576

Компьютер мечты с доставкой по всей России Привет! На связи Royal Computers✨Если нужна качественная сборка мощного пк для игр и работы, тебе сюда. Мы собираем компьютеры в Санкт-Петербурге и отправляем по всей стране. На сайте найдешь то, что в наличии в нашем шоуруме прямо сейчас, а кроме этого там есть сбалансированный конфигуратор, который поможет рассчитать любую сборку. Перейти на сайт #реклама royal-computers.ru О рекламодателе

Feature Engineering важнее выбора модели Самый непопулярный факт в ML: модель — это не главное. Можно часами выбирать между:
Feature Engineering важнее выбора модели Самый непопулярный факт в ML: модель — это не главное. Можно часами выбирать между: XGBoost LightGBM CatBoost …и получить +1% к качеству. А можно поменять фичи — и получить +20%. Разберёмся, почему так 👇 Модель учится только на том, что ты ей дал
Garbage in → garbage out Если признаки: - шумные - нерелевантные - плохо отражают задачу 👉 никакая модель не спасёт Даже самая большая.
Пример из жизни
Задача: предсказать отток клиентов Фичи: - возраст - город - тариф Модель: ок, но слабый результат Добавили: - время с последнего действия - частоту использования - изменение активности 👉 резкий рост качества Почему? Потому что фичи начали отражать реальное поведение
Feature Engineering = внедрение знаний о задаче
Модель не знает: - бизнес - контекст - причинно-следственные связи Зато ты знаешь. И когда ты создаёшь фичи — ты “вшиваешь” это знание в данные. Модель vs Фичи Что меняем → эффект Модель → +1–5% Гиперпараметры → +1–3% Feature Engineering → +10–50%
Где FE особенно решает
- Табличные данные - Маленькие датасеты - Бизнес-задачи 👉 там, где нет миллионов примеров, фичи — это всё Когда модель важнее - CV (изображения) - NLP (тексты) - Speech 👉 там фичи учатся автоматически
Почему все игнорируют FE
Потому что: - это сложно - это долго - нет “магической кнопки” - требует понимания данных Гораздо проще: “давай попробуем ещё одну модель”
Главный инсайт ML — это не соревнование моделей. Это соревнование представлений данных. В одном предложении Лучший способ улучшить модель — 👉 перестать тюнить модель и начать тюнить данные