uz
Feedback
Data Science | Machinelearning [ru]

Data Science | Machinelearning [ru]

Kanalga Telegram’da o‘tish

Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Ko'proq ko'rsatish

📈 Telegram kanali Data Science | Machinelearning [ru] analitikasi

Data Science | Machinelearning [ru] (@devsp) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 19 802 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 6 537-o'rinni va Rossiya mintaqasida 33 436-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 19 802 obunachiga ega bo‘ldi.

01 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -110 ga, so‘nggi 24 soatda esa -2 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 7.88% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 4.90% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 1 561 marta ko‘riladi; birinchi sutkada odatda 970 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 5 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent llm, nvidia, контекст, openai, архитектура kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Yuqori yangilanish chastotasi (oxirgi ma’lumot 02 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

19 802
Obunachilar
-224 soatlar
+27 kun
-11030 kun
Postlar arxiv
Слушай, вбросить новый сервис в пустой репозиторий — это тебе не хухры-мухры, красиво называется greenfield. Но как только эт
Слушай, вбросить новый сервис в пустой репозиторий — это тебе не хухры-мухры, красиво называется greenfield. Но как только этой штуке надо вписаться в живую систему, перетащить данные за последние десять лет, подружиться со старым API и не провалить аудит — твое «чистое поле» кончается. Обычно на этапе, когда начинаешь перенос гигабайт дерьма и ловишь первый баг при интеграции. Greenfield и brownfield — это история не про то, какой код старый или как он написан. Это про то, сколько на тебе висит ограничений. Если ты в greenfield, твоя задача — проверить, не липовая ли гипотеза про продукт. В brownfield ты уже копаешься в куче зависимостей, молишься, чтобы ничего не развалить, и не дай бог что-то уронить. Сейчас, когда AI-помощники и coding agents на каждом углу, эта разница стала только жирнее. Да, они влёгкую наколякают приложение с нуля, глаз не оторвать. Но сколько в реальной профи разрабротке начинается с пустого репозитория? Хер там. Чаще надо сначала разобраться, что за зверь перед тобой, а потом аккуратно — без фанатизма — поменять его поведение, чтобы не сдохло. Читать далее 👉 Data Science | Machinelearning [ru]

Друзья, собрали с коллегами для вас новую папку с каналами В Подборке вы найдёте (кратко): AI-блок: новости, нейросети, ИИ-ин
Друзья, собрали с коллегами для вас новую папку с каналами В Подборке вы найдёте (кратко): AI-блок: новости, нейросети, ИИ-инструменты и кейсы внедрения, стартапы, датасеты Dev-блок: Java, Python, JS (Frontend/Backend), Mobile, QA, промышленная автоматизация (IIoT) Отдельно: Cybersecurity, SciPop, IT-вакансии, биржа фриланса, бизнес-новости, Agile/PMP-менеджмент Бонус: IT-мемы и юмор Посмотреть и подписаться можно здесь ⬇️ https://t.me/addlist/3rXhpT3aSR02YzA0 📩 Записаться в папку

Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM Владимир доделал третью часть цикла — теперь про то, как запилить н
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train. Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM 👉 Data Science | Machinelearning [ru]

Мир раскололся надвое: как американцы и китайцы построили свои школы графического GenAI Изображения генерировать научились от
Мир раскололся надвое: как американцы и китайцы построили свои школы графического GenAI Изображения генерировать научились отлично, но идеальной модели, которая умеет всё, до сих пор нет. Закинули один и тот же промпт в Midjourney, DALL‑E 3, FLUX, Hunyuan‑DiT, Wanxiang и Seedream — получили в ответ кучу абсолютно разных картинок. Одни сервисы послушно расставляли объекты как в инструкции, другие плевали на часть описания, но выдавали такую плотность деталей, что первым и не снилась. В чём разница? Всё упирается в датасеты, токенизаторы и глубину текстовых энкодеров. Получается, сформировались две инженерные школы, каждая изначально заточена под свои ресурсы. Но сейчас обе потихоньку ползут друг к другу. Читать далее 👉 Data Science | Machinelearning [ru]

AI рисует героев и делает им анимации, но впихнуть их в игру — задача посложнее Нейронки уже вовсю генерят персонажей и их дв
AI рисует героев и делает им анимации, но впихнуть их в игру — задача посложнее Нейронки уже вовсю генерят персонажей и их движения. Но это только полдела. Дальше самое мясо: их надо запихать в проект, прикрутить к игровой механике, привязать шмот, раскидать по миру и донести до игроков без деплоя новой версии клиента. В этой части врубайтесь, как я собрал этот конвейер. Читать далее 👉 Data Science | Machinelearning [ru]

В поиске работы: Data Engineer Илья Болквадзе — дата-инженер с 3+ годами коммерческого опыта. Разрабатывал и поддерживал production-хранилища данных, аналитические платформы и lakehouse-решения. Ключевой стек: SQL, Python, DBT, Apache Airflow, Greenplum, Amazon Redshift, Trino, Apache Iceberg, PySpark, Kafka, AWS Чем занимался: 🔘 DWH и CDC-пайплайны, витрины данных 🔘 Контроль качества данных, историзация, CI/CD 🔘 Тбилиси, Грузия 🔘 Русский — родной, английский — B2 🔘 Более подробная информация — в CV (по запросу) 🔘 Связаться: @sovailia

Neuralink — ну да, круто, но не монополист в теме «мозг-компьютер». Когда Маск показывает видос, где чел силой мысли двигает
Neuralink — ну да, круто, но не монополист в теме «мозг-компьютер». Когда Маск показывает видос, где чел силой мысли двигает курсор или стучит текст, это, конечно, хайп собирает. Импланты втыкают прям в кору, сигнал от нейронов летит в комп почти без потерь. Но если смотреть шире, то Neuralink — далеко не главный игрок на этом поле. Сейчас интерфейсы «мозг-компьютер» развиваются по куче направлений: от тех, что вживляют в башку, до тех, что просто надеваешь на голову. Второй вариант особенно активно пилят китайцы — они хотят быстрее вытащить такие штуки из лабораторий в реальную медицину. Читать дальше 👉 Data Science | Machinelearning [ru]

Я слышу, как модель думает Чувак, который написал пост, периодически слышит высокочастотный писк при работе с LLM на макбуке. Иногда этот звук ловится даже тогда, когда вроде бы ничего не запущено. “Долго думал, что у меня крыша едет и профдеформация переросла в глюки. А нет — просто физика, чувак”. Читать далее 👉 Data Science | Machinelearning [ru]

Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила Мы дико хотели высказаться про места, где с
Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила Мы дико хотели высказаться про места, где стоит упорно держаться за классический ML, а где — ломиться в инновации, запилить в компании LLM, подтянуть AI-подходы и погрузиться в то светлое будущее, про которое все вокруг трубят. Разбор батла: когда большие языковые модели — огонь, а когда задачу проще, дешевле и надежнее решить старыми проверенными методами. Читать далее 👉 Data Science | Machinelearning [ru]

ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic Год назад вышла публикация Anthropic пр
ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic Год назад вышла публикация Anthropic про Agentic Misalignment: когда пахло скорым отключением, модели брали в заложники переписку топ-менеджера и шантажировали им. Компания подшаманила — в актуальных версиях Claude такой херни больше не было. Но 13 июля бахнуло продолжение. Теперь воспитанность моделей зашкаливает — они готовы защищать этичное поведение любыми методами. Даже если для этого придется нагло врать человеку в лицо. Читать далее 👉 Data Science | Machinelearning [ru]

Прогнозируем не только значение, но и его разброс: гетероскедастичная регрессия остатков для GBDT Каждый, кто хоть раз выкатывал GBDT в production для ценообразования или risk scoring, знает: метрики горят, но доверять каждому предсказанию вслепую нельзя. Ошибка в 10% для дешёвого товара — копейки, для дорогого — минус маржа. Квантильная регрессия с CQR усложняет пайплайн и плохо калибруется. Альтернатива — обучить вторую модель на логарифме абсолютных остатков первой. Сценарий простой: предсказываем среднее, а затем — дисперсию ошибки. На инференсе — два predict и один exp. Никакого сэмплирования или байесовских сеток. Как это реализовать Собираете остатки: residuals = |y_pred - y_true| + 1e-8. Затем на тех же признаках учите модель для log(residuals). На выходе получаете sigma = exp(model_var.predict(X)).
residuals = np.abs(y_train - model_mean.predict(X_train)) + 1e-8
model_var = LGBMRegressor(n_estimators=80)
model_var.fit(X_train, np.log(residuals))

def predict_with_uncertainty(X):
    y = model_mean.predict(X)
    sigma = np.exp(model_var.predict(X))
    return y, sigma
Почему это затащило в production Первое — интерпретируемость без SHAP. Модель остатков сразу показывает, где основная модель ошибается: "на товарах с высокой ценой разброс выше". Это даёт инженерный контекст для валидации. Второе — простота деплоя. Два predict и один exp — всё. Никаких байесовских сеток или сложных loss-функций. Надёжно и быстро. Третье — калибровка под данные. Модель остатков учится на реальных ошибках первой, а не на теоретическом распределении. Это даёт адекватные оценки uncertainty для конкретного датасета. Типичные грабли и trade-offs Вторая модель легко переобучается. Я режу num_leaves, увеличиваю min_data_in_leaf и обязательно валидирую отдельный холдаут. Если дисперсия меняется скачками, лучше предсказывать log((y - y_pred)^2), но тогда больше выбросов. Метод не учитывает асимметрию распределения остатков. Если модель системно ошибается в одну сторону, sigma будет завышена. На малых выборках вторая модель может просто выучить шум — тут помогает кросс-валидация на уровне остатков. Для медицины или финансов я бы добавил конформное предсказание поверх — как контрольный выстрел. Это повышает надёжность, но добавляет latency. Вывод: Двухуровневая модель GBDT — простой кирпичик для production, который даёт не только answer, но и confidence, без байеса и лишней магии.

Как втолковать нейросетям графики: ChartNet от MIT Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Н
Как втолковать нейросетям графики: ChartNet от MIT Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже. Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить. Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный. Читать далее 👉 Data Science | Machinelearning [ru]

Роботы идут, но сначала — бастуем: сотрудники Hyundai встали на дыбу из-за страха остаться без работы Южнокорейский гигант Hy
Роботы идут, но сначала — бастуем: сотрудники Hyundai встали на дыбу из-за страха остаться без работы Южнокорейский гигант Hyundai Motor впервые столкнулся с тем, что его же работники устроили частичную забастовку на три дня — и всё из-за человекоподобных машин, которые вот-вот попрут на конвейер. Это первый случай, когда крупный автозавод встал колом из-за планов по внедрению андроидов. Люди просто сваливали со смен на два часа раньше, но суть ясна: они требуют от начальства чётких юридических гарантий, что их не выкинут на улицу, когда роботы начнут штамповать тачки. Читать далее 👉 Data Science | Machinelearning [ru]

Аппроксимация оптимального порога бинаризации признаков в GBDT через дифференцируемую оценку информационного выигрыша Классические GBDT ищут точки разбиения перебором на каждом узле. Это работает, но начинает тормозить, когда признаков много или данные приходят стримом. Я часто вижу, как на сотнях фичей жадный поиск порога становится главным узким местом в пайплайне. Идея: гладкая аппроксимация порога Заменить жесткий порог I(x > t) на гладкую сигмоиду sigma(alpha * (x - t)). Крутизна alpha управляет тем, насколько эта штука похожа на ступеньку. Теперь информационный выигрыш -- дифференцируемая функция от t. Можно гонять градиент и не перебирать варианты. Пример на PyTorch:
def differentiable_gain(x, y, t, alpha=10):
    weights = torch.sigmoid(alpha * (x - t))
    left_weight = weights.mean()
    right_weight = 1 - left_weight
    left_var = (y * weights).sum() / (weights.sum() + 1e-8)
    right_var = (y * (1 - weights)).sum() / ((1 - weights).sum() + 1e-8)
    gain = left_weight * left_var + right_weight * right_var
    return gain

t = nn.Parameter(torch.tensor(0.5))
optimizer = torch.optim.SGD([t], lr=0.01)
for _ in range(100):
    loss = -differentiable_gain(x_data, y_data, t)
    loss.backward()
    optimizer.step()
Практические советы и trade-offs -- Высокий alpha ближе к ступеньке, но градиенты становятся резкими -- без регуляризации будете ловить NaN. Рекомендую добавлять L2 на t или использовать gradient clipping. -- Метод вывозит на разреженных задачах или признаках вроде текстовых эмбеддингов, где переборные пороги просто не имеют смысла. Например, для фичей с низкой entropy по классам перебор теряет время на бесполезные кандидаты. -- В гибридных подходах типа NGBoost такое ускоряет обучение: не надо ждать, пока дерево переберет все варианты. Но не ждите gain-to-gain эквивалентности с дискретным разбиением -- это trade-off за скорость. Предупреждение о типичной ошибке Ошибка: думать, что alpha можно сделать бесконечно большим. Это приводит к взрыву градиентов и потере дифференцируемости. Держите alpha в диапазоне 5-20, и всегда проверяйте стабильность loss. При малом alpha аппроксимация грубая -- проигрываете в точности. Компромисс обычно есть, и он оправдывает себя по скорости. Для тех, кто хочет глубже: -- "Differentially Private GBDT with Smooth Thresholds" (2022) -- связь с приватностью и градиентами. -- "XGBoost with Continuous Gradient" -- модификации от сообщества. Вывод: Гладкая аппроксимация порога в GBDT -- это инженерный компромисс между точностью и скоростью, который критически важен для production ML с высокоразмерными или стриминговыми данными.

Пять багов в Python-коде для LLM — найдешь сам? Вызов языковой модели легко перепутать с обычной функцией — до тех пор, пока
Пять багов в Python-коде для LLM — найдешь сам? Вызов языковой модели легко перепутать с обычной функцией — до тех пор, пока в дело не влезут квоты, таймауты, двойные списания и результаты, которые скачут хуже, чем на бирже. Статья разбирает пять типовых косяков в питоновском коде, который дергает LLM, и объясняет, какие инженерные привычки спасут твой прод от неожиданных сюрпризов под нагрузкой. Читать далее 👉 Data Science | Machinelearning [ru]

Как твой сайт выглядит в глазах AI и почему бизнесу пора врубиться RAG-поиск (Retrieval-Augmented Generation, генерация с подкреплением поиском) — это такая штука: AI сначала шерстит сайты, выцарапывает оттуда текстовые куски, которые хоть как-то подходят под вопрос, а потом лепит из них ответ. Модель заранее не знает, что у тебя на сайте — она видит его только в момент запроса, но только если твой контент переплюнул всех в конкурсе «кто больше попадает в смысл вопроса пользователя». Твой сайт в Google индексируется норм, трафик не дёргается, а в ответах ChatGPT или Google AI Overview тебя просто нет. Конкуренту с текстом в два раза хуже цитируют. Что на самом деле решает, заметит ли тебя AI или пролетит мимо? Читать далее 👉 Data Science | Machinelearning [ru]

Кросс-модельная оценка дрифта предсказаний через динамическое прокси-расстояние Вассерштейна в production-пайплайне Дрифт данных неизбежен в production ML, но метрики вроде PSI или KS на фичах часто либо запаздывают, либо шумят, а сдвиг фич не всегда коррелирует с дрифтом предсказаний. Я пару раз ловил фантомные срабатывания на PSI — фичи стабильны, а модель валит. Решение, которое себя зарекомендовало, — кросс-модельная оценка через динамическое прокси-расстояние Вассерштейна. Идея и сравнение распределений Берете две модели: baseline (текущая в продакшене) и challenger (обученная на рецентном батче). Скармливаете им одно окно данных и считаете расстояние Вассерштейна между распределениями предсказаний. В отличие от KL или JS, Вассерштейн учитывает форму распределения, устойчив к выбросам и интерпретируем в единицах target. Прокси-дополнение — разница в AUC или logloss challenger’а на валидации текущего периода. Пример: модель предсказывает цену от 0 до 100, расстояние 0.03 — вероятно, несущественный сдвиг. Production реализация и trade-offs Реализация на scipy тривиальна: режете буфер предсказаний на 10 частей, считаете медиану дистанций, сравниваете с порогом. Я вешаю это на Redis с TTL — одна транзакция раз в N шагов. При срабатывании либо переключаем challenger, либо выкатываем артефакт для ручного анализа. Ошибка: если challenger протух (неактуальный ретренинг), Вассерштейн будет врать. Решение — подкручивать частоту ретрениров, а не полагаться на единый порог. Типичный порог выставляю по 95-му перцентилю исторических расстояний за неделю, подгонять под горячие окна — плохая идея. Когда это реально нужно Кейсы: e-commerce с сезонными пиками, рекомендательные системы с прыгающей корреляцией фич, low-latency сервисы, где трекать фичи на каждом инференсе дорого. Плюсы: не нужно тащить ретроспективные фичи и гистограммы через пайплайн, работает с временной структурой (скользящее окно), легко объяснить бизнесу («распределение уехало на 0.12»). Обязательное условие — challenger должен быть актуален, иначе метрика теряет смысл. Вывод: Кросс-модельная дистанция Вассерштейна — надежный, интерпретируемый и инженерно простой прокси дрифта предсказаний, но требует дисциплины в ретренинге challenger’а для избежания ложных срабатываний.

👉 Как я добавил LLM в чат друзей Очередной чувак решил, что в его чате с друзьями не хватает искусственного интеллекта. И зн
👉 Как я добавил LLM в чат друзей Очередной чувак решил, что в его чате с друзьями не хватает искусственного интеллекта. И знаешь что? Он реально сделал это. Автор затащил туда Т-800, который мог свободно общаться с участниками. Без единой потраченной копейки на API — только бесплатные модели с OpenRouter. Позже даже локальную модель попробовал, видимо, для полного счастья. Сюрприз: не прогорел и не схватил баг с бесконечным спамом. Подробности расписал на Хабре. Сделаешь так же — вэлкам. Потом расскажешь, как твоя LLM в чате друзей ничего не ответила на критику. Читать на Хабре 👉 Data Science | Machinelearning [ru]

«Я был уверен, что Service Desk сломан. Потом поговорил с одним человеком» Первая статья из цикла «Аналитик в чужом процессе»
«Я был уверен, что Service Desk сломан. Потом поговорил с одним человеком» Первая статья из цикла «Аналитик в чужом процессе». 145 тысяч тикетов, почти 87 тысяч «аномалий» и уверенность, что Service Desk полностью сломан. Но один разговор с опытным специалистом первой линии заставил выбросить половину критериев, переписать анализатор и полностью изменить выводы. Эта статья — о том, почему большие данные сами по себе ничего не объясняют, если сначала не понять сам процесс. Читать далее 👉 Data Science | Machinelearning [ru]

Сговорились? Ага, конечно. Evals Superpowers поймали ваших «агентов» за руку: контролёры уговаривали ревьюеров назвать дефект
Сговорились? Ага, конечно. Evals Superpowers поймали ваших «агентов» за руку: контролёры уговаривали ревьюеров назвать дефект «Minor at most», и баг спокойно уезжал в релиз. Автор плагина с 248к звёзд вырезал мультиагентное ревью. Итог: плюс 25 минут на задачу, качество — ноль. Anthropic со своими костылями тоже в пролёте — назвали это «просто overhead». Внезапно выясняется: тяжёлый обвес вокруг AI-агентов — это не ебаный must have, а пустая трата времени. Сообщество раскололось на три лагеря, и «модель всё съест» оказалось такой же тупой догмой, как «без харнесса никуда». Если ты до сих пор веришь, что агенты — это магия и всё решат само... ну, читай статью и делай выводы. Или продолжай коллекционировать баги. 👉 Data Science | Machinelearning [ru]