Data Portal | DS & ML
Всё самое интересное из мира Data Science и машинного обучения Cотрудничество: @devmangx Автор: @ScienceLLM
Mostrar más📈 Análisis del canal de Telegram Data Portal | DS & ML
El canal Data Portal | DS & ML (@llmscience) es un actor destacado. Actualmente la comunidad reúne a 10 463 suscriptores, ocupando la posición 11 247 en la categoría Tecnologías y Aplicaciones y el puesto 60 231 en la región Rusia.
📊 Métricas de audiencia y dinámica
Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 10 463 suscriptores.
Según los últimos datos del 05 octubre, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de 2 082, y en las últimas 24 horas de 5, conservando un alto alcance.
- Estado de verificación: No verificado
- Tasa de interacción (ER): El promedio de interacción de la audiencia es 21.93%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 13.31% de reacciones respecto al total de suscriptores.
- Alcance de las publicaciones: Cada publicación recibe en promedio 2 295 visualizaciones. En el primer día suele acumular 1 393 visualizaciones.
- Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 0.
- Intereses temáticos: El contenido se centra en temas clave como llm, контекст, токенов, claude, архитектура.
📝 Descripción y política de contenido
El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Всё самое интересное из мира Data Science и машинного обучения
Cотрудничество: @devmangx
Автор: @ScienceLLM”
Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 06 octubre, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.
Carga de datos en curso...
| Fecha | Crecimiento de Suscriptores | Menciones | Canales | |
| 06 octubre | 0 | |||
| 05 octubre | +8 | |||
| 04 octubre | +9 | |||
| 03 octubre | +8 | |||
| 02 octubre | +12 | |||
| 01 octubre | +58 |
| 2 | «Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965 | 930 |
| 3 | Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.
В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk | 1 037 |
| 4 | «Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu | 1 126 |
| 5 | Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Обучать хорошие небольшие модели может кто угодно. 😋 | 1 255 |
| 6 | Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел.
CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.
И это не просто учебник.
Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.
В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.
Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.
Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.
Всё здесь:
mlsysbook.ai
GitHub: https://github.com/harvard-edge/cs249r_book | 1 257 |
| 7 | «Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям.
Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.
Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.
Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.
Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.
Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.
web.stanford.edu/~jurafsky/slp3/ | 1 238 |
| 8 | Reasoning from Scratch, шестой выпуск. Себастьян Рашка
Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO.
00:00 — Введение
01:54 — Чем reasoning-модель отличается от обычной
04:25 — Цепочки рассуждений и возможности модели
08:29 — Награды за точность и формат ответа
11:34 — «Aha-моменты» и обучение DeepSeek-R1
14:41 — Глубина рассуждений и длина ответа
18:38 — RLHF и RLVR
23:04 — GRPO против PPO
26:40 — Объяснение GRPO на аналогии с готовкой
31:43 — KL-компонент и упрощённый GRPO
35:04 — Загрузка предобученной модели
36:07 — Загрузка обучающих данных MATH
39:26 — Генерация ответов модели
46:30 — Расчёт проверяемых наград
49:55 — Расчёт преимуществ
51:54 — Логарифмические вероятности токенов и последовательностей
55:29 — Реализация логарифмических вероятностей последовательностей
57:37 — Исправление ошибки режима инференса
1:02:24 — Расчёт функции потерь GRPO
1:04:37 — Собираем один шаг GRPO целиком
1:09:19 — Цикл обучения GRPO
1:12:57 — Настройки обучения, логирование и чекпоинты
1:17:24 — Запуск обучения и разбор результатов
1:19:28 — Загрузка и оценка чекпоинтов
1:22:33 — Результаты MATH-500 и стабильность обучения
1:24:05 — Требования к памяти и следующие шаги
https://www.youtube.com/watch?v=237Hf7Q3lgg | 1 240 |
| 9 | Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn.
Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления.
Бесплатно, без регистрации.
https://vizlearn.in | 1 284 |
| 10 | Modern Robotics: Mechanics, Planning, and Control.
Сохраните на потом.
Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press.
Внутри:
- конфигурационные пространства
- кинематика
- динамика
- генерация траекторий
- планирование движения
- управление роботами
По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром.
https://hades.mech.northwestern.edu/images/7/7f/MR.pdf | 1 331 |
| 11 | «Изучение математики. Почему память, практика и техника важнее таланта»
Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру.
Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить.
https://algebrica.org/learning-mathematics/ | 1 378 |
| 12 | «Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса.
В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации.
Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение.
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf | 1 556 |
| 13 | Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям.
В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN.
https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf | 1 677 |
| 14 | Гайд по RL от Unsloth.
В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO.
Полный материал — от базового уровня до продвинутого.
Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide | 1 417 |
| 15 | DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей.
Она называется DeepGEMM.
Библиотека оптимизирует матричные операции, на которых работают большие языковые модели, и позволяет эффективнее использовать NVIDIA Hopper и Blackwell.
Поддерживаются FP8, FP4 и BF16. Есть оптимизации для моделей с архитектурой Mixture-of-Experts, совмещение обмена данными между GPU с вычислениями и компиляция ядер прямо во время выполнения, без отдельной сборки CUDA при установке.
По данным DeepSeek, DeepGEMM на ряде размеров матриц показывает производительность на уровне или выше специализированных библиотек, вручную оптимизированных экспертами.
https://github.com/deepseek-ai/DeepGEMM#interfaces | 1 510 |
| 16 | Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh
Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.
Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh
А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh
И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh | 1 567 |
| 17 | Нельзя просто выбрать модель и видеокарту и считать, что на этом всё.
Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.
Начнём с самого цикла.
Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.
Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.
У этого цикла есть две фазы, и это разные задачи.
Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.
Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».
Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.
Движок инференса — это не сама модель.
Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.
Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.
Серьёзные движки ещё и выбирают ядра.
Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.
На бумаге математика может быть одинаковой. Ядро — разное.
Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.
Квантование — это не один переключатель.
Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.
Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.
Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.
Вот конкретный пример.
Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.
Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.
Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.
Это другой путь выполнения ядер.
RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.
Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.
Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.
Это не одно и то же.
Поэтому prefill и decode тоже не получают одинаковый выигрыш.
Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.
Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.
Не тестируйте просто «модель».
Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Есть ещё одна вещь, которую часто неправильно понимают из-за слова Blackwell.
Это маркетинговое название для нескольких разных чипов, которые не обязаны выполнять одни и те же ядра. Серверный B200 — это не RTX 5090. RTX 5090 — это не Spark. Spark — это не Thor.
Поддержка инструк | 1 579 |
| 18 | «Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов.
В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.
В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.
Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.
https://louis.pressbooks.pub/trigonometry/ | 1 551 |
| 19 | Подборка с объяснениями ключевых концепций и научных работ по машинному обучению:
https://github.com/dair-ai/ML-Papers-Explained | 1 647 |
| 20 | Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей.
Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.
Код опубликован под MIT, доступны и веса для тестирования.
https://github.com/Friedrich-M/UniMate | 1 759 |
