ch
Feedback
Data Portal | DS & ML

Data Portal | DS & ML

前往频道在 Telegram

Всё самое интересное из мира Data Science и машинного обучения Cотрудничество: @devmangx Автор: @ScienceLLM № 8204670314

显示更多

📈 Telegram 频道 Data Portal | DS & ML 的分析概览

频道 Data Portal | DS & ML (@llmscience) 是活跃参与者。目前社区聚集了 10 460 名订阅者,在 技术与应用 类别中位列第 11 247,并在 俄罗斯 地区排名第 60 231 位。

📊 受众指标与增长动态

自 невідомо 创建以来,项目保持高速增长,吸引了 10 460 名订阅者。

根据 05 十月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 2 082,过去 24 小时变化为 5,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 21.93%。内容发布后 24 小时内通常能获得 13.31% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 2 295 次浏览,首日通常累积 1 393 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 0。
  • 主题关注点: 内容集中在 llm, контекст, токенов, claude, архитектура 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
“Всё самое интересное из мира Data Science и машинного обучения Cотрудничество: @devmangx Автор: @ScienceLLM № 8204670314”

凭借高频更新(最新数据采集于 06 十月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

10 460
订阅者
+524 小时
+2187 天
+2 08230 天
帖子存档
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых и
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей. Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer. Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание. https://arxiv.org/pdf/2604.00965

Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton. Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа. Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением. В лекции разбираются: — Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры. — Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память. — Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент. — Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность. — Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер. — Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков. — Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline. — Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему. Знание CUDA и устройства железа не требуется. Что дальше: — Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней. — Новые лекции о программировании GPU и оптимизации инференса. — Запланированная серия о глубоком обучении для аудио. Полная лекция: https://youtu.be/dEZP1qUNTOk

«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения. В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое. Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях. https://visionbook.mit.edu

Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике. Kolibri от
+2
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике. Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0. Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba. Обучать хорошие небольшие модели может кто угодно. 😋

Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел. CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание. И это не просто учебник. Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса. В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию. Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers. Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень. Всё здесь: mlsysbook.ai GitHub: https://github.com/harvard-edge/cs249r_book

«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям. Посл
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям. Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны. Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций. Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP. Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование. Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник. web.stanford.edu/~jurafsky/slp3/

Reasoning from Scratch, шестой выпуск. Себастьян Рашка Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO. 00:00 — Введение 01:54 — Чем reasoning-модель отличается от обычной 04:25 — Цепочки рассуждений и возможности модели 08:29 — Награды за точность и формат ответа 11:34 — «Aha-моменты» и обучение DeepSeek-R1 14:41 — Глубина рассуждений и длина ответа 18:38 — RLHF и RLVR 23:04 — GRPO против PPO 26:40 — Объяснение GRPO на аналогии с готовкой 31:43 — KL-компонент и упрощённый GRPO 35:04 — Загрузка предобученной модели 36:07 — Загрузка обучающих данных MATH 39:26 — Генерация ответов модели 46:30 — Расчёт проверяемых наград 49:55 — Расчёт преимуществ 51:54 — Логарифмические вероятности токенов и последовательностей 55:29 — Реализация логарифмических вероятностей последовательностей 57:37 — Исправление ошибки режима инференса 1:02:24 — Расчёт функции потерь GRPO 1:04:37 — Собираем один шаг GRPO целиком 1:09:19 — Цикл обучения GRPO 1:12:57 — Настройки обучения, логирование и чекпоинты 1:17:24 — Запуск обучения и разбор результатов 1:19:28 — Загрузка и оценка чекпоинтов 1:22:33 — Результаты MATH-500 и стабильность обучения 1:24:05 — Требования к памяти и следующие шаги https://www.youtube.com/watch?v=237Hf7Q3lgg

Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn. Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления. Бесплатно, без регистрации. https://vizlearn.in

Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный учебник по робототехнике уровня магист
Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press. Внутри: - конфигурационные пространства - кинематика - динамика - генерация траекторий - планирование движения - управление роботами По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром. https://hades.mech.northwestern.edu/images/7/7f/MR.pdf

«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру. Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить. https://algebrica.org/learning-mathematics/

«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундамен
+1
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса. В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации. Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение. https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf

Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям. В лекции разбираются свёртки на сетках и
+3
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям. В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN. https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf

Гайд по RL от Unsloth. В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле Deep
Гайд по RL от Unsloth. В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO. Полный материал — от базового уровня до продвинутого. Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide

DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей. Она называет
DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей. Она называется DeepGEMM. Библиотека оптимизирует матричные операции, на которых работают большие языковые модели, и позволяет эффективнее использовать NVIDIA Hopper и Blackwell. Поддерживаются FP8, FP4 и BF16. Есть оптимизации для моделей с архитектурой Mixture-of-Experts, совмещение обмена данными между GPU с вычислениями и компиляция ядер прямо во время выполнения, без отдельной сборки CUDA при установке. По данным DeepSeek, DeepGEMM на ряде размеров матриц показывает производительность на уровне или выше специализированных библиотек, вручную оптимизированных экспертами. https://github.com/deepseek-ai/DeepGEMM#interfaces

+2
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes. Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh

Нельзя просто выбрать модель и видеокарту и считать, что на этом всё. Нужно выбрать формат файлов и путь выполнения ядер. Уже
+3
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё. Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU. Начнём с самого цикла. Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется. Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену. У этого цикла есть две фазы, и это разные задачи. Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом. Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания». Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память. Движок инференса — это не сама модель. Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API. Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком. Серьёзные движки ещё и выбирают ядра. Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу. На бумаге математика может быть одинаковой. Ядро — разное. Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать. Квантование — это не один переключатель. Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует. Правильный формат — тот, под который в вашем движке есть оптимизированные ядра. Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность. Вот конкретный пример. Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4. Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные. Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах. Это другой путь выполнения ядер. RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными. Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается. Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо. Это не одно и то же. Поэтому prefill и decode тоже не получают одинаковый выигрыш. Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост. Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место. Не тестируйте просто «модель». Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode. Есть ещё одна вещь, которую часто неправильно понимают из-за слова Blackwell. Это маркетинговое название для нескольких разных чипов, которые не обязаны выполнять одни и те же ядра. Серверный B200 — это не RTX 5090. RTX 5090 — это не Spark. Spark — это не Thor. Поддержка инструк

«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ д
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов. В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла. В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме. Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала. https://louis.pressbooks.pub/trigonometry/

Подборка с объяснениями ключевых концепций и научных работ по машинному обучению: https://github.com/dair-ai/ML-Papers-Explained

Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей. Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы. Код опубликован под MIT, доступны и веса для тестирования. https://github.com/Friedrich-M/UniMate