uk
Feedback
Data Portal | DS & ML

Data Portal | DS & ML

Відкрити в Telegram

Всё самое интересное из мира Data Science и машинного обучения Cотрудничество: @devmangx Автор: @ScienceLLM № 8204670314

Показати більше

📈 Аналітичний огляд Telegram-каналу Data Portal | DS & ML

Канал Data Portal | DS & ML (@llmscience) є активним учасником. На даний момент спільнота об'єднує 10 460 підписників, посідаючи 11 247 місце в категорії Технології та додатки та 60 231 місце у регіоні Росія.

📊 Показники аудиторії та динаміка

З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 10 460 підписників.

За останніми даними від 05 жовтня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на 2 082, а за останні 24 години на 5, загальне охоплення залишається високим.

  • Статус верифікації: Не верифікований
  • Рівень залученості (ER): Середній показник залученості аудиторії становить 21.93%. Протягом перших 24 годин після публікації контент зазвичай збирає 13.31% реакцій від загальної кількості підписників.
  • Охоплення публікацій: В середньому кожен допис отримує 2 295 переглядів. Протягом першої доби публікація в середньому набирає 1 393 переглядів.
  • Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 0.
  • Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як llm, контекст, токенов, claude, архитектура.

📝 Опис та контентна політика

Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Всё самое интересное из мира Data Science и машинного обучения Cотрудничество: @devmangx Автор: @ScienceLLM № 8204670314”

Завдяки високій частоті оновлень (останні дані отримано 06 жовтня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.

10 460
Підписники
+524 години
+2187 днів
+2 08230 днів
Залучення підписників
жовт '26
жовтень '26
+95
в 15 каналах
вересень '26
+2 083
в 99 каналах
Get PRO
серпень '26
+164
в 4 каналах
Get PRO
липень '26
+92
в 0 каналах
Get PRO
червень '26
+224
в 5 каналах
Get PRO
травень '26
+92
в 2 каналах
Get PRO
квітень '26
+48
в 0 каналах
Get PRO
березень '26
+61
в 1 каналах
Get PRO
лютий '26
+48
в 1 каналах
Get PRO
січень '26
+52
в 2 каналах
Get PRO
грудень '25
+183
в 8 каналах
Get PRO
листопад '25
+715
в 318 каналах
Get PRO
жовтень '25
+29
в 0 каналах
Get PRO
вересень '25
+44
в 0 каналах
Get PRO
серпень '25
+80
в 0 каналах
Get PRO
липень '25
+1 123
в 264 каналах
Get PRO
червень '25
+283
в 2 каналах
Get PRO
травень '25
+147
в 1 каналах
Get PRO
квітень '25
+662
в 2 каналах
Get PRO
березень '25
+591
в 0 каналах
Get PRO
лютий '25
+507
в 0 каналах
Get PRO
січень '25
+651
в 0 каналах
Get PRO
грудень '24
+1 342
в 404 каналах
Get PRO
листопад '24
+509
в 164 каналах
Get PRO
жовтень '24
+1 048
в 285 каналах
Get PRO
вересень '24
+887
в 281 каналах
Get PRO
серпень '24
+1 933
в 234 каналах
Дата
Залучення підписників
Згадування
Канали
06 жовтня0
05 жовтня+8
04 жовтня+9
03 жовтня+8
02 жовтня+12
01 жовтня+58
Дописи каналу
2
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых и
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей. Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer. Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание. https://arxiv.org/pdf/2604.00965
930
3
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программиров
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton. Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа. Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением. В лекции разбираются: — Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры. — Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память. — Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент. — Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность. — Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер. — Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков. — Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline. — Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему. Знание CUDA и устройства железа не требуется. Что дальше: — Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней. — Новые лекции о программировании GPU и оптимизации инференса. — Запланированная серия о глубоком обучении для аудио. Полная лекция: https://youtu.be/dEZP1qUNTOk
1 037
4
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения. В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое. Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях. https://visionbook.mit.edu
1 126
5
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике. Kolibri от+2
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике. Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0. Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba. Обучать хорошие небольшие модели может кто угодно. 😋
1 255
6
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел. CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание. И это не просто учебник. Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса. В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию. Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers. Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень. Всё здесь: mlsysbook.ai GitHub: https://github.com/harvard-edge/cs249r_book
1 257
7
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям. Посл
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям. Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны. Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций. Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP. Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование. Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник. web.stanford.edu/~jurafsky/slp3/
1 238
8
Reasoning from Scratch, шестой выпуск. Себастьян Рашка Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO. 00:00 — Введение 01:54 — Чем reasoning-модель отличается от обычной 04:25 — Цепочки рассуждений и возможности модели 08:29 — Награды за точность и формат ответа 11:34 — «Aha-моменты» и обучение DeepSeek-R1 14:41 — Глубина рассуждений и длина ответа 18:38 — RLHF и RLVR 23:04 — GRPO против PPO 26:40 — Объяснение GRPO на аналогии с готовкой 31:43 — KL-компонент и упрощённый GRPO 35:04 — Загрузка предобученной модели 36:07 — Загрузка обучающих данных MATH 39:26 — Генерация ответов модели 46:30 — Расчёт проверяемых наград 49:55 — Расчёт преимуществ 51:54 — Логарифмические вероятности токенов и последовательностей 55:29 — Реализация логарифмических вероятностей последовательностей 57:37 — Исправление ошибки режима инференса 1:02:24 — Расчёт функции потерь GRPO 1:04:37 — Собираем один шаг GRPO целиком 1:09:19 — Цикл обучения GRPO 1:12:57 — Настройки обучения, логирование и чекпоинты 1:17:24 — Запуск обучения и разбор результатов 1:19:28 — Загрузка и оценка чекпоинтов 1:22:33 — Результаты MATH-500 и стабильность обучения 1:24:05 — Требования к памяти и следующие шаги https://www.youtube.com/watch?v=237Hf7Q3lgg
1 240
9
Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn. Можно поэкспериментировать с градиентным
Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn. Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления. Бесплатно, без регистрации. https://vizlearn.in
1 284
10
Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный учебник по робототехнике уровня магист
Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press. Внутри: - конфигурационные пространства - кинематика - динамика - генерация траекторий - планирование движения - управление роботами По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром. https://hades.mech.northwestern.edu/images/7/7f/MR.pdf
1 331
11
«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру. Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить. https://algebrica.org/learning-mathematics/
1 378
12
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундамен+1
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса. В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации. Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение. https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf
1 556
13
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям. В лекции разбираются свёртки на сетках и+3
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям. В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN. https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf
1 677
14
Гайд по RL от Unsloth. В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле Deep
Гайд по RL от Unsloth. В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO. Полный материал — от базового уровня до продвинутого. Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide
1 417
15
DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей. Она называет
DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей. Она называется DeepGEMM. Библиотека оптимизирует матричные операции, на которых работают большие языковые модели, и позволяет эффективнее использовать NVIDIA Hopper и Blackwell. Поддерживаются FP8, FP4 и BF16. Есть оптимизации для моделей с архитектурой Mixture-of-Experts, совмещение обмена данными между GPU с вычислениями и компиляция ядер прямо во время выполнения, без отдельной сборки CUDA при установке. По данным DeepSeek, DeepGEMM на ряде размеров матриц показывает производительность на уровне или выше специализированных библиотек, вручную оптимизированных экспертами. https://github.com/deepseek-ai/DeepGEMM#interfaces
1 510
16
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh Дальше можно пройтись по практическим навык+2
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes. Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh
1 567
17
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё. Нужно выбрать формат файлов и путь выполнения ядер. Уже+3
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё. Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU. Начнём с самого цикла. Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется. Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену. У этого цикла есть две фазы, и это разные задачи. Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом. Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания». Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память. Движок инференса — это не сама модель. Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API. Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком. Серьёзные движки ещё и выбирают ядра. Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу. На бумаге математика может быть одинаковой. Ядро — разное. Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать. Квантование — это не один переключатель. Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует. Правильный формат — тот, под который в вашем движке есть оптимизированные ядра. Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность. Вот конкретный пример. Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4. Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные. Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах. Это другой путь выполнения ядер. RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными. Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается. Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо. Это не одно и то же. Поэтому prefill и decode тоже не получают одинаковый выигрыш. Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост. Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место. Не тестируйте просто «модель». Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode. Есть ещё одна вещь, которую часто неправильно понимают из-за слова Blackwell. Это маркетинговое название для нескольких разных чипов, которые не обязаны выполнять одни и те же ядра. Серверный B200 — это не RTX 5090. RTX 5090 — это не Spark. Spark — это не Thor. Поддержка инструк
1 579
18
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ д
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов. В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла. В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме. Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала. https://louis.pressbooks.pub/trigonometry/
1 551
19
Подборка с объяснениями ключевых концепций и научных работ по машинному обучению: https://github.com/dair-ai/ML-Papers-Explained
1 647
20
Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей. Одна модель работает с разными скелетами
Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей. Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы. Код опубликован под MIT, доступны и веса для тестирования. https://github.com/Friedrich-M/UniMate
1 759