es
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Ir al canal en Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

Mostrar más

📈 Análisis del canal de Telegram Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

El canal Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) en el segmento lingüístico de Ruso es un actor destacado. Actualmente la comunidad reúne a 18 339 suscriptores, ocupando la posición 6 946 en la categoría Tecnologías y Aplicaciones y el puesto 35 703 en la región Rusia.

📊 Métricas de audiencia y dinámica

Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 18 339 suscriptores.

Según los últimos datos del 26 septiembre, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de -30, y en las últimas 24 horas de -1, conservando un alto alcance.

  • Estado de verificación: No verificado
  • Tasa de interacción (ER): El promedio de interacción de la audiencia es 8.57%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 4.10% de reacciones respecto al total de suscriptores.
  • Alcance de las publicaciones: Cada publicación recibe en promedio 1 571 visualizaciones. En el primer día suele acumular 752 visualizaciones.
  • Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 6.
  • Intereses temáticos: El contenido se centra en temas clave como сайентиста, llm, буст, навигация, openai.

📝 Descripción y política de contenido

El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”

Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 27 septiembre, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.

18 339
Suscriptores
-124 horas
+57 días
-3030 días
Atraer Suscriptores
sep '26
septiembre '26
+74
en 0 canales
agosto '26
+70
en 0 canales
Get PRO
julio '26
+83
en 0 canales
Get PRO
junio '26
+97
en 2 canales
Get PRO
mayo '26
+142
en 2 canales
Get PRO
abril '26
+106
en 1 canales
Get PRO
marzo '26
+329
en 4 canales
Get PRO
febrero '26
+154
en 5 canales
Get PRO
enero '26
+212
en 4 canales
Get PRO
diciembre '25
+211
en 3 canales
Get PRO
noviembre '25
+101
en 1 canales
Get PRO
octubre '25
+148
en 5 canales
Get PRO
septiembre '25
+105
en 2 canales
Get PRO
agosto '25
+103
en 4 canales
Get PRO
julio '25
+171
en 2 canales
Get PRO
junio '25
+185
en 42 canales
Get PRO
mayo '25
+319
en 6 canales
Get PRO
abril '25
+206
en 18 canales
Get PRO
marzo '25
+247
en 53 canales
Get PRO
febrero '25
+236
en 36 canales
Get PRO
enero '25
+180
en 41 canales
Get PRO
diciembre '24
+212
en 42 canales
Get PRO
noviembre '24
+217
en 52 canales
Get PRO
octubre '24
+224
en 43 canales
Get PRO
septiembre '24
+249
en 38 canales
Get PRO
agosto '24
+269
en 37 canales
Get PRO
julio '24
+197
en 37 canales
Get PRO
junio '24
+257
en 31 canales
Get PRO
mayo '24
+429
en 38 canales
Get PRO
abril '24
+339
en 38 canales
Get PRO
marzo '24
+437
en 32 canales
Get PRO
febrero '24
+426
en 32 canales
Get PRO
enero '24
+473
en 28 canales
Get PRO
diciembre '23
+604
en 34 canales
Get PRO
noviembre '23
+289
en 13 canales
Get PRO
octubre '23
+462
en 22 canales
Get PRO
septiembre '23
+631
en 0 canales
Get PRO
agosto '23
+488
en 0 canales
Get PRO
julio '23
+420
en 0 canales
Get PRO
junio '23
+329
en 0 canales
Get PRO
mayo '23
+433
en 0 canales
Get PRO
abril '23
+224
en 0 canales
Get PRO
marzo '23
+712
en 0 canales
Get PRO
febrero '23
+249
en 0 canales
Get PRO
enero '23
+260
en 0 canales
Get PRO
diciembre '22
+292
en 0 canales
Get PRO
noviembre '22
+407
en 0 canales
Get PRO
octubre '22
+172
en 0 canales
Get PRO
septiembre '22
+209
en 0 canales
Get PRO
agosto '22
+287
en 0 canales
Get PRO
julio '22
+352
en 0 canales
Get PRO
junio '22
+407
en 0 canales
Get PRO
mayo '22
+166
en 0 canales
Get PRO
abril '22
+215
en 0 canales
Get PRO
marzo '22
+225
en 0 canales
Get PRO
febrero '22
+129
en 0 canales
Get PRO
enero '22
+250
en 0 canales
Get PRO
diciembre '21
+203
en 0 canales
Get PRO
noviembre '21
+253
en 0 canales
Get PRO
octubre '21
+237
en 0 canales
Get PRO
septiembre '21
+208
en 0 canales
Get PRO
agosto '21
+297
en 0 canales
Get PRO
julio '21
+312
en 0 canales
Get PRO
junio '21
+288
en 0 canales
Get PRO
mayo '21
+446
en 0 canales
Get PRO
abril '21
+446
en 0 canales
Get PRO
marzo '21
+429
en 0 canales
Get PRO
febrero '21
+396
en 0 canales
Get PRO
enero '21
+351
en 0 canales
Get PRO
diciembre '20
+12 450
en 0 canales
Fecha
Crecimiento de Suscriptores
Menciones
Canales
26 septiembre+1
25 septiembre+2
24 septiembre+4
23 septiembre+4
22 septiembre+5
21 septiembre+6
20 septiembre+2
19 septiembre+2
18 septiembre+1
17 septiembre+2
16 septiembre0
15 septiembre+6
14 septiembre+3
13 septiembre0
12 septiembre+3
11 septiembre+3
10 septiembre+9
09 septiembre+1
08 septiembre+8
07 septiembre+2
06 septiembre0
05 septiembre+5
04 septiembre+2
03 septiembre+2
02 septiembre0
01 septiembre+1
Publicaciones del Canal
🧹 Пора почистить промпты для Claude Code Для этого есть команда:
/claude-api-prompt-audit
Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot. Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

2
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных о
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия. 🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку. Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам. MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей. 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
876
3
🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов. Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты: 🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 066
4
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 295
5
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0. Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами. По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров. Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений: — для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели; — много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения; — одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн. Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре. ML Underhood
1 208
6
🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать Вот набор, который реально закрывает почти все задачи: 🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU. 🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля. 🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами. 🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас. 🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели. 🔴 PEFT Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах. 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста
1 226
7
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигу
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному. У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов. Похожий принцип действительно используется в задачах поиска: 🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий. Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 220
8
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
1 226
9
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patc
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных. Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 340
10
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральны
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
1 295
11
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 345
12
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей п
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab. Что можно сделать: 1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат. Подойдёт, чтобы: — попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM. ⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 588
13
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распрост
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе: — predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция. 🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 710
14
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠
1 595
15
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCE
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai. Что заявлено: 🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang. Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 ⁠Модель на Hugging Face 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 682
16
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 578
17
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс да
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏 📍 Выбрать курс
1 585
18
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (varia
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение. Как работает: ✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование) Примеры: ✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor 👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает: ✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильную Примеры: ✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 528
19
🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить? 🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 383
20
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, г
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает: TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов. Упрощённо: score = TF × IDF × поправка на длину документа 💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 395