uk
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Відкрити в Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

Показати більше

📈 Аналітичний огляд Telegram-каналу Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Канал Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 18 339 підписників, посідаючи 6 946 місце в категорії Технології та додатки та 35 703 місце у регіоні Росія.

📊 Показники аудиторії та динаміка

З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 18 339 підписників.

За останніми даними від 26 вересня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -30, а за останні 24 години на -1, загальне охоплення залишається високим.

  • Статус верифікації: Не верифікований
  • Рівень залученості (ER): Середній показник залученості аудиторії становить 8.57%. Протягом перших 24 годин після публікації контент зазвичай збирає 4.10% реакцій від загальної кількості підписників.
  • Охоплення публікацій: В середньому кожен допис отримує 1 571 переглядів. Протягом першої доби публікація в середньому набирає 752 переглядів.
  • Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 6.
  • Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як сайентиста, llm, буст, навигация, openai.

📝 Опис та контентна політика

Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”

Завдяки високій частоті оновлень (останні дані отримано 27 вересня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.

18 339
Підписники
-124 години
+57 днів
-3030 днів
Залучення підписників
вер '26
вересень '26
+74
в 0 каналах
серпень '26
+70
в 0 каналах
Get PRO
липень '26
+83
в 0 каналах
Get PRO
червень '26
+97
в 2 каналах
Get PRO
травень '26
+142
в 2 каналах
Get PRO
квітень '26
+106
в 1 каналах
Get PRO
березень '26
+329
в 4 каналах
Get PRO
лютий '26
+154
в 5 каналах
Get PRO
січень '26
+212
в 4 каналах
Get PRO
грудень '25
+211
в 3 каналах
Get PRO
листопад '25
+101
в 1 каналах
Get PRO
жовтень '25
+148
в 5 каналах
Get PRO
вересень '25
+105
в 2 каналах
Get PRO
серпень '25
+103
в 4 каналах
Get PRO
липень '25
+171
в 2 каналах
Get PRO
червень '25
+185
в 42 каналах
Get PRO
травень '25
+319
в 6 каналах
Get PRO
квітень '25
+206
в 18 каналах
Get PRO
березень '25
+247
в 53 каналах
Get PRO
лютий '25
+236
в 36 каналах
Get PRO
січень '25
+180
в 41 каналах
Get PRO
грудень '24
+212
в 42 каналах
Get PRO
листопад '24
+217
в 52 каналах
Get PRO
жовтень '24
+224
в 43 каналах
Get PRO
вересень '24
+249
в 38 каналах
Get PRO
серпень '24
+269
в 37 каналах
Get PRO
липень '24
+197
в 37 каналах
Get PRO
червень '24
+257
в 31 каналах
Get PRO
травень '24
+429
в 38 каналах
Get PRO
квітень '24
+339
в 38 каналах
Get PRO
березень '24
+437
в 32 каналах
Get PRO
лютий '24
+426
в 32 каналах
Get PRO
січень '24
+473
в 28 каналах
Get PRO
грудень '23
+604
в 34 каналах
Get PRO
листопад '23
+289
в 13 каналах
Get PRO
жовтень '23
+462
в 22 каналах
Get PRO
вересень '23
+631
в 0 каналах
Get PRO
серпень '23
+488
в 0 каналах
Get PRO
липень '23
+420
в 0 каналах
Get PRO
червень '23
+329
в 0 каналах
Get PRO
травень '23
+433
в 0 каналах
Get PRO
квітень '23
+224
в 0 каналах
Get PRO
березень '23
+712
в 0 каналах
Get PRO
лютий '23
+249
в 0 каналах
Get PRO
січень '23
+260
в 0 каналах
Get PRO
грудень '22
+292
в 0 каналах
Get PRO
листопад '22
+407
в 0 каналах
Get PRO
жовтень '22
+172
в 0 каналах
Get PRO
вересень '22
+209
в 0 каналах
Get PRO
серпень '22
+287
в 0 каналах
Get PRO
липень '22
+352
в 0 каналах
Get PRO
червень '22
+407
в 0 каналах
Get PRO
травень '22
+166
в 0 каналах
Get PRO
квітень '22
+215
в 0 каналах
Get PRO
березень '22
+225
в 0 каналах
Get PRO
лютий '22
+129
в 0 каналах
Get PRO
січень '22
+250
в 0 каналах
Get PRO
грудень '21
+203
в 0 каналах
Get PRO
листопад '21
+253
в 0 каналах
Get PRO
жовтень '21
+237
в 0 каналах
Get PRO
вересень '21
+208
в 0 каналах
Get PRO
серпень '21
+297
в 0 каналах
Get PRO
липень '21
+312
в 0 каналах
Get PRO
червень '21
+288
в 0 каналах
Get PRO
травень '21
+446
в 0 каналах
Get PRO
квітень '21
+446
в 0 каналах
Get PRO
березень '21
+429
в 0 каналах
Get PRO
лютий '21
+396
в 0 каналах
Get PRO
січень '21
+351
в 0 каналах
Get PRO
грудень '20
+12 450
в 0 каналах
Дата
Залучення підписників
Згадування
Канали
26 вересня+1
25 вересня+2
24 вересня+4
23 вересня+4
22 вересня+5
21 вересня+6
20 вересня+2
19 вересня+2
18 вересня+1
17 вересня+2
16 вересня0
15 вересня+6
14 вересня+3
13 вересня0
12 вересня+3
11 вересня+3
10 вересня+9
09 вересня+1
08 вересня+8
07 вересня+2
06 вересня0
05 вересня+5
04 вересня+2
03 вересня+2
02 вересня0
01 вересня+1
Дописи каналу
🧹 Пора почистить промпты для Claude Code Для этого есть команда:
/claude-api-prompt-audit
Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot. Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

2
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных о
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия. 🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку. Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам. MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей. 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
876
3
🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов. Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты: 🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 066
4
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 295
5
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0. Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами. По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров. Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений: — для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели; — много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения; — одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн. Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре. ML Underhood
1 208
6
🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать Вот набор, который реально закрывает почти все задачи: 🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU. 🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля. 🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами. 🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас. 🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели. 🔴 PEFT Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах. 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста
1 226
7
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигу
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному. У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов. Похожий принцип действительно используется в задачах поиска: 🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий. Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 220
8
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
1 226
9
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patc
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных. Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 340
10
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральны
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
1 295
11
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 345
12
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей п
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab. Что можно сделать: 1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат. Подойдёт, чтобы: — попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM. ⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 588
13
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распрост
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе: — predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция. 🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 710
14
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠
1 595
15
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCE
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai. Что заявлено: 🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang. Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 ⁠Модель на Hugging Face 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 682
16
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 578
17
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс да
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏 📍 Выбрать курс
1 585
18
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (varia
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение. Как работает: ✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование) Примеры: ✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor 👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает: ✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильную Примеры: ✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 528
19
🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить? 🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 383
20
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, г
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает: TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов. Упрощённо: score = TF × IDF × поправка на длину документа 💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 395