Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Показати більше📈 Аналітичний огляд Telegram-каналу Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Канал Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 18 339 підписників, посідаючи 6 946 місце в категорії Технології та додатки та 35 703 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 18 339 підписників.
За останніми даними від 26 вересня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -30, а за останні 24 години на -1, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 8.57%. Протягом перших 24 годин після публікації контент зазвичай збирає 4.10% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 1 571 переглядів. Протягом першої доби публікація в середньому набирає 752 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 6.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як сайентиста, llm, буст, навигация, openai.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Завдяки високій частоті оновлень (останні дані отримано 27 вересня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Триває завантаження даних...
| Дата | Залучення підписників | Згадування | Канали | |
| 26 вересня | +1 | |||
| 25 вересня | +2 | |||
| 24 вересня | +4 | |||
| 23 вересня | +4 | |||
| 22 вересня | +5 | |||
| 21 вересня | +6 | |||
| 20 вересня | +2 | |||
| 19 вересня | +2 | |||
| 18 вересня | +1 | |||
| 17 вересня | +2 | |||
| 16 вересня | 0 | |||
| 15 вересня | +6 | |||
| 14 вересня | +3 | |||
| 13 вересня | 0 | |||
| 12 вересня | +3 | |||
| 11 вересня | +3 | |||
| 10 вересня | +9 | |||
| 09 вересня | +1 | |||
| 08 вересня | +8 | |||
| 07 вересня | +2 | |||
| 06 вересня | 0 | |||
| 05 вересня | +5 | |||
| 04 вересня | +2 | |||
| 03 вересня | +2 | |||
| 02 вересня | 0 | |||
| 01 вересня | +1 |
/claude-api-prompt-auditОна проверяет CLAUDE
.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot.
Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста| 2 | 🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ
Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия.
🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку.
Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам.
MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей.
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 876 |
| 3 | 🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов.
Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:
🟡 локальный MCP-клиент;
🟡 Agentic RAG;
🟡 финансовый аналитик;
🟡 voice agent;
🟡 Deep Researcher;
🟡 RAG по документам и видео;
🟡 генератор синтетических данных;
🟡 shared memory для Claude Desktop и Cursor.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 066 |
| 4 | RAG vs. Agentic RAG: в чём разница ❔
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 295 |
| 5 | Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0.
Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами.
По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров.
Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений:
— для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели;
— много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения;
— одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн.
Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре.
ML Underhood | 1 208 |
| 6 | 🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать
Вот набор, который реально закрывает почти все задачи:
🔴 Unsloth
Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU.
🔴 LLaMA-Factory
Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля.
🔴 DeepSpeed
Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами.
🔴 Axolotl
Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас.
🔴 TRL
Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели.
🔴 PEFT
Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах.
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста | 1 226 |
| 7 | 🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний
Кубик Рубика можно представить как граф:
— каждая конфигурация — вершина;
— поворот грани — ребро;
— решение — путь от перемешанного состояния к собранному.
У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов.
Похожий принцип действительно используется в задачах поиска:
🔴 шахматный движок исследует варианты ходов;
🔴 навигатор — граф дорог;
🔴 AI-агент — возможные последовательности действий.
Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 220 |
| 8 | Что выведет код?
👍 — {}
👾 — {«x»: 1}
🥰 — Error
🔥 — None
🐸 Библиотека задач по Data Science | 1 226 |
| 9 | 🌞 3 open-source инструмента для AI-агентов
🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам.
🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами.
🔘 Scrapling — быстрый scraping сайтов и извлечение данных.
Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 340 |
| 10 | А вы уже забрали свой подарок ко Дню программиста?
К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS
Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw | 1 295 |
| 11 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 345 |
| 12 | 🤗 Fine-tuning LLM в Google Colab — без собственной GPU
Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab.
Что можно сделать:
1️⃣ Открыть готовый Colab.
2️⃣ Установить Unsloth Studio.
3️⃣ Выбрать модель.
4️⃣ Загрузить датасет — например, CSV или данные из PDF.
5️⃣ Запустить fine-tuning и экспортировать результат.
Подойдёт, чтобы:
— попробовать LoRA/QLoRA;
— адаптировать модель под свой формат данных;
— собрать небольшой synthetic dataset;
— разобраться с процессом дообучения LLM.
⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета.
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 588 |
| 13 | 🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation
Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями.
В основе:
— predictive coding;
— локальные ошибки;
— множители Лагранжа;
— PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах.
Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть.
Почему интересно:
— обучение остаётся локальным;
— подход ближе к идеям NeuroAI;
— потенциально полезен для нейроморфного железа.
⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко.
🔗 Статья
🔗 Код
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 710 |
| 14 | 😭 Как не потратить недельный лимит AI-кодинга за три дня?
Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.
🔘 Поговорим о том:
— когда дорогая модель действительно нужна, а когда хватит дешёвой;
— сколько стоит один прогон и куда уходят токены;
— какие задачи можно отдавать субагентам;
— как настроить маршрутизацию моделей;
— что проверять в AI-коде перед merge.
✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.
⬇️ 18 сентября, 19:00 МСК
⬇️ 1,5 часа · бесплатно
⬇️ Арсений Харланов и Олег Лайок
💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре.
🔗 Зарегистрироваться на вебинар | 1 595 |
| 15 | 🧠 DeepSeek-V4.1-Flash без встроенных ограничений
На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.
Что заявлено:
🔘 MoE-модель на 552B параметров;
🔘 8B–16B активных параметров на токен;
🔘 FP8/FP4-квантизация;
🔘 контекст до 1 млн токенов;
🔘 поддержка изображений, инструментов и reasoning;
🔘 запуск через SGLang.
Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.
📊 Результаты авторских тестов:
HarmBench: 100% ASR;
MMLU: 82,74% против 86,96% у базовой модели.
⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200.
🔗 Модель на Hugging Face
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 682 |
| 16 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 578 |
| 17 | 🌸 Вселенная намекает: пора уже начать этот курс
С 14 сентября цены в Proglib Academy вырастут на 20% 👀
Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏
📍 Выбрать курс | 1 585 |
| 18 | ⚡️ Шпаргалка: Bagging vs Boosting
👉 Bagging
Идея: несколько независимых моделей → усреднение.
Цель: снизить дисперсию (variance) и уменьшить переобучение.
Как работает:
✳️ делаем много бутстрап-выборок
✳️ обучаем модели параллельно
✳️ объединяем результаты (среднее/голосование)
Примеры:
✳️ RandomForestClassifier
✳️ RandomForestRegressor
✳️ BaggingClassifier
✳️ BaggingRegressor
👉 Boosting
Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей.
Цель: снизить смещение (bias) и повысить точность.
Как работает:
✳️ задаём базового слабого ученика
✳️ увеличиваем вес «трудных» объектов
✳️ комбинируем множество слабых моделей в одну сильную
Примеры:
✳️ GradientBoosting
✳️ XGBoost
✳️ CatBoost
✳️ LightGBM
✳️ AdaBoost
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 528 |
| 19 | 🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?
🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.
Задавайте всё, что давно хотелось спросить 📍
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 383 |
| 20 | 🤔 Почему поиск понимает, что один документ релевантнее другого?
Например, запрос:
python machine learning
Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?
🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.
Он учитывает:
TF — насколько часто термин встречается в документе;
IDF — насколько термин редкий во всей коллекции;
длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
Упрощённо:
score =
TF × IDF × поправка на длину документа
💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 395 |
