Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
显示更多📈 Telegram 频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение 的分析概览
频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 18 339 名订阅者,在 技术与应用 类别中位列第 6 942,并在 俄罗斯 地区排名第 35 725 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 18 339 名订阅者。
根据 15 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -46,过去 24 小时变化为 -2,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 8.72%。内容发布后 24 小时内通常能获得 3.89% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 1 600 次浏览,首日通常累积 714 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 4。
- 主题关注点: 内容集中在 сайентиста, llm, буст, навигация, openai 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
凭借高频更新(最新数据采集于 16 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。
数据加载中...
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 16 九月 | 0 | |||
| 15 九月 | +6 | |||
| 14 九月 | +3 | |||
| 13 九月 | 0 | |||
| 12 九月 | +3 | |||
| 11 九月 | +3 | |||
| 10 九月 | +9 | |||
| 09 九月 | +1 | |||
| 08 九月 | +8 | |||
| 07 九月 | +2 | |||
| 06 九月 | 0 | |||
| 05 九月 | +5 | |||
| 04 九月 | +2 | |||
| 03 九月 | +2 | |||
| 02 九月 | 0 | |||
| 01 九月 | +1 |
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
| 2 | 😭 Как не потратить недельный лимит AI-кодинга за три дня?
Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.
🔘 Поговорим о том:
— когда дорогая модель действительно нужна, а когда хватит дешёвой;
— сколько стоит один прогон и куда уходят токены;
— какие задачи можно отдавать субагентам;
— как настроить маршрутизацию моделей;
— что проверять в AI-коде перед merge.
✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.
⬇️ 18 сентября, 19:00 МСК
⬇️ 1,5 часа · бесплатно
⬇️ Арсений Харланов и Олег Лайок
💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре.
🔗 Зарегистрироваться на вебинар | 949 |
| 3 | 🧠 DeepSeek-V4.1-Flash без встроенных ограничений
На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.
Что заявлено:
🔘 MoE-модель на 552B параметров;
🔘 8B–16B активных параметров на токен;
🔘 FP8/FP4-квантизация;
🔘 контекст до 1 млн токенов;
🔘 поддержка изображений, инструментов и reasoning;
🔘 запуск через SGLang.
Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.
📊 Результаты авторских тестов:
HarmBench: 100% ASR;
MMLU: 82,74% против 86,96% у базовой модели.
⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200.
🔗 Модель на Hugging Face
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 038 |
| 4 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 057 |
| 5 | 🌸 Вселенная намекает: пора уже начать этот курс
С 14 сентября цены в Proglib Academy вырастут на 20% 👀
Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏
📍 Выбрать курс | 1 123 |
| 6 | ⚡️ Шпаргалка: Bagging vs Boosting
👉 Bagging
Идея: несколько независимых моделей → усреднение.
Цель: снизить дисперсию (variance) и уменьшить переобучение.
Как работает:
✳️ делаем много бутстрап-выборок
✳️ обучаем модели параллельно
✳️ объединяем результаты (среднее/голосование)
Примеры:
✳️ RandomForestClassifier
✳️ RandomForestRegressor
✳️ BaggingClassifier
✳️ BaggingRegressor
👉 Boosting
Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей.
Цель: снизить смещение (bias) и повысить точность.
Как работает:
✳️ задаём базового слабого ученика
✳️ увеличиваем вес «трудных» объектов
✳️ комбинируем множество слабых моделей в одну сильную
Примеры:
✳️ GradientBoosting
✳️ XGBoost
✳️ CatBoost
✳️ LightGBM
✳️ AdaBoost
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 097 |
| 7 | 🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?
🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.
Задавайте всё, что давно хотелось спросить 📍
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 991 |
| 8 | 🤔 Почему поиск понимает, что один документ релевантнее другого?
Например, запрос:
python machine learning
Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?
🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.
Он учитывает:
TF — насколько часто термин встречается в документе;
IDF — насколько термин редкий во всей коллекции;
длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
Упрощённо:
score =
TF × IDF × поправка на длину документа
💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 069 |
| 9 | 📊 Всё о непрерывном равномерном распределении
Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 194 |
| 10 | 🤩 Pixeltable — декларативная инфраструктура данных для AI
Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений.
С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД.
🤩 Особенности:
— Поддержка мультимодальных данных: изображения, видео, документы
— Инкрементальное хранение и трансформация данных
— Простая декларативная работа вместо множества систем
Установка:
pip install pixeltable
🔗 Документация и примеры
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 267 |
| 11 | 🧠 Зачем Pipeline в scikit-learn
Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:
scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)
💡 Правильнее спрятать preprocessing внутрь Pipeline:
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
model = make_pipeline(
StandardScaler(),
LogisticRegression()
)
model.fit(X_train, y_train)
score = model.score(X_test, y_test)
Теперь StandardScaler обучается только на X_train.
Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing.
🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 400 |
| 12 | 💡 GPT-6 Astra: модели уже работают как исследовательские агенты
OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам.
Что интересного:
— Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов;
— может работать с Blender, Excel, Power BI и браузером;
— на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах;
— на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям.
При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 670 |
| 13 | 🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning”
Это сборник задач с решениями, где вы на бумаге разбираете:
— оптимизацию и линейную алгебру
— графические модели
— Variational Inference
— Monte-Carlo методы
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 773 |
| 14 | 🤖 Не одна LLM, а роутер
Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы между разными моделями и учитывать стоимость, latency и доступность.
Простые задачи — дешёвая модель, сложные — мощная. Такой подход уже становится частью LLM-инфраструктуры.
🔗 LiteLLM — документация
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 660 |
| 15 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 555 |
| 16 | 🧠 DAAF: Claude Code для полноценного анализа данных
Появился интересный open-source инструмент — Data Analyst Augmentation Framework (DAAF). Он превращает Claude Code в помощника для количественного анализа на Python или R.
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.
Свежая версия 3.0.2 вышла 18 августа.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 793 |
| 17 | Что делать айтишнику в наше турбулентное время?
Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда.
Вариант второй: адаптироваться.
Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований.
— Почему твоё резюме не даёт откликов
— Почему ты не зарабатываешь 400к?
— Где искать работу ML-инженеру?
И ещё много полезных материалов уже ждёт тебя на канале.
Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers
Реклама
ИП Камаев Богдан Эльмарович
ИНН 770973951244
erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6 | 1 151 |
| 18 | 🤖 Anthropic учит AI-агентов управлять реальным железом
Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием.
Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом.
Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним.
MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно.
Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами;
— меняет параметры эксперимента в реальном времени;
— реагирует на результаты и ошибки оборудования;
— координирует роботизированную руку и liquid handler;
— превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов.
И здесь начинается самое интересное.
У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл.
У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент.
Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта.
Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент».
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 400 |
| 19 | 🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа?
Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей.
Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция.
❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры.
Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии:
💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры.
Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 463 |
| 20 | ⏳ Главная ошибка при валидации временных рядов
Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет.
🤩 Для временных рядов используйте разбиение по времени:
from sklearn.model_selection import TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5, gap=24)
for train_idx, val_idx in tscv.split(X):
X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить:
— скейлеры и энкодеры fit только на train каждого фолда;
— lag и rolling не должны использовать будущие значения;
— gap выбирайте с учётом горизонта прогноза и способа формирования признаков.
Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 506 |
