ch
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

前往频道在 Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

显示更多

📈 Telegram 频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение 的分析概览

频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 18 339 名订阅者,在 技术与应用 类别中位列第 6 942,并在 俄罗斯 地区排名第 35 725

📊 受众指标与增长动态

невідомо 创建以来,项目保持高速增长,吸引了 18 339 名订阅者。

根据 15 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -46,过去 24 小时变化为 -2,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 8.72%。内容发布后 24 小时内通常能获得 3.89% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 1 600 次浏览,首日通常累积 714 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 4
  • 主题关注点: 内容集中在 сайентиста, llm, буст, навигация, openai 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

凭借高频更新(最新数据采集于 16 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

18 339
订阅者
-224 小时
-147 天
-4630 天
帖子存档
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе:
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠

🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCE
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai. Что заявлено:
🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang.
Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 ⁠Модель на Hugging Face 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс да
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏 📍 Выбрать курс

⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (varia
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение. Как работает:
✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование)
Примеры:
✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor
👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает:
✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильную
Примеры:
✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost
📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?
🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, г
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос:
python machine learning
Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает:
TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
Упрощённо:
score =
  TF × IDF × поправка на длину документа
💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпа
📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работ
🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений. С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД. 🤩 Особенности:
— Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества систем
Установка:

pip install pixeltable
🔗 Документация и примеры 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧠 Зачем Pipeline в scikit-learn Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:

scaler.fit_transform(X)  # уже увидел весь датасет
X_train, X_test = train_test_split(X)
💡 Правильнее спрятать preprocessing внутрь Pipeline:

from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

model = make_pipeline(
    StandardScaler(),
    LogisticRegression()
)

model.fit(X_train, y_train)
score = model.score(X_test, y_test)
Теперь StandardScaler обучается только на X_train. Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing. 🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заме
+2
💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам. Что интересного: — Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов; — может работать с Blender, Excel, Power BI и браузером; — на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах; — на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям. При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning” Это сборник задач с решениями, где вы на бумаге разбираете:
— оптимизацию и линейную алгебру — графические модели — Variational Inference — Monte-Carlo методы
📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы ме
🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы между разными моделями и учитывать стоимость, latency и доступность. Простые задачи — дешёвая модель, сложные — мощная. Такой подход уже становится частью LLM-инфраструктуры. 🔗 LiteLLM — документация 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation F
🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation Framework (DAAF). Он превращает Claude Code в помощника для количественного анализа на Python или R.
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.
Свежая версия 3.0.2 вышла 18 августа. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседо
Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда. Вариант второй: адаптироваться. Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований. — Почему твоё резюме не даёт откликовПочему ты не зарабатываешь 400к?Где искать работу ML-инженеру? И ещё много полезных материалов уже ждёт тебя на канале. Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers Реклама ИП Камаев Богдан Эльмарович ИНН 770973951244 erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6

🤖 Anthropic учит AI-агентов управлять реальным железом Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием. Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом. Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним. MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно. Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами; — меняет параметры эксперимента в реальном времени; — реагирует на результаты и ошибки оборудования; — координирует роботизированную руку и liquid handler; — превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов. И здесь начинается самое интересное. У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл. У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент. Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта. Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент». 🔗 Источник 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT предста
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей. Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция. ❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры. Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии: 💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры. Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

Главная ошибка при валидации временных рядов Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет. 🤩 Для временных рядов используйте разбиение по времени:

from sklearn.model_selection import TimeSeriesSplit

tscv = TimeSeriesSplit(n_splits=5, gap=24)

for train_idx, val_idx in tscv.split(X):
    X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить: — скейлеры и энкодеры fit только на train каждого фолда; — lag и rolling не должны использовать будущие значения; — gap выбирайте с учётом горизонта прогноза и способа формирования признаков. Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение - Telegram 频道 @dsproglib 的统计与分析