Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
显示更多📈 Telegram 频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение 的分析概览
频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 18 339 名订阅者,在 技术与应用 类别中位列第 6 942,并在 俄罗斯 地区排名第 35 725 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 18 339 名订阅者。
根据 15 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -46,过去 24 小时变化为 -2,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 8.72%。内容发布后 24 小时内通常能获得 3.89% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 1 600 次浏览,首日通常累积 714 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 4。
- 主题关注点: 内容集中在 сайентиста, llm, буст, навигация, openai 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
凭借高频更新(最新数据采集于 16 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang.Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 Модель на Hugging Face 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование)Примеры:
✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает:
✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильнуюПримеры:
✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
python machine learningПочему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает:
TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.Упрощённо:
score = TF × IDF × поправка на длину документа💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
— Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества системУстановка:
pip install pixeltable
🔗 Документация и примеры
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)
💡 Правильнее спрятать preprocessing внутрь Pipeline:
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
model = make_pipeline(
StandardScaler(),
LogisticRegression()
)
model.fit(X_train, y_train)
score = model.score(X_test, y_test)
Теперь StandardScaler обучается только на X_train.
Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing.
🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентистаmodel.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning”
Это сборник задач с решениями, где вы на бумаге разбираете:
— оптимизацию и линейную алгебру — графические модели — Variational Inference — Monte-Carlo методы📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.Свежая версия 3.0.2 вышла 18 августа. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
— управляет несколькими лабораторными приборами; — меняет параметры эксперимента в реальном времени; — реагирует на результаты и ошибки оборудования; — координирует роботизированную руку и liquid handler; — превращает найденную последовательность действий в обычный код для дальнейшего выполнения.В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов. И здесь начинается самое интересное. У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл. У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент. Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта. Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент». 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры. Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.И здесь интересный вывод уже не только для биологии: 💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры. Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
from sklearn.model_selection import TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5, gap=24)
for train_idx, val_idx in tscv.split(X):
X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить:
— скейлеры и энкодеры fit только на train каждого фолда;
— lag и rolling не должны использовать будущие значения;
— gap выбирайте с учётом горизонта прогноза и способа формирования признаков.
Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста