Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
إظهار المزيد📈 نظرة تحليلية على قناة تيليجرام Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
تُعد قناة Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 18 339 مشتركاً، محتلاً المرتبة 6 940 في فئة التكنولوجيات والتطبيقات والمرتبة 35 711 في منطقة روسيا.
📊 مؤشرات الجمهور والحراك
منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 18 339 مشتركاً.
بحسب آخر البيانات بتاريخ 16 سبتمبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -50، وفي آخر 24 ساعة بمقدار -2، مع بقاء الوصول العام مرتفعاً.
- حالة التحقق: غير موثّقة
- معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 8.66%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 4.07% من ردود الفعل نسبةً إلى إجمالي المشتركين.
- وصول المنشورات: يحصل كل منشور على متوسط 1 589 مشاهدة. وخلال اليوم الأول يجمع عادةً 747 مشاهدة.
- التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 5.
- الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل сайентиста, llm, буст, навигация, openai.
📝 الوصف وسياسة المحتوى
يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 17 سبتمبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.
جاري تحميل البيانات...
| التاريخ | نمو المشتركين | الإشارات | القنوات | |
| 17 سبتمبر | +1 | |||
| 16 سبتمبر | 0 | |||
| 15 سبتمبر | +6 | |||
| 14 سبتمبر | +3 | |||
| 13 سبتمبر | 0 | |||
| 12 سبتمبر | +3 | |||
| 11 سبتمبر | +3 | |||
| 10 سبتمبر | +9 | |||
| 09 سبتمبر | +1 | |||
| 08 سبتمبر | +8 | |||
| 07 سبتمبر | +2 | |||
| 06 سبتمبر | 0 | |||
| 05 سبتمبر | +5 | |||
| 04 سبتمبر | +2 | |||
| 03 سبتمبر | +2 | |||
| 02 سبتمبر | 0 | |||
| 01 سبتمبر | +1 |
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
| 2 | 😭 Как не потратить недельный лимит AI-кодинга за три дня?
Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.
🔘 Поговорим о том:
— когда дорогая модель действительно нужна, а когда хватит дешёвой;
— сколько стоит один прогон и куда уходят токены;
— какие задачи можно отдавать субагентам;
— как настроить маршрутизацию моделей;
— что проверять в AI-коде перед merge.
✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.
⬇️ 18 сентября, 19:00 МСК
⬇️ 1,5 часа · бесплатно
⬇️ Арсений Харланов и Олег Лайок
💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре.
🔗 Зарегистрироваться на вебинар | 979 |
| 3 | 🧠 DeepSeek-V4.1-Flash без встроенных ограничений
На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.
Что заявлено:
🔘 MoE-модель на 552B параметров;
🔘 8B–16B активных параметров на токен;
🔘 FP8/FP4-квантизация;
🔘 контекст до 1 млн токенов;
🔘 поддержка изображений, инструментов и reasoning;
🔘 запуск через SGLang.
Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.
📊 Результаты авторских тестов:
HarmBench: 100% ASR;
MMLU: 82,74% против 86,96% у базовой модели.
⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200.
🔗 Модель на Hugging Face
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 066 |
| 4 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 075 |
| 5 | 🌸 Вселенная намекает: пора уже начать этот курс
С 14 сентября цены в Proglib Academy вырастут на 20% 👀
Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏
📍 Выбрать курс | 1 126 |
| 6 | ⚡️ Шпаргалка: Bagging vs Boosting
👉 Bagging
Идея: несколько независимых моделей → усреднение.
Цель: снизить дисперсию (variance) и уменьшить переобучение.
Как работает:
✳️ делаем много бутстрап-выборок
✳️ обучаем модели параллельно
✳️ объединяем результаты (среднее/голосование)
Примеры:
✳️ RandomForestClassifier
✳️ RandomForestRegressor
✳️ BaggingClassifier
✳️ BaggingRegressor
👉 Boosting
Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей.
Цель: снизить смещение (bias) и повысить точность.
Как работает:
✳️ задаём базового слабого ученика
✳️ увеличиваем вес «трудных» объектов
✳️ комбинируем множество слабых моделей в одну сильную
Примеры:
✳️ GradientBoosting
✳️ XGBoost
✳️ CatBoost
✳️ LightGBM
✳️ AdaBoost
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 104 |
| 7 | 🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?
🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.
Задавайте всё, что давно хотелось спросить 📍
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 000 |
| 8 | 🤔 Почему поиск понимает, что один документ релевантнее другого?
Например, запрос:
python machine learning
Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?
🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.
Он учитывает:
TF — насколько часто термин встречается в документе;
IDF — насколько термин редкий во всей коллекции;
длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
Упрощённо:
score =
TF × IDF × поправка на длину документа
💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 074 |
| 9 | 📊 Всё о непрерывном равномерном распределении
Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 198 |
| 10 | 🤩 Pixeltable — декларативная инфраструктура данных для AI
Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений.
С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД.
🤩 Особенности:
— Поддержка мультимодальных данных: изображения, видео, документы
— Инкрементальное хранение и трансформация данных
— Простая декларативная работа вместо множества систем
Установка:
pip install pixeltable
🔗 Документация и примеры
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 285 |
| 11 | 🧠 Зачем Pipeline в scikit-learn
Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:
scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)
💡 Правильнее спрятать preprocessing внутрь Pipeline:
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
model = make_pipeline(
StandardScaler(),
LogisticRegression()
)
model.fit(X_train, y_train)
score = model.score(X_test, y_test)
Теперь StandardScaler обучается только на X_train.
Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing.
🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 413 |
| 12 | 💡 GPT-6 Astra: модели уже работают как исследовательские агенты
OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам.
Что интересного:
— Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов;
— может работать с Blender, Excel, Power BI и браузером;
— на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах;
— на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям.
При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 686 |
| 13 | 🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning”
Это сборник задач с решениями, где вы на бумаге разбираете:
— оптимизацию и линейную алгебру
— графические модели
— Variational Inference
— Monte-Carlo методы
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 791 |
| 14 | 🤖 Не одна LLM, а роутер
Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы между разными моделями и учитывать стоимость, latency и доступность.
Простые задачи — дешёвая модель, сложные — мощная. Такой подход уже становится частью LLM-инфраструктуры.
🔗 LiteLLM — документация
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 670 |
| 15 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 561 |
| 16 | 🧠 DAAF: Claude Code для полноценного анализа данных
Появился интересный open-source инструмент — Data Analyst Augmentation Framework (DAAF). Он превращает Claude Code в помощника для количественного анализа на Python или R.
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.
Свежая версия 3.0.2 вышла 18 августа.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 803 |
| 17 | Что делать айтишнику в наше турбулентное время?
Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда.
Вариант второй: адаптироваться.
Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований.
— Почему твоё резюме не даёт откликов
— Почему ты не зарабатываешь 400к?
— Где искать работу ML-инженеру?
И ещё много полезных материалов уже ждёт тебя на канале.
Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers
Реклама
ИП Камаев Богдан Эльмарович
ИНН 770973951244
erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6 | 1 151 |
| 18 | 🤖 Anthropic учит AI-агентов управлять реальным железом
Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием.
Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом.
Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним.
MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно.
Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами;
— меняет параметры эксперимента в реальном времени;
— реагирует на результаты и ошибки оборудования;
— координирует роботизированную руку и liquid handler;
— превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов.
И здесь начинается самое интересное.
У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл.
У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент.
Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта.
Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент».
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 400 |
| 19 | 🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа?
Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей.
Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция.
❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры.
Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии:
💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры.
Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 463 |
| 20 | ⏳ Главная ошибка при валидации временных рядов
Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет.
🤩 Для временных рядов используйте разбиение по времени:
from sklearn.model_selection import TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5, gap=24)
for train_idx, val_idx in tscv.split(X):
X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить:
— скейлеры и энкодеры fit только на train каждого фолда;
— lag и rolling не должны использовать будущие значения;
— gap выбирайте с учётом горизонта прогноза и способа формирования признаков.
Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 506 |
