ar
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

الذهاب إلى القناة على Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

إظهار المزيد

📈 نظرة تحليلية على قناة تيليجرام Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

تُعد قناة Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 18 339 مشتركاً، محتلاً المرتبة 6 942 في فئة التكنولوجيات والتطبيقات والمرتبة 35 725 في منطقة روسيا.

📊 مؤشرات الجمهور والحراك

منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 18 339 مشتركاً.

بحسب آخر البيانات بتاريخ 15 سبتمبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -46، وفي آخر 24 ساعة بمقدار -2، مع بقاء الوصول العام مرتفعاً.

  • حالة التحقق: غير موثّقة
  • معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 8.72‎%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 3.89‎% من ردود الفعل نسبةً إلى إجمالي المشتركين.
  • وصول المنشورات: يحصل كل منشور على متوسط 1 600 مشاهدة. وخلال اليوم الأول يجمع عادةً 714 مشاهدة.
  • التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 4.
  • الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل сайентиста, llm, буст, навигация, openai.

📝 الوصف وسياسة المحتوى

يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 16 سبتمبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.

18 339
المشتركون
-224 ساعات
-147 أيام
-4630 أيام
أرشيف المشاركات
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе:
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠

🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCE
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai. Что заявлено:
🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang.
Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 ⁠Модель на Hugging Face 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс да
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏 📍 Выбрать курс

⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (varia
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение. Как работает:
✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование)
Примеры:
✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor
👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает:
✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильную
Примеры:
✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost
📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным
Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?
🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, г
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос:
python machine learning
Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает:
TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.
Упрощённо:
score =
  TF × IDF × поправка на длину документа
💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпа
📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работ
🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений. С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД. 🤩 Особенности:
— Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества систем
Установка:

pip install pixeltable
🔗 Документация и примеры 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧠 Зачем Pipeline в scikit-learn Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:

scaler.fit_transform(X)  # уже увидел весь датасет
X_train, X_test = train_test_split(X)
💡 Правильнее спрятать preprocessing внутрь Pipeline:

from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

model = make_pipeline(
    StandardScaler(),
    LogisticRegression()
)

model.fit(X_train, y_train)
score = model.score(X_test, y_test)
Теперь StandardScaler обучается только на X_train. Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing. 🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заме
+2
💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам. Что интересного: — Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов; — может работать с Blender, Excel, Power BI и браузером; — на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах; — на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям. При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning” Это сборник задач с решениями, где вы на бумаге разбираете:
— оптимизацию и линейную алгебру — графические модели — Variational Inference — Monte-Carlo методы
📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы ме
🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы между разными моделями и учитывать стоимость, latency и доступность. Простые задачи — дешёвая модель, сложные — мощная. Такой подход уже становится частью LLM-инфраструктуры. 🔗 LiteLLM — документация 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation F
🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation Framework (DAAF). Он превращает Claude Code в помощника для количественного анализа на Python или R.
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.
Свежая версия 3.0.2 вышла 18 августа. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседо
Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда. Вариант второй: адаптироваться. Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований. — Почему твоё резюме не даёт откликовПочему ты не зарабатываешь 400к?Где искать работу ML-инженеру? И ещё много полезных материалов уже ждёт тебя на канале. Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers Реклама ИП Камаев Богдан Эльмарович ИНН 770973951244 erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6

🤖 Anthropic учит AI-агентов управлять реальным железом Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием. Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом. Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним. MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно. Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами; — меняет параметры эксперимента в реальном времени; — реагирует на результаты и ошибки оборудования; — координирует роботизированную руку и liquid handler; — превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов. И здесь начинается самое интересное. У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл. У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент. Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта. Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент». 🔗 Источник 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT предста
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей. Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция. ❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры. Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии: 💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры. Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

Главная ошибка при валидации временных рядов Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет. 🤩 Для временных рядов используйте разбиение по времени:

from sklearn.model_selection import TimeSeriesSplit

tscv = TimeSeriesSplit(n_splits=5, gap=24)

for train_idx, val_idx in tscv.split(X):
    X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить: — скейлеры и энкодеры fit только на train каждого фолда; — lag и rolling не должны использовать будущие значения; — gap выбирайте с учётом горизонта прогноза и способа формирования признаков. Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста