ar
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

الذهاب إلى القناة على Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

إظهار المزيد

📈 نظرة تحليلية على قناة تيليجرام Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

تُعد قناة Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 18 339 مشتركاً، محتلاً المرتبة 6 940 في فئة التكنولوجيات والتطبيقات والمرتبة 35 711 في منطقة روسيا.

📊 مؤشرات الجمهور والحراك

منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 18 339 مشتركاً.

بحسب آخر البيانات بتاريخ 16 سبتمبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -50، وفي آخر 24 ساعة بمقدار -2، مع بقاء الوصول العام مرتفعاً.

  • حالة التحقق: غير موثّقة
  • معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 8.66‎%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 4.07‎% من ردود الفعل نسبةً إلى إجمالي المشتركين.
  • وصول المنشورات: يحصل كل منشور على متوسط 1 589 مشاهدة. وخلال اليوم الأول يجمع عادةً 747 مشاهدة.
  • التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 5.
  • الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل сайентиста, llm, буст, навигация, openai.

📝 الوصف وسياسة المحتوى

يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 17 سبتمبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.

18 339
المشتركون
-224 ساعات
-107 أيام
-5030 أيام
جذب المشتركين
سبتمبر '26
سبتمبر '26
+46
في 0 قنوات
أغسطس '26
+70
في 0 قنوات
Get PRO
يوليو '26
+83
في 0 قنوات
Get PRO
يونيو '26
+97
في 2 قنوات
Get PRO
مايو '26
+142
في 2 قنوات
Get PRO
أبريل '26
+106
في 1 قنوات
Get PRO
مارس '26
+329
في 4 قنوات
Get PRO
فبراير '26
+154
في 5 قنوات
Get PRO
يناير '26
+212
في 4 قنوات
Get PRO
ديسمبر '25
+211
في 3 قنوات
Get PRO
نوفمبر '25
+101
في 1 قنوات
Get PRO
أكتوبر '25
+148
في 5 قنوات
Get PRO
سبتمبر '25
+105
في 2 قنوات
Get PRO
أغسطس '25
+103
في 4 قنوات
Get PRO
يوليو '25
+171
في 2 قنوات
Get PRO
يونيو '25
+185
في 42 قنوات
Get PRO
مايو '25
+319
في 6 قنوات
Get PRO
أبريل '25
+206
في 18 قنوات
Get PRO
مارس '25
+247
في 53 قنوات
Get PRO
فبراير '25
+236
في 36 قنوات
Get PRO
يناير '25
+180
في 41 قنوات
Get PRO
ديسمبر '24
+212
في 42 قنوات
Get PRO
نوفمبر '24
+217
في 52 قنوات
Get PRO
أكتوبر '24
+224
في 43 قنوات
Get PRO
سبتمبر '24
+249
في 38 قنوات
Get PRO
أغسطس '24
+269
في 37 قنوات
Get PRO
يوليو '24
+197
في 37 قنوات
Get PRO
يونيو '24
+257
في 31 قنوات
Get PRO
مايو '24
+429
في 38 قنوات
Get PRO
أبريل '24
+339
في 38 قنوات
Get PRO
مارس '24
+437
في 32 قنوات
Get PRO
فبراير '24
+426
في 32 قنوات
Get PRO
يناير '24
+473
في 28 قنوات
Get PRO
ديسمبر '23
+604
في 34 قنوات
Get PRO
نوفمبر '23
+289
في 13 قنوات
Get PRO
أكتوبر '23
+462
في 22 قنوات
Get PRO
سبتمبر '23
+631
في 0 قنوات
Get PRO
أغسطس '23
+488
في 0 قنوات
Get PRO
يوليو '23
+420
في 0 قنوات
Get PRO
يونيو '23
+329
في 0 قنوات
Get PRO
مايو '23
+433
في 0 قنوات
Get PRO
أبريل '23
+224
في 0 قنوات
Get PRO
مارس '23
+712
في 0 قنوات
Get PRO
فبراير '23
+249
في 0 قنوات
Get PRO
يناير '23
+260
في 0 قنوات
Get PRO
ديسمبر '22
+292
في 0 قنوات
Get PRO
نوفمبر '22
+407
في 0 قنوات
Get PRO
أكتوبر '22
+172
في 0 قنوات
Get PRO
سبتمبر '22
+209
في 0 قنوات
Get PRO
أغسطس '22
+287
في 0 قنوات
Get PRO
يوليو '22
+352
في 0 قنوات
Get PRO
يونيو '22
+407
في 0 قنوات
Get PRO
مايو '22
+166
في 0 قنوات
Get PRO
أبريل '22
+215
في 0 قنوات
Get PRO
مارس '22
+225
في 0 قنوات
Get PRO
فبراير '22
+129
في 0 قنوات
Get PRO
يناير '22
+250
في 0 قنوات
Get PRO
ديسمبر '21
+203
في 0 قنوات
Get PRO
نوفمبر '21
+253
في 0 قنوات
Get PRO
أكتوبر '21
+237
في 0 قنوات
Get PRO
سبتمبر '21
+208
في 0 قنوات
Get PRO
أغسطس '21
+297
في 0 قنوات
Get PRO
يوليو '21
+312
في 0 قنوات
Get PRO
يونيو '21
+288
في 0 قنوات
Get PRO
مايو '21
+446
في 0 قنوات
Get PRO
أبريل '21
+446
في 0 قنوات
Get PRO
مارس '21
+429
في 0 قنوات
Get PRO
فبراير '21
+396
في 0 قنوات
Get PRO
يناير '21
+351
في 0 قنوات
Get PRO
ديسمبر '20
+12 450
في 0 قنوات
التاريخ
نمو المشتركين
الإشارات
القنوات
17 سبتمبر+1
16 سبتمبر0
15 سبتمبر+6
14 سبتمبر+3
13 سبتمبر0
12 سبتمبر+3
11 سبتمبر+3
10 سبتمبر+9
09 سبتمبر+1
08 سبتمبر+8
07 سبتمبر+2
06 سبتمبر0
05 سبتمبر+5
04 سبتمبر+2
03 سبتمبر+2
02 سبتمبر0
01 سبتمبر+1
منشورات القناة
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе:
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

2
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠
979
3
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCE
🧠 DeepSeek-V4.1-Flash без встроенных ограничений На Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai. Что заявлено: 🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang. Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток. 📊 Результаты авторских тестов: HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели. ⚠️ Это сторонняя модификация, поэтому результаты требуют независимой проверки. Для запуска авторы использовали 4×H200. 🔗 ⁠Модель на Hugging Face 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 066
4
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 075
5
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс да
🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy вырастут на 20% 👀 Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏 📍 Выбрать курс
1 126
6
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (varia
⚡️ Шпаргалка: Bagging vs Boosting 👉 Bagging Идея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение. Как работает: ✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование) Примеры: ✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor 👉 Boosting Идея: модели обучаются последовательно → каждая исправляет ошибки предыдущей. Цель: снизить смещение (bias) и повысить точность. Как работает: ✳️ задаём базового слабого ученика ✳️ увеличиваем вес «трудных» объектов ✳️ комбинируем множество слабых моделей в одну сильную Примеры: ✳️ GradientBoosting ✳️ XGBoost ✳️ CatBoost ✳️ LightGBM ✳️ AdaBoost 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 104
7
🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезным Что реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить? 🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь. Задавайте всё, что давно хотелось спросить 📍 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 000
8
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, г
🤔 Почему поиск понимает, что один документ релевантнее другого? Например, запрос: python machine learning Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже? 🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов. Он учитывает: TF — насколько часто термин встречается в документе; IDF — насколько термин редкий во всей коллекции; длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов. Упрощённо: score = TF × IDF × поправка на длину документа 💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 074
9
📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпа
📊 Всё о непрерывном равномерном распределении Разбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 198
10
🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работ
🤩 Pixeltable — декларативная инфраструктура данных для AI Единственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений. С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД. 🤩 Особенности: — Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества систем Установка: pip install pixeltable 🔗 Документация и примеры 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 285
11
🧠 Зачем Pipeline в scikit-learn Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test: scaler.fit_transform(X) # уже увидел весь датасет X_train, X_test = train_test_split(X) 💡 Правильнее спрятать preprocessing внутрь Pipeline: from sklearn.pipeline import make_pipeline from sklearn.preprocessing import StandardScaler from sklearn.linear_model import LogisticRegression model = make_pipeline( StandardScaler(), LogisticRegression() ) model.fit(X_train, y_train) score = model.score(X_test, y_test) Теперь StandardScaler обучается только на X_train. Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing. 🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 413
12
💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заме+2
💡 GPT-6 Astra: модели уже работают как исследовательские агенты OpenAI представила GPT-6 Astra — модель, которая делает заметный шаг от генерации ответа к долгим исследовательским задачам. Что интересного: — Astra умеет сохранять заметки между окнами контекста и искать по прошлым сообщениям и результатам инструментов; — может работать с Blender, Excel, Power BI и браузером; — на Terminal-Bench Science получила 64,6% на 70 командных исследовательских задачах; — на BenchCAD — 95,9% на восстановлении CAD-программ по изображениям. При этом Astra не стала безусловным лидером во всех тестах: в coding-бенчмарках результаты конкурентов находятся рядом. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 686
13
🌸 Если хочется не просто запускать model.fit(), а понимать математику ML, посмотрите книгу “Pen & Paper Exercises in Machine Learning” Это сборник задач с решениями, где вы на бумаге разбираете: — оптимизацию и линейную алгебру — графические модели — Variational Inference — Monte-Carlo методы 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 791
14
🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы ме
🤖 Не одна LLM, а роутер Зачем отправлять каждый запрос в самую дорогую модель? LiteLLM позволяет маршрутизировать запросы между разными моделями и учитывать стоимость, latency и доступность. Простые задачи — дешёвая модель, сложные — мощная. Такой подход уже становится частью LLM-инфраструктуры. 🔗 LiteLLM — документация 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 670
15
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 561
16
🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation F
🧠 DAAF: Claude Code для полноценного анализа данных Появился интересный open-source инструмент — Data Analyst Augmentation Framework (DAAF). Он превращает Claude Code в помощника для количественного анализа на Python или R. Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести. Свежая версия 3.0.2 вышла 18 августа. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 803
17
Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседо
Что делать айтишнику в наше турбулентное время? Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда. Вариант второй: адаптироваться. Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований. — Почему твоё резюме не даёт откликов — Почему ты не зарабатываешь 400к? — Где искать работу ML-инженеру? И ещё много полезных материалов уже ждёт тебя на канале. Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers Реклама ИП Камаев Богдан Эльмарович ИНН 770973951244 erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6
1 151
18
🤖 Anthropic учит AI-агентов управлять реальным железом Anthropic открыла research preview Model Hardware Standard (MHS) — сп
🤖 Anthropic учит AI-агентов управлять реальным железом Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием. Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом. Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним. MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно. Anthropic уже показывает сценарии, где агент: — управляет несколькими лабораторными приборами; — меняет параметры эксперимента в реальном времени; — реагирует на результаты и ошибки оборудования; — координирует роботизированную руку и liquid handler; — превращает найденную последовательность действий в обычный код для дальнейшего выполнения. В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов. И здесь начинается самое интересное. У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл. У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент. Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта. Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент». 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 400
19
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT предста
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей. Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция. ❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога. PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры. Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные. И здесь интересный вывод уже не только для биологии: 💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры. Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 463
20
⏳ Главная ошибка при валидации временных рядов Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет. 🤩 Для временных рядов используйте разбиение по времени: from sklearn.model_selection import TimeSeriesSplit tscv = TimeSeriesSplit(n_splits=5, gap=24) for train_idx, val_idx in tscv.split(X): X_tr, X_val = X[train_idx], X[val_idx] 🤩 Что ещё проверить: — скейлеры и энкодеры fit только на train каждого фолда; — lag и rolling не должны использовать будущие значения; — gap выбирайте с учётом горизонта прогноза и способа формирования признаков. Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 506