ar
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

الذهاب إلى القناة على Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

إظهار المزيد

📈 نظرة تحليلية على قناة تيليجرام Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

تُعد قناة Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 18 339 مشتركاً، محتلاً المرتبة 6 872 في فئة التكنولوجيات والتطبيقات والمرتبة 35 237 في منطقة روسيا.

📊 مؤشرات الجمهور والحراك

منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 18 339 مشتركاً.

بحسب آخر البيانات بتاريخ 07 أكتوبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -6، وفي آخر 24 ساعة بمقدار 1، مع بقاء الوصول العام مرتفعاً.

  • حالة التحقق: غير موثّقة
  • معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 7.65‎%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 4.13‎% من ردود الفعل نسبةً إلى إجمالي المشتركين.
  • وصول المنشورات: يحصل كل منشور على متوسط 1 403 مشاهدة. وخلال اليوم الأول يجمع عادةً 757 مشاهدة.
  • التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 10.
  • الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل сайентиста, llm, буст, навигация, openai.

📝 الوصف وسياسة المحتوى

يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
“Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”

بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 08 أكتوبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.

18 339
المشتركون
+124 ساعات
+107 أيام
-630 أيام
جذب المشتركين
أكتوبر '26
أكتوبر '26
+26
في 0 قنوات
سبتمبر '26
+83
في 0 قنوات
Get PRO
أغسطس '26
+70
في 0 قنوات
Get PRO
يوليو '26
+83
في 0 قنوات
Get PRO
يونيو '26
+97
في 2 قنوات
Get PRO
مايو '26
+142
في 2 قنوات
Get PRO
أبريل '26
+106
في 1 قنوات
Get PRO
مارس '26
+329
في 4 قنوات
Get PRO
فبراير '26
+154
في 5 قنوات
Get PRO
يناير '26
+212
في 4 قنوات
Get PRO
ديسمبر '25
+211
في 3 قنوات
Get PRO
نوفمبر '25
+101
في 1 قنوات
Get PRO
أكتوبر '25
+148
في 5 قنوات
Get PRO
سبتمبر '25
+105
في 2 قنوات
Get PRO
أغسطس '25
+103
في 4 قنوات
Get PRO
يوليو '25
+171
في 2 قنوات
Get PRO
يونيو '25
+185
في 42 قنوات
Get PRO
مايو '25
+319
في 6 قنوات
Get PRO
أبريل '25
+206
في 18 قنوات
Get PRO
مارس '25
+247
في 53 قنوات
Get PRO
فبراير '25
+236
في 36 قنوات
Get PRO
يناير '25
+180
في 41 قنوات
Get PRO
ديسمبر '24
+212
في 42 قنوات
Get PRO
نوفمبر '24
+217
في 52 قنوات
Get PRO
أكتوبر '24
+224
في 43 قنوات
Get PRO
سبتمبر '24
+249
في 38 قنوات
Get PRO
أغسطس '24
+269
في 37 قنوات
Get PRO
يوليو '24
+197
في 37 قنوات
Get PRO
يونيو '24
+257
في 31 قنوات
Get PRO
مايو '24
+429
في 38 قنوات
Get PRO
أبريل '24
+339
في 38 قنوات
Get PRO
مارس '24
+437
في 32 قنوات
Get PRO
فبراير '24
+426
في 32 قنوات
Get PRO
يناير '24
+473
في 28 قنوات
Get PRO
ديسمبر '23
+604
في 34 قنوات
Get PRO
نوفمبر '23
+289
في 13 قنوات
Get PRO
أكتوبر '23
+462
في 22 قنوات
Get PRO
سبتمبر '23
+631
في 0 قنوات
Get PRO
أغسطس '23
+488
في 0 قنوات
Get PRO
يوليو '23
+420
في 0 قنوات
Get PRO
يونيو '23
+329
في 0 قنوات
Get PRO
مايو '23
+433
في 0 قنوات
Get PRO
أبريل '23
+224
في 0 قنوات
Get PRO
مارس '23
+712
في 0 قنوات
Get PRO
فبراير '23
+249
في 0 قنوات
Get PRO
يناير '23
+260
في 0 قنوات
Get PRO
ديسمبر '22
+292
في 0 قنوات
Get PRO
نوفمبر '22
+407
في 0 قنوات
Get PRO
أكتوبر '22
+172
في 0 قنوات
Get PRO
سبتمبر '22
+209
في 0 قنوات
Get PRO
أغسطس '22
+287
في 0 قنوات
Get PRO
يوليو '22
+352
في 0 قنوات
Get PRO
يونيو '22
+407
في 0 قنوات
Get PRO
مايو '22
+166
في 0 قنوات
Get PRO
أبريل '22
+215
في 0 قنوات
Get PRO
مارس '22
+225
في 0 قنوات
Get PRO
فبراير '22
+129
في 0 قنوات
Get PRO
يناير '22
+250
في 0 قنوات
Get PRO
ديسمبر '21
+203
في 0 قنوات
Get PRO
نوفمبر '21
+253
في 0 قنوات
Get PRO
أكتوبر '21
+237
في 0 قنوات
Get PRO
سبتمبر '21
+208
في 0 قنوات
Get PRO
أغسطس '21
+297
في 0 قنوات
Get PRO
يوليو '21
+312
في 0 قنوات
Get PRO
يونيو '21
+288
في 0 قنوات
Get PRO
مايو '21
+446
في 0 قنوات
Get PRO
أبريل '21
+446
في 0 قنوات
Get PRO
مارس '21
+429
في 0 قنوات
Get PRO
فبراير '21
+396
في 0 قنوات
Get PRO
يناير '21
+351
في 0 قنوات
Get PRO
ديسمبر '20
+12 450
في 0 قنوات
التاريخ
نمو المشتركين
الإشارات
القنوات
08 أكتوبر0
07 أكتوبر+3
06 أكتوبر+5
05 أكتوبر+8
04 أكتوبر+3
03 أكتوبر+6
02 أكتوبر+1
01 أكتوبر0
منشورات القناة
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных re
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных reinforcement learning-тренировок должна появляться структурированная документация по безопасности — с аргументами, доказательствами и остаточными рисками. В подходе выделяют три уровня: 🟢 технические меры — alignment, sandboxing и мониторинг; 🟢 операционные правила — независимый review, возможность остановить обучение и аудит; 🟢 разбор инцидентов — поиск причин, postmortem и превращение инцидентов в regression-тесты. Пока это не готовый отраслевой стандарт, а набор практик, которые OpenAI внедряет и планирует развивать. 🔗 Читать блог 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

2
Пока вы ковыряете обычные приложения, AI уже ставит эксперименты и делает покупки! Стендап-комик Сева Ловкачёв вместе с экспе
Пока вы ковыряете обычные приложения, AI уже ставит эксперименты и делает покупки! Стендап-комик Сева Ловкачёв вместе с экспертами MAGNIT OMNI и гостями в шоу «ПРОДАКТовая корзина» обсуждают актуальные новости технологий и разбираются, что попадёт на прод, а что — на мусорку. Без духоты, с классными экспертами и  интеллектуальным  юмором. Смотреть: • YouTube • VK Видео
1 031
3
🤖 Google на 5 месяцев пустил AI-агента в реальные команды Агент читал рабочие чаты и документы, заводил баги, писал коллегам и сам инициировал действия. Но главный эксперимент оказался не про продуктивность. Люди начали ограничивать его доступ, создавать чаты без агента и отдельно договариваться о том, что ему можно делать. 🔗 Исследование 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 166
4
🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически вы
🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически выгодно распределять разные этапы ИИ- и ML-пайплайна по различным средам.  Для реализации полноценного гибрида Yandex Cloud имеет все необходимые инструменты. 🔹 Безопасная связность. Cloud Interconnect объединяет локальную инфраструктуру и облако по приватному соединению. VPC Private Endpoint позволяет подключать облачные ресурсы без выхода трафика в публичный Интернет. 🔹 Выделенные вычисления. BareMetal Extend — инфраструктура на выделенных серверах с виртуализацией или Kubernetes. Такой контур можно использовать для задач, где нужны изоляция, контроль над инфраструктурой и обработка данных вне публичного облака. 🔹 Полноценная data-платформа внутри корпоративной инфраструктуры. В Stackland, который разворачивается локально в контуре компании, появились новые PaaS-компоненты: • Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных; • Managed Service for Trino + Object Storage — аналитический слой; • Managed Service for Apache Airflow® — оркестрация data-пайплайнов; • DataLens — визуализация данных. В итоге получается единый технологический контур: локальная инфраструктура + облачные ресурсы + приватная сеть + инструменты для хранения, обработки и анализа данных. Для data science это особенно интересно: вычисления и данные можно размещать там, где это рационально для конкретной задачи — учитывая требования к безопасности, производительности и стоимости. Свое железо остается в деле, а облако добавляет гибкости. ⚙️
1 040
5
🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать):
🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать): 🔥 [1, 2, 3, 4] x[x > 2] использует булеву индексацию NumPy и создаёт отдельный массив. Поэтому изменение y не затрагивает исходный x. ⚠️ В NumPy важно понимать, когда вы работаете с view, а когда получаете copy. Обычный срез и булева индексация ведут себя по-разному. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 054
6
🤡🤡 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
🤡🤡 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 153
7
🧹 Пора почистить промпты для Claude Code Для этого есть команда: /claude-api-prompt-audit Она проверяет CLAUDE.md, AGENTS.md
🧹 Пора почистить промпты для Claude Code Для этого есть команда: /claude-api-prompt-audit Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot. Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 266
8
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных о
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия. 🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку. Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам. MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей. 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 454
9
🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов. Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты: 🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 575
10
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
RAG vs. Agentic RAG: в чём разница ❔ 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 655
11
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0. Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами. По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров. Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений: — для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели; — много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения; — одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн. Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре. ML Underhood
1 463
12
🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать Вот набор, который реально закрывает почти все задачи: 🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU. 🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля. 🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами. 🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас. 🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели. 🔴 PEFT Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах. 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста
1 490
13
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигу
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф: — каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному. У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов. Похожий принцип действительно используется в задачах поиска: 🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий. Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 493
14
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Science
1 456
15
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patc
🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных. Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 619
16
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральны
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
1 510
17
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 596
18
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей п
🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab. Что можно сделать: 1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат. Подойдёт, чтобы: — попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM. ⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 952
19
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распрост
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе: — predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция. 🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 777
20
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠
1 658