Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
نمایش بیشتر📈 تحلیل کانال تلگرام Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
کانال Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 18 343 مشترک است و جایگاه 6 935 را در دسته فناوری و برنامهها و رتبه 35 592 را در منطقه روسيا دارد.
📊 شاخصهای مخاطب و پویایی
از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 18 343 مشترک جذب کرده است.
بر اساس آخرین دادهها در تاریخ 05 اکتبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر -24 و در ۲۴ ساعت گذشته برابر 8 بوده و همچنان دسترسی گستردهای حفظ شده است.
- وضعیت تأیید: تأیید نشده
- نرخ تعامل (ER): میانگین تعامل مخاطب 8.43% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 4.07% واکنش نسبت به کل مشترکان کسب میکند.
- دسترسی پستها: هر پست به طور میانگین 1 546 بازدید دریافت میکند. در اولین روز معمولاً 746 بازدید جمعآوری میشود.
- واکنشها و تعامل: مخاطبان بهطور فعال حمایت میکنند؛ میانگین واکنش به هر پست 10 است.
- علایق موضوعی: محتوا بر موضوعات کلیدی مانند сайентиста, llm, буст, навигация, openai تمرکز دارد.
📝 توضیح و سیاست محتوایی
نویسنده این فضا را محل بیان دیدگاههای شخصی توصیف میکند:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @tproger_sales_bot
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
به لطف بهروزرسانیهای پرتکرار (آخرین داده در تاریخ 06 اکتبر, 2026)، کانال همواره بهروز و دارای دسترسی بالاست. تحلیلها نشان میدهد مخاطبان بهطور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامهها تبدیل کردهاند.
در حال بارگیری داده...
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 06 اکتبر | +4 | |||
| 05 اکتبر | +8 | |||
| 04 اکتبر | +3 | |||
| 03 اکتبر | +6 | |||
| 02 اکتبر | +1 | |||
| 01 اکتبر | 0 |
| 2 | Пока вы ковыряете обычные приложения, AI уже ставит эксперименты и делает покупки!
Стендап-комик Сева Ловкачёв вместе с экспертами MAGNIT OMNI и гостями в шоу «ПРОДАКТовая корзина» обсуждают актуальные новости технологий и разбираются, что попадёт на прод, а что — на мусорку.
Без духоты, с классными экспертами и интеллектуальным юмором.
Смотреть:
• YouTube
• VK Видео | 992 |
| 3 | 🤖 Google на 5 месяцев пустил AI-агента в реальные команды
Агент читал рабочие чаты и документы, заводил баги, писал коллегам и сам инициировал действия.
Но главный эксперимент оказался не про продуктивность. Люди начали ограничивать его доступ, создавать чаты без агента и отдельно договариваться о том, что ему можно делать.
🔗 Исследование
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 109 |
| 4 | 🧠 Как создать единый технологический контур для распределения ML-нагрузок
Гибридная инфраструктура позволяет экономически выгодно распределять разные этапы ИИ- и ML-пайплайна по различным средам.
Для реализации полноценного гибрида Yandex Cloud имеет все необходимые инструменты.
🔹 Безопасная связность.
Cloud Interconnect объединяет локальную инфраструктуру и облако по приватному соединению. VPC Private Endpoint позволяет подключать облачные ресурсы без выхода трафика в публичный Интернет.
🔹 Выделенные вычисления.
BareMetal Extend — инфраструктура на выделенных серверах с виртуализацией или Kubernetes. Такой контур можно использовать для задач, где нужны изоляция, контроль над инфраструктурой и обработка данных вне публичного облака.
🔹 Полноценная data-платформа внутри корпоративной инфраструктуры.
В Stackland, который разворачивается локально в контуре компании, появились новые PaaS-компоненты:
• Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных;
• Managed Service for Trino + Object Storage — аналитический слой;
• Managed Service for Apache Airflow® — оркестрация data-пайплайнов;
• DataLens — визуализация данных.
В итоге получается единый технологический контур: локальная инфраструктура + облачные ресурсы + приватная сеть + инструменты для хранения, обработки и анализа данных.
Для data science это особенно интересно: вычисления и данные можно размещать там, где это рационально для конкретной задачи — учитывая требования к безопасности, производительности и стоимости.
Свое железо остается в деле, а облако добавляет гибкости. ⚙️ | 993 |
| 5 | 🧠 Что выведет код?
❤️ [1, 2, 99, 4]
🔥 [1, 2, 3, 4]
👍 [99, 2, 3, 4]
👾 Error
👇 Правильный ответ (нажми, чтобы прочитать):
🔥 [1, 2, 3, 4]
x[x > 2] использует булеву индексацию NumPy и создаёт отдельный массив. Поэтому изменение y не затрагивает исходный x.
⚠️ В NumPy важно понимать, когда вы работаете с view, а когда получаете copy. Обычный срез и булева индексация ведут себя по-разному.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 030 |
| 6 | 🤡🤡
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 133 |
| 7 | 🧹 Пора почистить промпты для Claude Code
Для этого есть команда:
/claude-api-prompt-audit
Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot.
Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 247 |
| 8 | 🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ
Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия.
🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку.
Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам.
MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей.
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 443 |
| 9 | 🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов.
Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:
🟡 локальный MCP-клиент;
🟡 Agentic RAG;
🟡 финансовый аналитик;
🟡 voice agent;
🟡 Deep Researcher;
🟡 RAG по документам и видео;
🟡 генератор синтетических данных;
🟡 shared memory для Claude Desktop и Cursor.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 546 |
| 10 | RAG vs. Agentic RAG: в чём разница ❔
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 645 |
| 11 | Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0.
Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами.
По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров.
Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений:
— для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели;
— много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения;
— одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн.
Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре.
ML Underhood | 1 455 |
| 12 | 🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать
Вот набор, который реально закрывает почти все задачи:
🔴 Unsloth
Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU.
🔴 LLaMA-Factory
Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля.
🔴 DeepSpeed
Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами.
🔴 Axolotl
Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас.
🔴 TRL
Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели.
🔴 PEFT
Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах.
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста | 1 490 |
| 13 | 🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний
Кубик Рубика можно представить как граф:
— каждая конфигурация — вершина;
— поворот грани — ребро;
— решение — путь от перемешанного состояния к собранному.
У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов.
Похожий принцип действительно используется в задачах поиска:
🔴 шахматный движок исследует варианты ходов;
🔴 навигатор — граф дорог;
🔴 AI-агент — возможные последовательности действий.
Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 493 |
| 14 | Что выведет код?
👍 — {}
👾 — {«x»: 1}
🥰 — Error
🔥 — None
🐸 Библиотека задач по Data Science | 1 456 |
| 15 | 🌞 3 open-source инструмента для AI-агентов
🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам.
🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами.
🔘 Scrapling — быстрый scraping сайтов и извлечение данных.
Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 619 |
| 16 | А вы уже забрали свой подарок ко Дню программиста?
К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS
Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw | 1 510 |
| 17 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 596 |
| 18 | 🤗 Fine-tuning LLM в Google Colab — без собственной GPU
Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab.
Что можно сделать:
1️⃣ Открыть готовый Colab.
2️⃣ Установить Unsloth Studio.
3️⃣ Выбрать модель.
4️⃣ Загрузить датасет — например, CSV или данные из PDF.
5️⃣ Запустить fine-tuning и экспортировать результат.
Подойдёт, чтобы:
— попробовать LoRA/QLoRA;
— адаптировать модель под свой формат данных;
— собрать небольшой synthetic dataset;
— разобраться с процессом дообучения LLM.
⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета.
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 952 |
| 19 | 🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation
Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями.
В основе:
— predictive coding;
— локальные ошибки;
— множители Лагранжа;
— PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах.
Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть.
Почему интересно:
— обучение остаётся локальным;
— подход ближе к идеям NeuroAI;
— потенциально полезен для нейроморфного железа.
⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко.
🔗 Статья
🔗 Код
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 777 |
| 20 | 😭 Как не потратить недельный лимит AI-кодинга за три дня?
Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.
🔘 Поговорим о том:
— когда дорогая модель действительно нужна, а когда хватит дешёвой;
— сколько стоит один прогон и куда уходят токены;
— какие задачи можно отдавать субагентам;
— как настроить маршрутизацию моделей;
— что проверять в AI-коде перед merge.
✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.
⬇️ 18 сентября, 19:00 МСК
⬇️ 1,5 часа · бесплатно
⬇️ Арсений Харланов и Олег Лайок
💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре.
🔗 Зарегистрироваться на вебинар | 1 658 |
