ch
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

前往频道在 Telegram

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

显示更多

📈 Telegram 频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение 的分析概览

频道 Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 18 343 名订阅者,在 技术与应用 类别中位列第 6 935,并在 俄罗斯 地区排名第 35 592 位。

📊 受众指标与增长动态

自 невідомо 创建以来,项目保持高速增长,吸引了 18 343 名订阅者。

根据 05 十月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -24,过去 24 小时变化为 8,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 8.43%。内容发布后 24 小时内通常能获得 4.07% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 1 546 次浏览,首日通常累积 746 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 10。
  • 主题关注点: 内容集中在 сайентиста, llm, буст, навигация, openai 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
“Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”

凭借高频更新(最新数据采集于 06 十月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

18 343
订阅者
+824 小时
+67 天
-2430 天
帖子存档
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных re
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных reinforcement learning-тренировок должна появляться структурированная документация по безопасности — с аргументами, доказательствами и остаточными рисками. В подходе выделяют три уровня: 🟢 технические меры — alignment, sandboxing и мониторинг; 🟢 операционные правила — независимый review, возможность остановить обучение и аудит; 🟢 разбор инцидентов — поиск причин, postmortem и превращение инцидентов в regression-тесты. Пока это не готовый отраслевой стандарт, а набор практик, которые OpenAI внедряет и планирует развивать. 🔗 Читать блог 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

Пока вы ковыряете обычные приложения, AI уже ставит эксперименты и делает покупки! Стендап-комик Сева Ловкачёв вместе с экспертами MAGNIT OMNI и гостями в шоу «ПРОДАКТовая корзина» обсуждают актуальные новости технологий и разбираются, что попадёт на прод, а что — на мусорку. Без духоты, с классными экспертами и  интеллектуальным  юмором. Смотреть: • YouTube • VK Видео

🤖 Google на 5 месяцев пустил AI-агента в реальные команды Агент читал рабочие чаты и документы, заводил баги, писал коллегам и сам инициировал действия. Но главный эксперимент оказался не про продуктивность. Люди начали ограничивать его доступ, создавать чаты без агента и отдельно договариваться о том, что ему можно делать. 🔗 Исследование 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически вы
🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически выгодно распределять разные этапы ИИ- и ML-пайплайна по различным средам.  Для реализации полноценного гибрида Yandex Cloud имеет все необходимые инструменты. 🔹 Безопасная связность. Cloud Interconnect объединяет локальную инфраструктуру и облако по приватному соединению. VPC Private Endpoint позволяет подключать облачные ресурсы без выхода трафика в публичный Интернет. 🔹 Выделенные вычисления. BareMetal Extend — инфраструктура на выделенных серверах с виртуализацией или Kubernetes. Такой контур можно использовать для задач, где нужны изоляция, контроль над инфраструктурой и обработка данных вне публичного облака. 🔹 Полноценная data-платформа внутри корпоративной инфраструктуры. В Stackland, который разворачивается локально в контуре компании, появились новые PaaS-компоненты: • Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных; • Managed Service for Trino + Object Storage — аналитический слой; • Managed Service for Apache Airflow® — оркестрация data-пайплайнов; • DataLens — визуализация данных. В итоге получается единый технологический контур: локальная инфраструктура + облачные ресурсы + приватная сеть + инструменты для хранения, обработки и анализа данных. Для data science это особенно интересно: вычисления и данные можно размещать там, где это рационально для конкретной задачи — учитывая требования к безопасности, производительности и стоимости. Свое железо остается в деле, а облако добавляет гибкости. ⚙️

🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать):
🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать): 🔥 [1, 2, 3, 4] x[x > 2] использует булеву индексацию NumPy и создаёт отдельный массив. Поэтому изменение y не затрагивает исходный x. ⚠️ В NumPy важно понимать, когда вы работаете с view, а когда получаете copy. Обычный срез и булева индексация ведут себя по-разному. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧹 Пора почистить промпты для Claude Code Для этого есть команда:
/claude-api-prompt-audit
Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot. Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных о
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия. 🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку. Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам. MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей. 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов. Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:
🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor.
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

Repost from ML Underhood
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0. Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами. По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров. Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений: — для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели; — много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения; — одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн. Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре. ML Underhood

🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать Вот набор, который реально закрывает почти все задачи: 🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU. 🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля. 🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами. 🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас. 🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели. 🔴 PEFT Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах. 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста

🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф:
— каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному.
У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов. Похожий принцип действительно используется в задачах поиска: 🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий. Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных. Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральны
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw

🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab. Что можно сделать: 1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат. Подойдёт, чтобы:
— попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM.
⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе:
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠