uz
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Kanalga Telegram’da o‘tish

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

Ko'proq ko'rsatish

📈 Telegram kanali Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение analitikasi

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 18 339 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 6 935-o'rinni va Rossiya mintaqasida 35 592-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 18 339 obunachiga ega bo‘ldi.

05 Oktabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -24 ga, so‘nggi 24 soatda esa 8 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 8.43% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 4.07% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 1 546 marta ko‘riladi; birinchi sutkada odatda 746 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 10 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent сайентиста, llm, буст, навигация, openai kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @tproger_sales_bot Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”

Yuqori yangilanish chastotasi (oxirgi ma’lumot 06 Oktabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

18 339
Obunachilar
+824 soatlar
+67 kun
-2430 kun
Postlar arxiv
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных re
🛡️ OpenAI предлагает safety cases для обучения frontier-моделей OpenAI описала подход, при котором перед запуском крупных reinforcement learning-тренировок должна появляться структурированная документация по безопасности — с аргументами, доказательствами и остаточными рисками. В подходе выделяют три уровня: 🟢 технические меры — alignment, sandboxing и мониторинг; 🟢 операционные правила — независимый review, возможность остановить обучение и аудит; 🟢 разбор инцидентов — поиск причин, postmortem и превращение инцидентов в regression-тесты. Пока это не готовый отраслевой стандарт, а набор практик, которые OpenAI внедряет и планирует развивать. 🔗 Читать блог 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

Пока вы ковыряете обычные приложения, AI уже ставит эксперименты и делает покупки! Стендап-комик Сева Ловкачёв вместе с экспертами MAGNIT OMNI и гостями в шоу «ПРОДАКТовая корзина» обсуждают актуальные новости технологий и разбираются, что попадёт на прод, а что — на мусорку. Без духоты, с классными экспертами и  интеллектуальным  юмором. Смотреть: • YouTube • VK Видео

🤖 Google на 5 месяцев пустил AI-агента в реальные команды Агент читал рабочие чаты и документы, заводил баги, писал коллегам и сам инициировал действия. Но главный эксперимент оказался не про продуктивность. Люди начали ограничивать его доступ, создавать чаты без агента и отдельно договариваться о том, что ему можно делать. 🔗 Исследование 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически вы
🧠 Как создать единый технологический контур для распределения ML-нагрузок Гибридная инфраструктура позволяет экономически выгодно распределять разные этапы ИИ- и ML-пайплайна по различным средам.  Для реализации полноценного гибрида Yandex Cloud имеет все необходимые инструменты. 🔹 Безопасная связность. Cloud Interconnect объединяет локальную инфраструктуру и облако по приватному соединению. VPC Private Endpoint позволяет подключать облачные ресурсы без выхода трафика в публичный Интернет. 🔹 Выделенные вычисления. BareMetal Extend — инфраструктура на выделенных серверах с виртуализацией или Kubernetes. Такой контур можно использовать для задач, где нужны изоляция, контроль над инфраструктурой и обработка данных вне публичного облака. 🔹 Полноценная data-платформа внутри корпоративной инфраструктуры. В Stackland, который разворачивается локально в контуре компании, появились новые PaaS-компоненты: • Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных; • Managed Service for Trino + Object Storage — аналитический слой; • Managed Service for Apache Airflow® — оркестрация data-пайплайнов; • DataLens — визуализация данных. В итоге получается единый технологический контур: локальная инфраструктура + облачные ресурсы + приватная сеть + инструменты для хранения, обработки и анализа данных. Для data science это особенно интересно: вычисления и данные можно размещать там, где это рационально для конкретной задачи — учитывая требования к безопасности, производительности и стоимости. Свое железо остается в деле, а облако добавляет гибкости. ⚙️

🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать):
🧠 Что выведет код? ❤️ [1, 2, 99, 4] 🔥 [1, 2, 3, 4] 👍 [99, 2, 3, 4] 👾 Error 👇 Правильный ответ (нажми, чтобы прочитать): 🔥 [1, 2, 3, 4] x[x > 2] использует булеву индексацию NumPy и создаёт отдельный массив. Поэтому изменение y не затрагивает исходный x. ⚠️ В NumPy важно понимать, когда вы работаете с view, а когда получаете copy. Обычный срез и булева индексация ведут себя по-разному. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧹 Пора почистить промпты для Claude Code Для этого есть команда:
/claude-api-prompt-audit
Она проверяет CLAUDE.md, AGENTS.md, skills и промпты на старые инструкции вроде MUST/ALWAYS, лишнего think step by step, громоздких шаблонов и устаревших few-shot. Если конфиги собирались годами, такой аудит может убрать лишние токены, tool calls и противоречивые правила. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных о
🧠 OpenAI выпустила MentalHealthBench — открытый бенчмарк для ИИ Он оценивает не только способность модели избегать вредных ответов, но и то, как она ведёт сам диалог: уточняет ли контекст, учитывает ли ситуацию пользователя, сохраняет ли его свободу выбора и предлагает ли подходящие действия. 🔴 Над созданием набора работали 80+ психологов и психиатров из 22 стран. В нём есть сценарии от повседневного стресса до кризисных ситуаций, а также разные типы пользователей — взрослые, подростки, специалисты и люди, оказывающие поддержку. Для каждой ситуации эксперты формировали собственные критерии оценки, после чего ответы моделей проверялись по этим рубрикам. MentalHealthBench опубликован открыто — исследователи могут использовать его для собственных экспериментов и оценки моделей. 🔗 Источник 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов. Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:
🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor.
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

Repost from ML Underhood
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0. Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами. По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь раз меньшем активном числе параметров. Вместе с весами опубликовали технический отчёт на Хабре. В нём — устройство датасета, scaling laws, стабилизация MoE, абляционные эксперименты и подходы, которые не сработали. Среди интересных наблюдений: — для корректного подбора гиперпараметров по scaling laws пришлось пересобрать валидационные датасеты так, чтобы loss на них больше коррелировал с качеством модели; — много внимания уделили стабилизации обучения и борьбе с ростом активаций, который приводил к взрыву обучения; — одного обучения сложным рассуждениям оказалось недостаточно для агентских навыков — взаимодействия с инструментами пришлось добавлять уже в претрейн. Модель и бенчмарки (WikiWebFacts и HardMultiQA) уже на Hugging Face. Полный техрепорт — на Хабре. ML Underhood

🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начать Вот набор, который реально закрывает почти все задачи: 🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU. 🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля. 🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами. 🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас. 🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO и reward-модели. 🔴 PEFT Основа всего: LoRA/QLoRA позволяют обучать большие модели на обычном железе и хранить веса в мегабайтах. 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста

🎲 Что общего у кубика Рубика и AI? Поиск по пространству состояний Кубик Рубика можно представить как граф:
— каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному.
У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов. Похожий принцип действительно используется в задачах поиска: 🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий. Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных. Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральны
А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLS Реклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw

🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab. Что можно сделать: 1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат. Подойдёт, чтобы:
— попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM.
⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета. 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями. В основе:
— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.
🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах. Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть. Почему интересно: — обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа. ⚠️ Это пока исследовательский метод — до замены backpropagation в больших моделях далеко. 🔗 Статья 🔗 Код 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста

😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потер
😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода. 🔘 Поговорим о том: — когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge. ✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после. ⬇️ 18 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок 💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы разберём на вебинаре. 🔗 Зарегистрироваться на вебинар⁠