Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Ko'proq ko'rsatish📈 Telegram kanali Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение analitikasi
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 18 369 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 7 000-o'rinni va Rossiya mintaqasida 35 999-o'rinni egallagan.
📊 Auditoriya ko‘rsatkichlari va dinamika
невідомо sanasidan buyon loyiha tez o‘sib, 18 369 obunachiga ega bo‘ldi.
01 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -37 ga, so‘nggi 24 soatda esa -3 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.
- Tasdiqlash holati: Tasdiqlanmagan
- Jalb etish (ER): Auditoriya o‘rtacha 7.67% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 3.92% ini tashkil etuvchi reaksiyalarni to‘playdi.
- Post qamrovi: Har bir post o‘rtacha 1 409 marta ko‘riladi; birinchi sutkada odatda 720 ta ko‘rish yig‘iladi.
- Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 6 ta reaksiya keladi.
- Tematik yo‘nalishlar: Kontent сайентиста, llm, буст, навигация, openai kabi asosiy mavzularga jamlangan.
📝 Tavsif va kontent siyosati
Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @proglib_adv
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Yuqori yangilanish chastotasi (oxirgi ma’lumot 02 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.
Ma'lumot yuklanmoqda...
| Sana | Obunachilarni jalb qilish | Esdaliklar | Kanallar | |
| 02 Sentabr | 0 | |||
| 01 Sentabr | +1 |
| 2 | 🤖 Anthropic учит AI-агентов управлять реальным железом
Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием.
Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом.
Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним.
MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно.
Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами;
— меняет параметры эксперимента в реальном времени;
— реагирует на результаты и ошибки оборудования;
— координирует роботизированную руку и liquid handler;
— превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов.
И здесь начинается самое интересное.
У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл.
У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент.
Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта.
Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент».
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 464 |
| 3 | 🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа?
Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей.
Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция.
❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры.
Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии:
💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры.
Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 794 |
| 4 | ⏳ Главная ошибка при валидации временных рядов
Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет.
🤩 Для временных рядов используйте разбиение по времени:
from sklearn.model_selection import TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5, gap=24)
for train_idx, val_idx in tscv.split(X):
X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить:
— скейлеры и энкодеры fit только на train каждого фолда;
— lag и rolling не должны использовать будущие значения;
— gap выбирайте с учётом горизонта прогноза и способа формирования признаков.
Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 841 |
| 5 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 937 |
| 6 | 🤩 Бесплатный курс по Visual GenAI: от DDPM до 3D
В одном репозитории собрали полноценный graduate-level курс по современной генерации изображений, видео и 3D.
Внутри:
🤩 DDPM, Score Matching, SDE/ODE;
🤩 Flow Matching и DPM-Solver;
🤩 Consistency Models, MeanFlow и генерация за несколько шагов;
🤩 авторегрессионная генерация изображений и видео;
🤩 ускорение diffusion-моделей: caching, sparse attention, quantization;
🤩 мультимодальная генерация, ControlNet, IP-Adapter;
🤩 3D и multi-view diffusion.
К каждой теме — англоязычные слайды + записи лекций и семинаров на русском, а ещё 7 практических домашних заданий в Jupyter Notebook: от обучения Flow Matching до AR video diffusion.
🔗 GitHub
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 137 |
| 7 | 🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели
Свежая работа MIT по machine unlearning обнаружила интересный эффект: с ростом обучающего датасета связь между отдельными примерами и поведением модели становится менее очевидной.
На практике это означает:
— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель;
— становится сложнее определить, какие данные повлияли на конкретный ответ;
— «право на забвение» технически становится сложнее реализовать для больших моделей.
Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 321 |
| 8 | 📄 Docling — мощный инструмент для разбора документов под задачи Data Science
Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.
Он не просто конвертирует файлы — он понимает структуру документов.
Работает «plug-and-play» с:
— LangChain
— LlamaIndex
— Haystack
— CrewAI
Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.
🔗 Ссылка на проект
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 378 |
| 9 | 📊 Matplotlib под рукой: всё главное для графиков и анализа
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 469 |
| 10 | 🐼 Pandas Cookbook: учимся анализу данных
Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.
🔗 Начать обучение
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 575 |
| 11 | 🗂 Большая подборка шпаргалок по ML и DS
Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 545 |
| 12 | 🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени
В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.
В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».
🔗 Читать статью
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 485 |
| 13 | 🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла
Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.
Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)
💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.
📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 436 |
| 14 | 🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.
🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану
Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.
🔵 Что AI-агенты уже успели сломать в проде
Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.
🔵 Когда агент начинает социально инженерить людей
AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.
🔵 Safety drift: как агент постепенно уходит не туда
Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.
💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.
🏃♀️ Proglib Academy | 1 545 |
| 15 | 😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять.
Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда.
Если работаете с AI-агентами — подборка точно пригодится 👇 | 1 380 |
| 16 | ⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов
Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback.
Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами.
Самое интересное — feedback loop:
Agent → Slack → feedback → Harvester → Tuner → PR → human approval
То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки.
➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов.
И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 550 |
| 17 | 🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML.
Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели.
Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 488 |
| 18 | Matn yo'q... | 1 375 |
| 19 | Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀 | 1 356 |
| 20 | Компании финансового и промышленного секторов уже активно внедряют технологии машинного обучения (МL) 👨🏻💻И правильно, ведь это повышает эффективность бизнес-процессов и позволяет создавать новые цифровые сервисы.
☹️Но высокие операционные риски, большие затраты на вывод моделей в промышленную эксплуатацию (и еще ряд проблем) мешают масштабированию ML-проектов.
😊Эти задачи решает продукт с говорящим названием "Управление жизненным циклом машинного обучения" от Диасофт. Он обеспечивает централизованное управление всеми этапами работы с ML-моделями – от проведения экспериментов и управления версиями до промышленного развертывания, мониторинга и сопровождения моделей. Все это происходит в едином технологическом контуре организации.
Как это возможно? Благодаря внушительной функциональности продукта. Узнать подробнее можно по ссылке!
#реклама
О рекламодателе | 752 |
