Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Show more📈 Analytical overview of Telegram channel Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Channel Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) in the Russian language segment is an active participant. Currently, the community unites 18 363 subscribers, ranking 6 994 in the Technologies & Applications category and 35 996 in the Russia region.
📊 Audience metrics and dynamics
Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 18 363 subscribers.
According to the latest data from 02 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by -39 over the last 30 days and by -4 over the last 24 hours, overall reach remains high.
- Verification status: Not verified
- Engagement rate (ER): The average audience engagement rate is 7.85%. Within the first 24 hours after publication, content typically collects 3.90% reactions from the total number of subscribers.
- Post reach: On average, each post receives 1 441 views. Within the first day, a publication typically gains 716 views.
- Reactions and interaction: The audience actively supports content: the average number of reactions per post is 5.
- Thematic interests: Content is focused on key topics such as сайентиста, llm, буст, навигация, openai.
📝 Description and content policy
The author describes the resource as a platform for expressing subjective opinions:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @proglib_adv
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Thanks to the high frequency of updates (latest data received on 03 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.
Data loading in progress...
| Date | Subscriber Growth | Mentions | Channels | |
| 03 September | +2 | |||
| 02 September | 0 | |||
| 01 September | +1 |
Можно дать ему исследовательскую задачу, а дальше агент помогает с кодом, данными, анализом и отчётом. При этом каждый шаг можно проверить и воспроизвести.Свежая версия 3.0.2 вышла 18 августа. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
| 2 | Что делать айтишнику в наше турбулентное время?
Вариант первый: скучать по старым добрым временам, когда ты проходил собеседования на 400к+ одной левой пяткой и думал, что так будет всегда.
Вариант второй: адаптироваться.
Повышать скиллы. Учиться проходить собеседования, а не гнуть пальцы. И, конечно, читать Богдана. Он больше 6 лет работает в бигтехе и прошёл 350+ собеседований.
— Почему твоё резюме не даёт откликов
— Почему ты не зарабатываешь 400к?
— Где искать работу ML-инженеру?
И ещё много полезных материалов уже ждёт тебя на канале.
Если хочешь не просто ходить на собеседования, а выходить оттуда с крутыми офферами, подписывайся на Богдана: https://t.me/ml_cabin_destroyers
Реклама
ИП Камаев Богдан Эльмарович
ИНН 770973951244
erid:CQH36pWzJqVJCbWwdw8YPGbm54Rbkkq1PurWH8do19EkU6 | 832 |
| 3 | 🤖 Anthropic учит AI-агентов управлять реальным железом
Anthropic открыла research preview Model Hardware Standard (MHS) — спецификации, которая позволяет AI-агентам находить, понимать и управлять физическим оборудованием.
Микроскопами, liquid handler’ами, лазерами, plate reader’ами, роботизированными руками и другим программируемым железом.
Идея похожа на то, что MCP сделал для софта: вместо отдельной интеграции под каждый инструмент появляется единый способ описать устройство и работать с ним.
MHS использует стандартизированные драйверы с базовыми операциями вроде read и write. В описании устройства можно указать его возможности, состояние и физические ограничения — например, вес роборуки или допустимые параметры работы. Агент получает эту информацию и может координировать несколько устройств одновременно.
Anthropic уже показывает сценарии, где агент:
— управляет несколькими лабораторными приборами;
— меняет параметры эксперимента в реальном времени;
— реагирует на результаты и ошибки оборудования;
— координирует роботизированную руку и liquid handler;
— превращает найденную последовательность действий в обычный код для дальнейшего выполнения.
В одном из экспериментов Anthropic пишет, что MHS позволил проводить автоматизированные эксперименты примерно в три раза быстрее. Но это пока ранний preview, а результаты получены в рамках партнёрских тестов.
И здесь начинается самое интересное.
У агента с доступом к API ошибка — это неправильная запись в базу или удалённый файл.
У агента с доступом к оборудованию ошибка может означать повреждённый образец, столкновение роботов или испорченный эксперимент.
Поэтому Anthropic пока тестирует MHS с ограниченной группой партнёров и собирает safety evaluations перед открытием стандарта.
Похоже, следующий этап agentic AI — это уже не только «дай мне данные» или «запусти код», а «проведи эксперимент».
🔗 Источник
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 841 |
| 4 | 🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа?
Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей.
Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция.
❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры.
Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии:
💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры.
Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 961 |
| 5 | ⏳ Главная ошибка при валидации временных рядов
Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет.
🤩 Для временных рядов используйте разбиение по времени:
from sklearn.model_selection import TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5, gap=24)
for train_idx, val_idx in tscv.split(X):
X_tr, X_val = X[train_idx], X[val_idx]
🤩 Что ещё проверить:
— скейлеры и энкодеры fit только на train каждого фолда;
— lag и rolling не должны использовать будущие значения;
— gap выбирайте с учётом горизонта прогноза и способа формирования признаков.
Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 040 |
| 6 | 📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 150 |
| 7 | 🤩 Бесплатный курс по Visual GenAI: от DDPM до 3D
В одном репозитории собрали полноценный graduate-level курс по современной генерации изображений, видео и 3D.
Внутри:
🤩 DDPM, Score Matching, SDE/ODE;
🤩 Flow Matching и DPM-Solver;
🤩 Consistency Models, MeanFlow и генерация за несколько шагов;
🤩 авторегрессионная генерация изображений и видео;
🤩 ускорение diffusion-моделей: caching, sparse attention, quantization;
🤩 мультимодальная генерация, ControlNet, IP-Adapter;
🤩 3D и multi-view diffusion.
К каждой теме — англоязычные слайды + записи лекций и семинаров на русском, а ещё 7 практических домашних заданий в Jupyter Notebook: от обучения Flow Matching до AR video diffusion.
🔗 GitHub
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 388 |
| 8 | 🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели
Свежая работа MIT по machine unlearning обнаружила интересный эффект: с ростом обучающего датасета связь между отдельными примерами и поведением модели становится менее очевидной.
На практике это означает:
— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель;
— становится сложнее определить, какие данные повлияли на конкретный ответ;
— «право на забвение» технически становится сложнее реализовать для больших моделей.
Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 494 |
| 9 | 📄 Docling — мощный инструмент для разбора документов под задачи Data Science
Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.
Он не просто конвертирует файлы — он понимает структуру документов.
Работает «plug-and-play» с:
— LangChain
— LlamaIndex
— Haystack
— CrewAI
Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.
🔗 Ссылка на проект
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 1 479 |
| 10 | 📊 Matplotlib под рукой: всё главное для графиков и анализа
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 563 |
| 11 | 🐼 Pandas Cookbook: учимся анализу данных
Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.
🔗 Начать обучение
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 639 |
| 12 | 🗂 Большая подборка шпаргалок по ML и DS
Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 596 |
| 13 | 🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени
В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.
В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».
🔗 Читать статью
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 517 |
| 14 | 🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла
Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.
Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)
💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.
📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 542 |
| 15 | 🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.
🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану
Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.
🔵 Что AI-агенты уже успели сломать в проде
Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.
🔵 Когда агент начинает социально инженерить людей
AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.
🔵 Safety drift: как агент постепенно уходит не туда
Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.
💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.
🏃♀️ Proglib Academy | 1 545 |
| 16 | 😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять.
Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда.
Если работаете с AI-агентами — подборка точно пригодится 👇 | 1 380 |
| 17 | ⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов
Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback.
Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами.
Самое интересное — feedback loop:
Agent → Slack → feedback → Harvester → Tuner → PR → human approval
То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки.
➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов.
И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 550 |
| 18 | 🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML.
Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели.
Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 488 |
| 19 | No text... | 1 375 |
| 20 | Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀 | 1 356 |
