Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Показати більше📈 Аналітичний огляд Telegram-каналу Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Канал Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 18 370 підписників, посідаючи 6 958 місце в категорії Технології та додатки та 35 841 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 18 370 підписників.
За останніми даними від 28 серпня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -39, а за останні 24 години на 1, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 7.18%. Протягом перших 24 годин після публікації контент зазвичай збирає 3.80% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 1 319 переглядів. Протягом першої доби публікація в середньому набирає 698 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 5.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як сайентиста, llm, буст, навигация, openai.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @proglib_adv
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Завдяки високій частоті оновлень (останні дані отримано 29 серпня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Триває завантаження даних...
| Дата | Залучення підписників | Згадування | Канали | |
| 29 серпня | +2 | |||
| 28 серпня | +4 | |||
| 27 серпня | +2 | |||
| 26 серпня | +2 | |||
| 25 серпня | +1 | |||
| 24 серпня | +3 | |||
| 23 серпня | +2 | |||
| 22 серпня | 0 | |||
| 21 серпня | 0 | |||
| 20 серпня | +1 | |||
| 19 серпня | +2 | |||
| 18 серпня | +5 | |||
| 17 серпня | +4 | |||
| 16 серпня | +1 | |||
| 15 серпня | 0 | |||
| 14 серпня | +3 | |||
| 13 серпня | +1 | |||
| 12 серпня | +2 | |||
| 11 серпня | 0 | |||
| 10 серпня | +1 | |||
| 09 серпня | +1 | |||
| 08 серпня | +3 | |||
| 07 серпня | +4 | |||
| 06 серпня | +2 | |||
| 05 серпня | +4 | |||
| 04 серпня | +3 | |||
| 03 серпня | +2 | |||
| 02 серпня | +1 | |||
| 01 серпня | +4 |
— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель; — становится сложнее определить, какие данные повлияли на конкретный ответ; — «право на забвение» технически становится сложнее реализовать для больших моделей.Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
| 2 | 📄 Docling — мощный инструмент для разбора документов под задачи Data Science
Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.
Он не просто конвертирует файлы — он понимает структуру документов.
Работает «plug-and-play» с:
— LangChain
— LlamaIndex
— Haystack
— CrewAI
Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.
🔗 Ссылка на проект
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 921 |
| 3 | 📊 Matplotlib под рукой: всё главное для графиков и анализа
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 128 |
| 4 | 🐼 Pandas Cookbook: учимся анализу данных
Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.
🔗 Начать обучение
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 252 |
| 5 | 🗂 Большая подборка шпаргалок по ML и DS
Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 303 |
| 6 | 🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени
В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.
В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».
🔗 Читать статью
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 270 |
| 7 | 🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла
Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.
Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)
💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.
📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 255 |
| 8 | 🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.
🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану
Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.
🔵 Что AI-агенты уже успели сломать в проде
Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.
🔵 Когда агент начинает социально инженерить людей
AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.
🔵 Safety drift: как агент постепенно уходит не туда
Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.
💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.
🏃♀️ Proglib Academy | 1 374 |
| 9 | 😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять.
Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда.
Если работаете с AI-агентами — подборка точно пригодится 👇 | 1 172 |
| 10 | ⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов
Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback.
Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами.
Самое интересное — feedback loop:
Agent → Slack → feedback → Harvester → Tuner → PR → human approval
То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки.
➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов.
И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 300 |
| 11 | 🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML.
Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели.
Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 305 |
| 12 | Немає тексту... | 1 181 |
| 13 | Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀 | 1 267 |
| 14 | Компании финансового и промышленного секторов уже активно внедряют технологии машинного обучения (МL) 👨🏻💻И правильно, ведь это повышает эффективность бизнес-процессов и позволяет создавать новые цифровые сервисы.
☹️Но высокие операционные риски, большие затраты на вывод моделей в промышленную эксплуатацию (и еще ряд проблем) мешают масштабированию ML-проектов.
😊Эти задачи решает продукт с говорящим названием "Управление жизненным циклом машинного обучения" от Диасофт. Он обеспечивает централизованное управление всеми этапами работы с ML-моделями – от проведения экспериментов и управления версиями до промышленного развертывания, мониторинга и сопровождения моделей. Все это происходит в едином технологическом контуре организации.
Как это возможно? Благодаря внушительной функциональности продукта. Узнать подробнее можно по ссылке!
#реклама
О рекламодателе | 752 |
| 15 | 🗂 Maths, CS & AI Compendium — бесплатная база для AI/ML
Большой open-source-компедиум, который связывает математику, Computer Science, ML и современный AI.
🔵 Внутри — линейная алгебра, вероятность и статистика, ML/DL, NLP, Computer Vision, GNN, GPU/SIMD, ML Systems и AI inference.
🔵 Отдельный плюс — MCP server: компедиум можно подключить к AI-ассистентам вроде Claude Code, Cursor и VS Code как базу знаний.
А если хочется пройти эту базу последовательно и с практикой, курс «ML для старта в Data Science» проводит от основ ML до ансамблей, бустинга и рекомендательных систем 💡
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 530 |
| 16 | 🙂🙂
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#развлекалово | 1 597 |
| 17 | 🙂 AI-агентов отправили в настоящий багфикс
В CyberGym-E2E собрали 920 реальных уязвимостей из open-source проектов. Задача агента звучит почти как тикет от сурового тимлида: самому найти баг, воспроизвести его, написать фикс — и при этом ничего не сломать рядом.
То есть мало выдать правдоподобный патч. Нужно ещё доказать, что уязвимость действительно закрыта, а проект после этого жив.
И вот это уже гораздо ближе к реальной разработке, чем «напиши безопасный код» в промпте 😅
На курсе «ИИ для разработчиков» похожая логика применяется к работе со своими проектами: агентам задают границы, проверки и quality gates. А доступ к курсу теперь можно взять вместе со всей библиотекой Proglib Academy по подписке 😮
🔗 Посмотреть, что входит в подписку
🏃♀️ Proglib Academy | 1 461 |
| 18 | Новый уровень проверки AI-кодера: вот тебе уязвимый проект, дальше разбирайся сам 👇 | 1 348 |
| 19 | 🧠 MLU-Explain — бесплатный интерактивный учебник по Machine Learning
У Amazon Machine Learning University есть отличный ресурс для тех, кто изучает базу ML или хочет быстро освежить её перед собеседованием.
Внутри разборы:
⬆️ линейной и логистической регрессии
⬆️ нейросетей и деревьев решений
⬆️ Random Forest
⬆️ bias-variance tradeoff и double descent
⬆️ ROC/AUC, precision и recall
⬆️ cross-validation и разбиения train/test/validation
⬆️ reinforcement learning
⬆️ fairness в ML
💡 Главная фишка — материал подается не как обычный учебник. Статьи сделаны в формате scrollytelling: по мере чтения можно взаимодействовать с графиками и наглядно смотреть, как меняется поведение моделей и метрик.
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 617 |
| 20 | 🚀 Устойчивые очереди в Postgres
PgQue предлагает универсальную архитектуру очередей для PostgreSQL, основанную на проверенной модели PgQ. Это решение без лишних зависимостей, работающее на любом управляемом Postgres, обеспечивая нулевое бремя и стабильную производительность под нагрузкой.
Основные моменты:
— Никаких внешних демонов или расширений
— Использует SQL и PL/pgSQL для установки
— Обеспечивает ACID-транзакции и долговечность
— Никакого накопления «мертвых» кортежей
— Подходит для высоконагруженных систем
🖥 GitHub
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 384 |
