Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Mostrar más📈 Análisis del canal de Telegram Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
El canal Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) en el segmento lingüístico de Ruso es un actor destacado. Actualmente la comunidad reúne a 18 370 suscriptores, ocupando la posición 6 953 en la categoría Tecnologías y Aplicaciones y el puesto 35 842 en la región Rusia.
📊 Métricas de audiencia y dinámica
Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 18 370 suscriptores.
Según los últimos datos del 27 agosto, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de -44, y en las últimas 24 horas de 1, conservando un alto alcance.
- Estado de verificación: No verificado
- Tasa de interacción (ER): El promedio de interacción de la audiencia es 7.10%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 3.73% de reacciones respecto al total de suscriptores.
- Alcance de las publicaciones: Cada publicación recibe en promedio 1 305 visualizaciones. En el primer día suele acumular 686 visualizaciones.
- Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 4.
- Intereses temáticos: El contenido se centra en temas clave como сайентиста, llm, буст, навигация, openai.
📝 Descripción y política de contenido
El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @proglib_adv
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 28 agosto, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.
Carga de datos en curso...
| Fecha | Crecimiento de Suscriptores | Menciones | Canales | |
| 28 agosto | +4 | |||
| 27 agosto | +2 | |||
| 26 agosto | +2 | |||
| 25 agosto | +1 | |||
| 24 agosto | +3 | |||
| 23 agosto | +2 | |||
| 22 agosto | 0 | |||
| 21 agosto | 0 | |||
| 20 agosto | +1 | |||
| 19 agosto | +2 | |||
| 18 agosto | +5 | |||
| 17 agosto | +4 | |||
| 16 agosto | +1 | |||
| 15 agosto | 0 | |||
| 14 agosto | +3 | |||
| 13 agosto | +1 | |||
| 12 agosto | +2 | |||
| 11 agosto | 0 | |||
| 10 agosto | +1 | |||
| 09 agosto | +1 | |||
| 08 agosto | +3 | |||
| 07 agosto | +4 | |||
| 06 agosto | +2 | |||
| 05 agosto | +4 | |||
| 04 agosto | +3 | |||
| 03 agosto | +2 | |||
| 02 agosto | +1 | |||
| 01 agosto | +4 |
— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель; — становится сложнее определить, какие данные повлияли на конкретный ответ; — «право на забвение» технически становится сложнее реализовать для больших моделей.Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
| 2 | 📄 Docling — мощный инструмент для разбора документов под задачи Data Science
Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.
Он не просто конвертирует файлы — он понимает структуру документов.
Работает «plug-and-play» с:
— LangChain
— LlamaIndex
— Haystack
— CrewAI
Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.
🔗 Ссылка на проект
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста | 893 |
| 3 | 📊 Matplotlib под рукой: всё главное для графиков и анализа
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 095 |
| 4 | 🐼 Pandas Cookbook: учимся анализу данных
Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.
🔗 Начать обучение
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 234 |
| 5 | 🗂 Большая подборка шпаргалок по ML и DS
Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 258 |
| 6 | 🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени
В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.
В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».
🔗 Читать статью
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 257 |
| 7 | 🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла
Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.
Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)
💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.
📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 248 |
| 8 | 🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.
🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану
Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.
🔵 Что AI-агенты уже успели сломать в проде
Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.
🔵 Когда агент начинает социально инженерить людей
AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.
🔵 Safety drift: как агент постепенно уходит не туда
Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.
💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.
🏃♀️ Proglib Academy | 1 374 |
| 9 | 😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять.
Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда.
Если работаете с AI-агентами — подборка точно пригодится 👇 | 1 172 |
| 10 | ⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов
Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback.
Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами.
Самое интересное — feedback loop:
Agent → Slack → feedback → Harvester → Tuner → PR → human approval
То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки.
➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов.
И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 254 |
| 11 | 🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML.
Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели.
Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 272 |
| 12 | Sin texto... | 1 152 |
| 13 | Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀 | 1 148 |
| 14 | Компании финансового и промышленного секторов уже активно внедряют технологии машинного обучения (МL) 👨🏻💻И правильно, ведь это повышает эффективность бизнес-процессов и позволяет создавать новые цифровые сервисы.
☹️Но высокие операционные риски, большие затраты на вывод моделей в промышленную эксплуатацию (и еще ряд проблем) мешают масштабированию ML-проектов.
😊Эти задачи решает продукт с говорящим названием "Управление жизненным циклом машинного обучения" от Диасофт. Он обеспечивает централизованное управление всеми этапами работы с ML-моделями – от проведения экспериментов и управления версиями до промышленного развертывания, мониторинга и сопровождения моделей. Все это происходит в едином технологическом контуре организации.
Как это возможно? Благодаря внушительной функциональности продукта. Узнать подробнее можно по ссылке!
#реклама
О рекламодателе | 752 |
| 15 | 🗂 Maths, CS & AI Compendium — бесплатная база для AI/ML
Большой open-source-компедиум, который связывает математику, Computer Science, ML и современный AI.
🔵 Внутри — линейная алгебра, вероятность и статистика, ML/DL, NLP, Computer Vision, GNN, GPU/SIMD, ML Systems и AI inference.
🔵 Отдельный плюс — MCP server: компедиум можно подключить к AI-ассистентам вроде Claude Code, Cursor и VS Code как базу знаний.
А если хочется пройти эту базу последовательно и с практикой, курс «ML для старта в Data Science» проводит от основ ML до ансамблей, бустинга и рекомендательных систем 💡
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 430 |
| 16 | 🙂🙂
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#развлекалово | 1 597 |
| 17 | 🙂 AI-агентов отправили в настоящий багфикс
В CyberGym-E2E собрали 920 реальных уязвимостей из open-source проектов. Задача агента звучит почти как тикет от сурового тимлида: самому найти баг, воспроизвести его, написать фикс — и при этом ничего не сломать рядом.
То есть мало выдать правдоподобный патч. Нужно ещё доказать, что уязвимость действительно закрыта, а проект после этого жив.
И вот это уже гораздо ближе к реальной разработке, чем «напиши безопасный код» в промпте 😅
На курсе «ИИ для разработчиков» похожая логика применяется к работе со своими проектами: агентам задают границы, проверки и quality gates. А доступ к курсу теперь можно взять вместе со всей библиотекой Proglib Academy по подписке 😮
🔗 Посмотреть, что входит в подписку
🏃♀️ Proglib Academy | 1 461 |
| 18 | Новый уровень проверки AI-кодера: вот тебе уязвимый проект, дальше разбирайся сам 👇 | 1 348 |
| 19 | 🧠 MLU-Explain — бесплатный интерактивный учебник по Machine Learning
У Amazon Machine Learning University есть отличный ресурс для тех, кто изучает базу ML или хочет быстро освежить её перед собеседованием.
Внутри разборы:
⬆️ линейной и логистической регрессии
⬆️ нейросетей и деревьев решений
⬆️ Random Forest
⬆️ bias-variance tradeoff и double descent
⬆️ ROC/AUC, precision и recall
⬆️ cross-validation и разбиения train/test/validation
⬆️ reinforcement learning
⬆️ fairness в ML
💡 Главная фишка — материал подается не как обычный учебник. Статьи сделаны в формате scrollytelling: по мере чтения можно взаимодействовать с графиками и наглядно смотреть, как меняется поведение моделей и метрик.
🔗 Ссылка
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 617 |
| 20 | 🚀 Устойчивые очереди в Postgres
PgQue предлагает универсальную архитектуру очередей для PostgreSQL, основанную на проверенной модели PgQ. Это решение без лишних зависимостей, работающее на любом управляемом Postgres, обеспечивая нулевое бремя и стабильную производительность под нагрузкой.
Основные моменты:
— Никаких внешних демонов или расширений
— Использует SQL и PL/pgSQL для установки
— Обеспечивает ACID-транзакции и долговечность
— Никакого накопления «мертвых» кортежей
— Подходит для высоконагруженных систем
🖥 GitHub
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
#буст | 1 384 |
