uz
Feedback
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Kanalga Telegram’da o‘tish

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

Ko'proq ko'rsatish

📈 Telegram kanali Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение analitikasi

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 18 371 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 6 957-o'rinni va Rossiya mintaqasida 35 773-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 18 371 obunachiga ega bo‘ldi.

31 Avgust, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -38 ga, so‘nggi 24 soatda esa 2 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 7.52% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 3.95% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 1 381 marta ko‘riladi; birinchi sutkada odatda 726 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 5 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent сайентиста, llm, буст, навигация, openai kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

Yuqori yangilanish chastotasi (oxirgi ma’lumot 01 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

18 371
Obunachilar
+224 soatlar
Ma'lumot yo'q7 kun
-3830 kun
Obunachilarni jalb qilish
Sentabr '26
Sentabr '26
+1
0 kanalda
Avgust '26
+70
0 kanalda
Get PRO
Iyul '26
+83
0 kanalda
Get PRO
Iyun '26
+97
2 kanalda
Get PRO
May '26
+142
1 kanalda
Get PRO
Aprel '26
+106
1 kanalda
Get PRO
Mart '26
+329
4 kanalda
Get PRO
Fevral '26
+154
5 kanalda
Get PRO
Yanvar '26
+212
4 kanalda
Get PRO
Dekabr '25
+211
3 kanalda
Get PRO
Noyabr '25
+101
1 kanalda
Get PRO
Oktabr '25
+148
5 kanalda
Get PRO
Sentabr '25
+105
2 kanalda
Get PRO
Avgust '25
+103
4 kanalda
Get PRO
Iyul '25
+171
2 kanalda
Get PRO
Iyun '25
+185
42 kanalda
Get PRO
May '25
+319
6 kanalda
Get PRO
Aprel '25
+206
18 kanalda
Get PRO
Mart '25
+247
53 kanalda
Get PRO
Fevral '25
+236
36 kanalda
Get PRO
Yanvar '25
+180
41 kanalda
Get PRO
Dekabr '24
+212
42 kanalda
Get PRO
Noyabr '24
+217
52 kanalda
Get PRO
Oktabr '24
+224
43 kanalda
Get PRO
Sentabr '24
+249
38 kanalda
Get PRO
Avgust '24
+269
37 kanalda
Get PRO
Iyul '24
+197
37 kanalda
Get PRO
Iyun '24
+257
31 kanalda
Get PRO
May '24
+429
38 kanalda
Get PRO
Aprel '24
+339
38 kanalda
Get PRO
Mart '24
+437
32 kanalda
Get PRO
Fevral '24
+426
32 kanalda
Get PRO
Yanvar '24
+473
28 kanalda
Get PRO
Dekabr '23
+604
34 kanalda
Get PRO
Noyabr '23
+289
13 kanalda
Get PRO
Oktabr '23
+462
22 kanalda
Get PRO
Sentabr '23
+631
0 kanalda
Get PRO
Avgust '23
+488
0 kanalda
Get PRO
Iyul '23
+420
0 kanalda
Get PRO
Iyun '23
+329
0 kanalda
Get PRO
May '23
+433
0 kanalda
Get PRO
Aprel '23
+224
0 kanalda
Get PRO
Mart '23
+712
0 kanalda
Get PRO
Fevral '23
+249
0 kanalda
Get PRO
Yanvar '23
+260
0 kanalda
Get PRO
Dekabr '22
+292
0 kanalda
Get PRO
Noyabr '22
+407
0 kanalda
Get PRO
Oktabr '22
+172
0 kanalda
Get PRO
Sentabr '22
+209
0 kanalda
Get PRO
Avgust '22
+287
0 kanalda
Get PRO
Iyul '22
+352
0 kanalda
Get PRO
Iyun '22
+407
0 kanalda
Get PRO
May '22
+166
0 kanalda
Get PRO
Aprel '22
+215
0 kanalda
Get PRO
Mart '22
+225
0 kanalda
Get PRO
Fevral '22
+129
0 kanalda
Get PRO
Yanvar '22
+250
0 kanalda
Get PRO
Dekabr '21
+203
0 kanalda
Get PRO
Noyabr '21
+253
0 kanalda
Get PRO
Oktabr '21
+237
0 kanalda
Get PRO
Sentabr '21
+208
0 kanalda
Get PRO
Avgust '21
+297
0 kanalda
Get PRO
Iyul '21
+312
0 kanalda
Get PRO
Iyun '21
+288
0 kanalda
Get PRO
May '21
+446
0 kanalda
Get PRO
Aprel '21
+446
0 kanalda
Get PRO
Mart '21
+429
0 kanalda
Get PRO
Fevral '21
+396
0 kanalda
Get PRO
Yanvar '21
+351
0 kanalda
Get PRO
Dekabr '20
+12 450
0 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
01 Sentabr+1
Kanal postlari
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT предста
🧬 А если модель оценивают не по тому, что она умеет создавать, а по тому, что уже создала природа? Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей. Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция. ❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры. Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии: 💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры. Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно. 📍 Навигация: ВакансииЗадачиСобесы 🐸 Библиотека дата-сайентиста

2
⏳ Главная ошибка при валидации временных рядов Обычный KFold на временных данных легко даёт утечку из будущего: модель обучается на данных, которые хронологически находятся после validation. Метрики красивые, прод — уже нет. 🤩 Для временных рядов используйте разбиение по времени: from sklearn.model_selection import TimeSeriesSplit tscv = TimeSeriesSplit(n_splits=5, gap=24) for train_idx, val_idx in tscv.split(X): X_tr, X_val = X[train_idx], X[val_idx] 🤩 Что ещё проверить: — скейлеры и энкодеры fit только на train каждого фолда; — lag и rolling не должны использовать будущие значения; — gap выбирайте с учётом горизонта прогноза и способа формирования признаков. Если после этого метрика упала — возможно, вы наконец увидели реальное качество модели. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
813
3
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
914
4
🤩 Бесплатный курс по Visual GenAI: от DDPM до 3D В одном репозитории собрали полноценный graduate-level курс по современной генерации изображений, видео и 3D. Внутри: 🤩 DDPM, Score Matching, SDE/ODE; 🤩 Flow Matching и DPM-Solver; 🤩 Consistency Models, MeanFlow и генерация за несколько шагов; 🤩 авторегрессионная генерация изображений и видео; 🤩 ускорение diffusion-моделей: caching, sparse attention, quantization; 🤩 мультимодальная генерация, ControlNet, IP-Adapter; 🤩 3D и multi-view diffusion. К каждой теме — англоязычные слайды + записи лекций и семинаров на русском, а ещё 7 практических домашних заданий в Jupyter Notebook: от обучения Flow Matching до AR video diffusion. 🔗 ⁠GitHub 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 108
5
🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели Свежая работа MIT по machine unlearning о
🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели Свежая работа MIT по machine unlearning обнаружила интересный эффект: с ростом обучающего датасета связь между отдельными примерами и поведением модели становится менее очевидной. На практике это означает: — удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель; — становится сложнее определить, какие данные повлияли на конкретный ответ; — «право на забвение» технически становится сложнее реализовать для больших моделей. Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 296
6
📄 Docling — мощный инструмент для разбора документов под задачи Data Science Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных. Он не просто конвертирует файлы — он понимает структуру документов. Работает «plug-and-play» с: — LangChain — LlamaIndex — Haystack — CrewAI Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы. 🔗 Ссылка на проект 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
1 363
7
📊 Matplotlib под рукой: всё главное для графиков и анализа Сохраняйте, пригодится не раз. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 467
8
🐼 Pandas Cookbook: учимся анализу данных Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookb
🐼 Pandas Cookbook: учимся анализу данных Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных. 🔗 Начать обучение 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 504
9
🗂 Большая подборка шпаргалок по ML и DS Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 508
10
🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени В отличие от классического ML, этот алг
🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента. В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта». 🔗 Читать статью 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 450
11
🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме. Вот пример реализации: def multi_head_attention(X, W_q, W_k, W_v, W_o): d_k = W_k.shape[-1] Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k) K = np.einsum('si,hik->hsk', X, W_k) V = np.einsum('si,hiv->hsv', X, W_v) scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k) weights = softmax(scores, axis=-1) output = weights @ V projected = np.einsum('hsv,hvd->hsd', output, W_o) return projected.transpose(1, 0, 2).reshape(seq_len, -1) 💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь. 📌 Почему стоит обратить внимание: — Полная векторизация — минимум циклов, максимум скорости; — Код ближе к математике, а значит — легче проверять; — Можно выразить довольно сложные операции с тензорами в одной строке. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 422
12
🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще п
🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит. 🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами. 🔵 Что AI-агенты уже успели сломать в проде Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда. 🔵 Когда агент начинает социально инженерить людей AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером. 🔵 Safety drift: как агент постепенно уходит не туда Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным. 💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности. 🏃‍♀️ Proglib Academy
1 531
13
😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять. Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда. Если работаете с AI-агентами — подборка точно пригодится 👇
1 265
14
⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов Компания превратила агентов в обычный softwa
⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback. Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами. Самое интересное — feedback loop: Agent → Slack → feedback → Harvester → Tuner → PR → human approval То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки. ➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов. И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 472
15
🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML. Сохраняйте шпаргалку,
🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML. Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели. Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science. 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 488
16
Matn yo'q...
1 375
17
Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀
1 356
18
Компании финансового и промышленного секторов уже активно внедряют технологии машинного обучения (МL) 👨🏻‍💻И правильно, вед
Компании финансового и промышленного секторов уже активно внедряют технологии машинного обучения (МL) 👨🏻‍💻И правильно, ведь это повышает эффективность бизнес-процессов и позволяет создавать новые цифровые сервисы. ☹️Но высокие операционные риски, большие затраты на вывод моделей в промышленную эксплуатацию (и еще ряд проблем) мешают масштабированию ML-проектов. 😊Эти задачи решает продукт с говорящим названием "Управление жизненным циклом машинного обучения" от Диасофт. Он обеспечивает централизованное управление всеми этапами работы с ML-моделями – от проведения экспериментов и управления версиями до промышленного развертывания, мониторинга и сопровождения моделей. Все это происходит в едином технологическом контуре организации. Как это возможно? Благодаря внушительной функциональности продукта. Узнать подробнее можно по ссылке! #реклама О рекламодателе
752
19
🗂 Maths, CS & AI Compendium — бесплатная база для AI/ML Большой open-source-компедиум, который связывает математику, Compute
🗂 Maths, CS & AI Compendium — бесплатная база для AI/ML Большой open-source-компедиум, который связывает математику, Computer Science, ML и современный AI. 🔵 Внутри — линейная алгебра, вероятность и статистика, ML/DL, NLP, Computer Vision, GNN, GPU/SIMD, ML Systems и AI inference. 🔵 Отдельный плюс — MCP server: компедиум можно подключить к AI-ассистентам вроде Claude Code, Cursor и VS Code как базу знаний. А если хочется пройти эту базу последовательно и с практикой, курс «ML для старта в Data Science» проводит от основ ML до ансамблей, бустинга и рекомендательных систем 💡 🔗 Ссылка 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #буст
1 606
20
🙂🙂 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #развлекалово
🙂🙂 📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста #развлекалово
1 597