Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Mostrar más📈 Análisis del canal de Telegram Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
El canal Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение (@dsproglib) en el segmento lingüístico de Ruso es un actor destacado. Actualmente la comunidad reúne a 18 419 suscriptores, ocupando la posición 7 084 en la categoría Tecnologías y Aplicaciones y el puesto 36 196 en la región Rusia.
📊 Métricas de audiencia y dinámica
Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 18 419 suscriptores.
Según los últimos datos del 26 julio, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de -38, y en las últimas 24 horas de 3, conservando un alto alcance.
- Estado de verificación: No verificado
- Tasa de interacción (ER): El promedio de interacción de la audiencia es 6.72%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 3.76% de reacciones respecto al total de suscriptores.
- Alcance de las publicaciones: Cada publicación recibe en promedio 1 237 visualizaciones. En el primer día suele acumular 693 visualizaciones.
- Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 5.
- Intereses temáticos: El contenido se centra en temas clave como сайентиста, llm, буст, навигация, openai.
📝 Descripción y política de contenido
El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Все самое полезное для дата сайентиста в одном канале.
Учиться у нас: clc.to/6qVHgg
По рекламе: @proglib_adv
Для обратной связи: @proglibrary_feeedback_bot
РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9”
Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 27 julio, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.
Впереди 7 недель работы со своим репозиторием. Вебинары проходят вживую и остаются в записи.Стартуем 31 августа. До конца июля можно присоединиться по ранней цене, а доступ к материалам останется бессрочным 😀 🔗 Посмотреть, что будет на курсе 🏃♀️ Proglib Academy
git pull origin main --no-rebase # merge: создаёт merge commit
git pull origin main --rebase # rebase: кладёт ваши коммиты поверх main
Rebase даёт чистую линейную историю — но осторожно если ветку используют другие.
↩️ revert vs reset — когда что
git revert <commit-hash> # создаёт новый коммит который отменяет изменения git reset <commit-hash> # удаляет коммиты из истории (деструктивно)Для командной работы —
revert. reset только если история ещё не запушена.
📋 Что всегда должно быть в .gitignore
data/ # датасеты — не версионировать в git .env # ключи и credentials venv/ .vscode/ __pycache__/ *.pycДля версионирования данных — DVC поверх Git. ✅ pre-commit — форматирование до коммита
# .pre-commit-config.yaml
repos:
- repo: https://github.com/astral-sh/ruff-pre-commit
hooks:
- id: ruff
- repo: https://github.com/psf/black
hooks:
- id: black
Ruff + Black запускаются автоматически перед каждым коммитом. Ревьюер фокусируется на логике, не на форматировании.
Правила которые реально помогают
· Маленькие коммиты с одной целью — легче ревертить и ревьюить
· Описательные названия веток: encode-categorical-columns вместо fix
· Никаких данных и секретов в репо
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста
#буст
from balance import load_data, Sample
target_df, sample_df = load_data()
sample = Sample.from_frame(sample_df, outcome_columns=["happiness"])
target = Sample.from_frame(target_df)
sample_with_target = sample.set_target(target)
adjusted = sample_with_target.adjust()
print(adjusted.summary())
# Covar ASMD reduction: 62.3%
# ASMD: 0.335 → 0.126
ASMD (Absolute Standardized Mean Difference) — основная метрика качества балансировки. Чем ниже, тем лучше.
📊 Методы взвешивания
· IPW — логистическая регрессия с L1 регуляризацией
· CBPS — Covariate Balancing Propensity Score
· Post-stratification
· Raking
📊 Когда использовать
· Анализ опросов с non-response bias
· Observational studies (treated vs untreated)
· Любые данные с selection bias
pip install balance
📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста
#бустПоэтому в большой команде недостаточно просто выбрать хорошую модель. ❗️ Нужно ещё объяснить ей, как у вас устроена разработка: какие подходы приняты, что обязательно проверять и по каким правилам принимать решения.🗓 23 июля в 19:00 МСК поговорим об этом на бесплатном вебинаре с Алексеем Жиряковым — он Executive Director в Сбере, руководит GenAI Data Platform, и с этой проблемой сталкивался не раз 🔥 Покажет живое демо, разберём, как встроить AI в процесс разработки так, чтобы он реально помогал, а не добавлял ещё один повод для споров на ревью. 🔗 Занять место на вебинаре 🏃♀️ Proglib Academy
Оцени ответ по шкале 1-5: · Точность (фактическая корректность) · Полнота (покрытие вопроса) · Релевантность (соответствие запросу) · Стиль (читаемость и тон)· Плюсы: гибко, понимает нюансы · Минусы: дорого, bias к похожим на себя ответам, не детерминировано 👥 Human evaluation · Попарное сравнение (A vs B) — надёжнее абсолютных оценок · Оценка по чеклисту критериев · Crowdsourcing через Toloka, MTurk Золотой стандарт, но дорого и медленно. 🏆 Бенчмарки · MMLU — знания по 57 областям · HumanEval / EvalPlus — генерация кода · MT-Bench — многоходовые диалоги · HELM — комплексная оценка по многим задачам · LiveBench — обновляется, минимизирует data contamination ✅ Когда что использовать · Разработка → автоматические метрики + LLM-as-Judge (быстро и дёшево) · До продакшена → human evaluation на репрезентативном сете · В продакшене → мониторинг через LLM-Judge + сбор user feedback · Для публикации/сравнения → стандартные бенчмарки 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #буст
