fa
Feedback
Библиотека собеса по Data Science | вопросы с собеседований

Библиотека собеса по Data Science | вопросы с собеседований

رفتن به کانال در Telegram

Вопросы с собеседований по Data Science и ответы на них. Учиться у нас: clc.to/GjjbkQ По рекламе: @proglib_adv Учиться у нас: https://proglib.io/w/7dfb7235 Для обратной связи: @proglibrary_feeedback_bot

نمایش بیشتر
4 474
مشترکین
-324 ساعت
-57 روز
-2130 روز
آرشیو پست ها
При кодировании категорий (например, названий городов) средним значением целевой переменной (Target Encoding) часто возникает дикая утечка данных. Какой метод «сглаживания» помогает этого избежать?
Anonymous voting

Популярная библиотека CatBoost строит «симметричные» или «забывчивые» деревья (Oblivious Trees). В чем их архитектурная особенность по сравнению с XGBoost или LightGBM?
Anonymous voting

В методе Stacking (Стэкинг) предсказания нескольких моделей передаются в «мета-модель». Как обычно обучается эта мета-модель?
Anonymous voting

Какую функцию потерь нельзя использовать для задачи классификации напрямую?
Anonymous voting

Вы обучаете модель Random Forest. Вы заметили, что каждое отдельное дерево в лесу переобучено. Как это повлияет на итоговую модель ансамбля, если деревьев в лесу достаточно много (например, 500)?
Anonymous voting

Представьте, что вы прогнозируете цены на акции. У вас есть данные за 3 года (с 2021 по 2023). Почему использование стандартной K-fold кросс-валидации является критической ошибкой при оценке качества такой модели?
Anonymous voting

WANTED: DS-ИНТЕРВЬЮЕР Обвиняется в умении загнать в тупик вопросом про регуляризацию. Мы ищем эксперта, который поможет други
WANTED: DS-ИНТЕРВЬЮЕР Обвиняется в умении загнать в тупик вопросом про регуляризацию. Мы ищем эксперта, который поможет другим соискателям разложить Machine Learning и статистику по полочкам. Приметы: — является профи в Python и математической статистике; — знает, какие вопросы реально задают на собеседованиях в бигтех; — умеет объяснять сложные модели без потери смысла; — хочет стать узнаваемым лицом в DS-комьюнити. Что мы предлагаем: — гонорар за разработку учебных материалов; — прокачка личного бренда на большую аудиторию; — сотрудничество с командой Proglib Academy. Явка с повинной P.S. Твой знакомый дата-сайентист знает слишком много? Сдай его нам.

Вы работаете с данными, которые имеют сложную форму: два кластера вложены друг в друга как кольца. Вы попробовали K-Means, но он разделил кольца вертикально. Какой алгоритм лучше всего справится с этой задачей, не требуя указывать количество кластеров?
Anonymous voting

Вы обучаете RNN для генерации текста. В процессе обучения вы замечаете в логах, что значения Loss внезапно становятся NaN, а веса модели принимают экстремально большие значения. Какая техника является наиболее простым способом борьбы с этой проблемой?
Anonymous voting

Задача — предсказать, совершит ли клиент покупку в интернет-магазине. В датасете вы обнаружили признак «ID транзакции чека». Вы включили его в модель, и она показала AUC-ROC = 0.999. Однако при проверке на новых данных модель не работает. Что произошло?
Anonymous voting

При работе с RNN для обработки длинных последовательностей часто возникает проблема, из-за которой модель «забывает» информацию, полученную в самом начале последовательности. Какое архитектурное решение было разработано для борьбы с этой проблемой?
Anonymous voting

Российские генеративные модели Kandinsky 5.0 Video Lite и Pro в международной text-to-video арене 🔘Pro версия является ТОП-1
Российские генеративные модели Kandinsky 5.0 Video Lite и Pro в международной text-to-video арене 🔘Pro версия является ТОП-1 опенсорсом в мире (см. модели с лицензиями MIT, Apache 2.0 в лидерборде) 🔘Lite версия (2B параметров) лучше первой версии Sora 🔘На данный момент Сбер уступает только топовым мировым бигтех компаниям: Google (Veo 3.1, Veo 3), OpenAI (Sora 2), Alibaba (Wan 2.5), KlingAI (Kling 2.5, 2.6); в паритете с Luma AI (Ray 3), MiniMax (Hailuo 2.3) — отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла 🔘Для российских генеративных моделей выход на международную арену — уникальное событие 🚀 Полезные ссылки: 🔘Посмотреть весь лидерборд: lmarena 🔘Почитать подробнее про Kandinsky 5.0: пост, техрепорт 🔘Open Source Kandinsky 5.0: github и hf

Вы обучаете нейронную сеть и замечаете, что на графике Train Loss сначала стабильно падает, а затем начинает резко колебаться или даже расти. При этом точность перестает улучшаться. Какое изменение, скорее всего, поможет стабилизировать процесс?
Anonymous voting

При построении дерева решений (Decision Tree) без ограничений, оно может расти до тех пор, пока в каждом листе не окажется ровно по одному объекту из обучающей выборки. К какому фундаментальному последствию для характеристик модели это приводит?
Anonymous voting

Вы обучаете модель k-NN на наборе данных, где количество признаков (столбцов) внезапно увеличилось с 10 до 1000, при этом количество строк осталось прежним. Как это практически отразится на работе алгоритма k-NN?
Anonymous voting

Вопрос с собеседования 2026: «Как вы организуете память в мультиагентной системе?» Если вы отвечаете «просто передам контекст
Вопрос с собеседования 2026: «Как вы организуете память в мультиагентной системе?» Если вы отвечаете «просто передам контекст в промпт», вы, скорее всего, не получите оффер на позицию AI Engineer. Современные системы требуют работы с векторными БД, чекпоинтами в графах и RAG. Подтяните хард-скиллы на нашем обновленном курсе «Разработка AI-агентов». Что в программе: — Паттерн ReAct и архитектура агентов; — Работа с LangChain и LangGraph ; — Инструменты AgentOps для мониторинга. Практика с код-ревью и дипломный проект, который не стыдно показать на собеседовании. Записаться

Какой из методов ансамблирования обычно дает наибольший выигрыш в качестве, если базовые модели сильно различаются по своей архитектуре (например, KNN, SVM и случайный лес)?
Anonymous voting

При обучении случайного леса (Random Forest) мы используем Out-of-Bag (OOB) ошибку. Что это такое?
Anonymous voting

При использовании L1-регуляризации (Lasso) в линейных моделях коэффициенты при некоторых признаках становятся строго равными нулю. Какое геометрическое свойство L1-нормы объясняет этот эффект?
Anonymous voting