Библиотека собеса по Data Science | вопросы с собеседований
Открыть в Telegram
Вопросы с собеседований по Data Science и ответы на них. Учиться у нас: clc.to/GjjbkQ По рекламе: @proglib_adv Учиться у нас: https://proglib.io/w/7dfb7235 Для обратной связи: @proglibrary_feeedback_bot
Больше4 474
Подписчики
-324 часа
-57 дней
-2130 день
Архив постов
Математика — это фильтр на входе
На собеседованиях по DS часто валят не на коде, а на вопросах по линейной алгебре, статам или терверу. Не дай теории стать твоим узким местом.
Уравнение выгоды: 1 + 2.
Берешь три курса, платишь за один (тот, что дороже).
Что усилит резюме:
— Математика для Data Science;
— AI-агенты для DS-специалистов;
— ML для старта.
Обучить свою нейронку
До 31 декабря.
Саппорт: @manager_proglib
При оценке бинарного классификатора была построена Матрица ошибок. Какая метрика рассчитывается как отношение истинно положительных срабатываний ко всем фактически положительным случаям?
Вы разрабатываете рекомендательную систему для нового стримингового сервиса. Какая из перечисленных ниже ситуаций является классическим примером проблемы холодного старта (Cold Start Problem)?
При использовании алгоритма k-ближайших соседей (k-NN) для классификации, какое влияние будет иметь слишком маленькое значение k (например, k=1) на поведение модели?
Вы используете SVM для классификации, но обнаружили, что данные не являются линейно разделимыми в исходном пространстве признаков.
Какая техника позволяет SVM классифицировать нелинейные данные, не увеличивая явно размерность пространства?
Вы строите модель и обнаруживаете, что хотя общая метрика производительности высока, индивидуальные p-значения большинства ваших переменных незначимы, а коэффициенты (weights) модели демонстрируют высокую чувствительность к небольшим изменениям в данных.
Вы обучаете глубокую нейронную сеть, которая показывает 99% точности на обучающей выборке, но всего 70% на тестовой. Какое из следующих действий, скорее всего, поможет снизить переобучение (overfitting), не требуя сбора новых данных?
Какая проблема возникает, когда распределение входных данных (признаков X) в тестовой среде отличается от распределения, на котором обучалась модель, но при этом связь между входными данными и целевой переменной (P(Y∣X)) остается неизменной?
Готовитесь к собеседованию в AI?
Вопросы по математической базе — стандартный этап отбора на позиции Data Scientist и ML Engineer. Вас спросят не только про код, но и про то, как работают алгоритмы «под капотом».
Прокачайте хард-скиллы на обновленном курсе «Математика для разработки AI-моделей».
Важный апдейт:
— теперь обучение включает живые вебинары;
— первый прошел, но второй стартует сегодня, 9 декабря;
— это шанс разобрать сложные вопросы с экспертами в прямом эфире.
Что внутри:
— линейная алгебра;
— матанализ;
— теория вероятностей.
Успейте присоединиться к потоку
Вы используете алгоритм K-Means. Вы визуализировали результат и заметили, что два ваших кластера перекрываются в форме полумесяцев.
Какова наиболее вероятная причина такого поведения?
Вы обучаете модель Логистической регрессии, и она показывает низкую точность как на обучающей, так и на тестовой выборках. Вы решаете добавить L2. Какого результата следует ожидать?
Почему вас валят на собесах по ML?
Чаще всего не из-за незнания
fit/predict , а из-за непонимания математики, которая стоит за этими методами.
Мы перезапустили курс с живыми вебинарами, чтобы закрыть эти пробелы. Глубокое погружение в линейную алгебру.
Ближайшие темы (Hard Skills):
— Матрицы: ранг, обратимость, линейные преобразования и решение СЛАУ.
— Линейная регрессия: реализация МНК с нуля в NumPy vs scikit-learn , интерпретация коэффициентов.
— SVD и Eigenvalues: смысл собственных векторов, снижение размерности и построение рек. систем.
Вы научитесь не просто «тюнить параметры», а понимать физический смысл операций.
Вход в поток до 9 декабря.
https://clc.to/LojFzwКакой из перечисленных ниже сценариев наиболее явно указывает на то, что ваша модель машинного обучения страдает от сильного переобучения (overfitting)?
Вы работаете с категориальным признаком City (Город), который содержит более 1000 уникальных значений. Какой из перечисленных методов кодирования чаще всего используется в Data Science для работы с высококардинальными категориальными признаками
В задаче бинарной классификации, что произойдет с метрикой Recall (Полнота) модели, если мы значительно понизим порог классификации (threshold)?
Площадь под ROC-кривой (AUC-ROC) для классификатора равна 0.50. Что это означает?
🔬 Вы когда-нибудь смотрели на код и думали: «Работает, но почему?»
А теперь представьте, что вы:
→ понимаете, почему модель учится слишком медленно или слишком быстро;
→ видите, какие данные реально влияют на предсказание, а какие — шум;
→ знаете, что происходит внутри нейронки.
4 декабря стартует курс «Математика для разработки AI-моделей».
Линал, оптимизация, матан, статистика — всё, что происходит внутри модели между input и output. Практика на Python. Живые разборы с экспертами из SberAI, ВШЭ, Wildberries&Russ.
3 задания + финальный проект. Без теории ради теории — только то, что реально используется в моделях.
🎁 Бонус: курс по школьной математике + тест уровня математики
👉 Записаться
Почему Bayesian Neural Networks могут по-прежнему быть плохо откалиброваны?
Почему MAE более устойчива к шуму меток, чем MSE, но часто обучается медленнее?
Почему даже rolling-window CV может давать leakage?
