fa
Feedback
DziS Science | Data Science

DziS Science | Data Science

رفتن به کانال در Telegram

Канал о жизни через призму науки о данных Учусь сам, учу других Пишу интересные статьи о соревновательном и коммерческом DS и его приложениях к жизни. Создатель: @a_dzis

نمایش بیشتر
2 206
مشترکین
اطلاعاتی وجود ندارد24 ساعت
-57 روز
+830 روز

در حال بارگیری داده...

جذب مشترکین
سپتامبر '26
سپتامبر '26
+1
در 0 کانال‌ها
اوت '26
+44
در 4 کانال‌ها
Get PRO
ژوئیه '26
+29
در 0 کانال‌ها
Get PRO
ژوئن '26
+59
در 0 کانال‌ها
Get PRO
مه '26
+39
در 1 کانال‌ها
Get PRO
آوریل '26
+49
در 0 کانال‌ها
Get PRO
مارس '26
+62
در 2 کانال‌ها
Get PRO
فوریه '26
+32
در 0 کانال‌ها
Get PRO
ژانویه '26
+80
در 2 کانال‌ها
Get PRO
دسامبر '25
+29
در 1 کانال‌ها
Get PRO
نوامبر '25
+32
در 2 کانال‌ها
Get PRO
اکتبر '25
+40
در 2 کانال‌ها
Get PRO
سپتامبر '25
+69
در 1 کانال‌ها
Get PRO
اوت '25
+243
در 8 کانال‌ها
Get PRO
ژوئیه '25
+49
در 0 کانال‌ها
Get PRO
ژوئن '25
+43
در 1 کانال‌ها
Get PRO
مه '25
+75
در 0 کانال‌ها
Get PRO
آوریل '25
+56
در 0 کانال‌ها
Get PRO
مارس '25
+75
در 1 کانال‌ها
Get PRO
فوریه '25
+209
در 4 کانال‌ها
Get PRO
ژانویه '25
+75
در 1 کانال‌ها
Get PRO
دسامبر '24
+76
در 0 کانال‌ها
Get PRO
نوامبر '24
+47
در 2 کانال‌ها
Get PRO
اکتبر '24
+94
در 1 کانال‌ها
Get PRO
سپتامبر '24
+94
در 1 کانال‌ها
Get PRO
اوت '24
+236
در 2 کانال‌ها
Get PRO
ژوئیه '24
+76
در 1 کانال‌ها
Get PRO
ژوئن '24
+33
در 0 کانال‌ها
Get PRO
مه '24
+43
در 0 کانال‌ها
Get PRO
آوریل '24
+50
در 0 کانال‌ها
Get PRO
مارس '24
+47
در 1 کانال‌ها
Get PRO
فوریه '24
+43
در 3 کانال‌ها
Get PRO
ژانویه '24
+41
در 0 کانال‌ها
Get PRO
دسامبر '23
+53
در 2 کانال‌ها
Get PRO
نوامبر '23
+33
در 0 کانال‌ها
Get PRO
اکتبر '23
+69
در 0 کانال‌ها
Get PRO
سپتامبر '23
+116
در 0 کانال‌ها
Get PRO
اوت '23
+93
در 0 کانال‌ها
Get PRO
ژوئیه '23
+65
در 0 کانال‌ها
Get PRO
ژوئن '23
+58
در 0 کانال‌ها
Get PRO
مه '23
+212
در 0 کانال‌ها
Get PRO
آوریل '23
+94
در 0 کانال‌ها
Get PRO
مارس '23
+31
در 0 کانال‌ها
Get PRO
فوریه '23
+55
در 0 کانال‌ها
Get PRO
ژانویه '23
+65
در 0 کانال‌ها
Get PRO
دسامبر '22
+54
در 0 کانال‌ها
Get PRO
نوامبر '22
+34
در 0 کانال‌ها
Get PRO
اکتبر '22
+124
در 0 کانال‌ها
Get PRO
سپتامبر '22
+18
در 0 کانال‌ها
Get PRO
اوت '22
+248
در 0 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
04 سپتامبر0
03 سپتامبر0
02 سپتامبر+1
01 سپتامبر0
پست‌های کانال
Привет всем!👋 Поздравляю всех причастных с Днём знаний!🍁🎒 Желаю всем хорошего и продуктивного старта учебного года. Для мн
Привет всем!👋 Поздравляю всех причастных с Днём знаний!🍁🎒 Желаю всем хорошего и продуктивного старта учебного года. Для многих новый учебный год - новый шаг/ступень в жизни🤗. 🔸Для кого-то новый год ознаменовал поступление в бакалавриат/магистратуру📖. 🔸Для кого-то это начало преподавательской деятельности. Или ее успешное продолжение. Как я неоднократно говорил учить людей - одна из самых сложных и уважаемых профессий🫡. 🔸Для кого-то это год - затишье перед бурей, где впереди ждут важные испытания для перехода на новый жизненный этап💻. 🔸Кто-то будет переживать за вас из ваших близких за ваши учебные успехи и неудачи, собирать в школу и институт🚬. Всех, к кому относятся эти пункты я поздравляю в первую очередь. 😺 Но самое важное, что я всегда регулярно повторяю: учебные года не ограничены учебой в школе/институте. Здесь в мире после института тоже есть ступени, просто они не такие явные, как во времена учебы. Чтобы оставаться на волне и быть конкурентным на рынке, учится в нашей профессии нужно круглосуточно. Поэтому желаю всем в этом учебном году интересоваться: освоить что-то новое, изучить новые технологии, разобраться в чем-то фундаментальном или попробовать для себя что-то новое. Ведь вы не станете крутыми спецами, если не будете интересоваться. Не бойтесь ошибаться, ведь не ошибается только тот, кто ничего не делает. Так что полный газ и попутного ветра!🏃‍♂️ В последнее время не так активно работает дискуссия, но я бы хотел в комментариях разделить ваши успехи перед данным учебным годом, фото первого учебного дня в новом статусе. Пишите в комментариях кто куда поступил, кто где учится, возможно встретите однокурсников/одногрупников👇 #офтоп

2
Привет всем!👋 Последние 2 недели выдались продуктивными. Немного расскажу. Про работу: По работе мы почти вывели модель PD Э
Привет всем!👋 Последние 2 недели выдались продуктивными. Немного расскажу. Про работу: По работе мы почти вывели модель PD ЭБГ (электронные банковские гарантии) в прод, по модели PD среднего бизнеса согласование ТЗ превратилось в ресерч уровня научной статьи. На этой неделе также случился корпоратив ДРМ, наше подразделение с размахом отметило свое день рождение. По соревнования: Честно говоря времени было не много, прорыва в «Счастливом фермере» на данный момент не произошло, сокомандник, который пока останется инкогнито, провел не плохую оптимизацию и тем самым ускорил пайплайн в 6 раз, собственно мы готовы уже активно бороться за медали. Что сейчас: На данный момент я собираюсь в отпуск, продлевать лето платно, во 🇻🇳. Поэтому пока все активности на 2 недели приостановил. Сгонял кстати на Одиссею в IMAX на выходных, мне зашло. Про спорт и здоровье: Собрался с друзьями в Падел, организовав элитный клуб тех, кто не умеет играть в падел. Уже как 2.5 месяца стабильно в выходные играем. Кроме того, последние фото меня навели на мысль, что я мягко говоря отъелся, поэтому начал жестко контролировать калории, за месяц -6кг. В целом думаю, в рамках анонсов этого достаточно, напишите про что из этого интересно почитать и буду начинать писать уже более глубокие посты про эти все мероприятия. #life
429
3
Привет всем! 👋 Недавно я разбирал программу Яндекса 75/75/75 и закончил мысль тем, что идея нравится, а как она поведёт себя
Привет всем! 👋 Недавно я разбирал программу Яндекса 75/75/75 и закончил мысль тем, что идея нравится, а как она поведёт себя в реальности — вопрос времени. Но одно дело внедрять ИИ, а совсем другое — понимать, как он меняет инженерные процессы и влияет на аспекты разработки 5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. AI тут не просто «одна из тем программы». Это ровно тот триггер, который переписывает инфраструктуру, архитектуру, процессы разработки и сам способ ставить задачи. У меня этот сдвиг случился на соревновании ROGII: 90% работы сделал Claude Code, а я по факту сидел тимлидом у агента и разгребал потерю контекста в логах. Ощущение специфическое, и навыки под него нужны другие, плюс недавно при общении с достаточно высокостоящими людьми в индустрии, я понял что почти все уже дрейфуют в сторону ИИзации. Обещают реальные кейсы команд и доклады на стыке AI, разработки, инфраструктуры и данных: среди выступающих как российские спикеры, так и приглашенный эксперт. - Кто у микрофона? 🎤 🔸 Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды. 🔸 Алексей Гусаков, CTO Бизнес-группы Поисковых сервисов и ИИ в Яндексе — переход от классического ML к генеративным моделям в рекомендательных системах. 🔸 Сергей Мельник, руководитель сервиса автономного транспорта и роботов — Physical AI: как построить стек и запустить его в реальных условиях. Это лишь часть докладов, полную программу можете посмотреть на сайте. В онлайне будут доступны Hard-трек с техническими докладами и Q&A-сессия с экспертами. Офлайн тоже есть, про участие в очном формате можете почитать подробнее на сайте. Лично мне интереснее всего разбор про генеративки в рекомендациях: учитывая, что SOTA решения в рекомендациях не используют такой тип моделей, то это тот случай, когда «поменяли модель» на практике означает «переписали половину пайплайна», и хочется услышать, чем платили за переход. Ну и C-level Google, конечно же, не каждый день люди такого уровня выступают. Зарегистрироваться на трансляцию
551
4
بدون متن...
651
5
Привет всем!👋 🚨Новое соревнование на Kaggle!🚨 На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия. От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱 Лично я рассматриваю это соревнование как отдушину от лютого стака моделей в ROGII, где можно почилить и попилить RL стратегии. -В чём задача?🚜 Здесь всё максимально нетривиально: нужно построить автономного AI-агента, который управляет виртуальной фермой — сажает и собирает урожай, ухаживает за скотом, нанимает работников, расширяет земельные участки и торгует на динамическом рынке, где цены реагируют на спрос и предложение. Соревнование организовано Kaggle совместно с Google. - Что по механике?🤨 Одна игра - это сезон длиной 30 дней (720 ходов, ход = игровой час). Ваши агенты играют лестничные (ladder) матчи против других участников, и по итогам каждой партии обновляется рейтинг. По каждому завершённому эпизоду доступен полный реплей - все наблюдения и действия обоих игроков по ходам, так что материала для анализа чужих стратегий будет более чем достаточно. Это скорее не классический supervised-таск, а стратегическая симуляция уровня Lux AI / Halite - заходит тем, кому интересны agentic AI, планирование и multi-agent взаимодействие. Призовые💰 Общий призовой фонд - $50,000. Распределение простое: 🏅 Топ-10 команд получают по $5,000 каждая. - Что по метрике?🎯 Метрика тоже нестандартная - это не RMSE и не accuracy, а итоговый банк (доход) вашего агента по итогам партии на лестнице, из которого и складывается рейтинг. - Что по срокам?📆 🔸Дедлайн регистрации/объединения в команды: 24 сентября 2026 Раз метрика - это доход агента в динамичной экономике, чистый RL «в лоб» может не зайти лучше эвристик — рынок и ограниченные ресурсы (земля, рабочие руки) сильно влияют на стратегию. Тестируйте разные подходы: от rule-based ботов до полноценных RL-агентов, комбинируйте их и смотрите реплеи чужих матчей - там реально можно многое подсмотреть. #соревнования
1 009
6
Привет всем!👋 Сегодня на IT-Пикнике залетел на сходку Саши Абрамова (ака Dealer.ai) Замучил вопросами про карьеру и получил
Привет всем!👋 Сегодня на IT-Пикнике залетел на сходку Саши Абрамова (ака Dealer.ai) Замучил вопросами про карьеру и получил лично от него мерч Вкусвилла. #life
548
7
2/2 Архитектура итогового сабмита: Два независимых стека, финальный бленд: 🔸Part A - физика. 128-сидовый likelihood-weighted particle filter (ANCC-anchored, Z-velocity coupled, numba), поверх — селектор кандидатных путей + robust low-degree полиномиальная проекция. На выходе anchor. 🔸Part B - ML-стек (fleongg). LGBM×3 + CatBoost×2 + Ridge-мета. Ключевая инженерная деталь - два спатиальных импьютера, FormationPlaneKNN и DenseANCCImputer, которые тянут признаки формаций (ANCC/ASTNU/…, есть только в train) с ближайших соседних скважин; на train-объектах вызываются с self_wid, который исключает саму скважину из выдачи соседей. Поверх - physfeats: self-log + neighbor-dip признаки, инъекция весом W_HARD=0.3 в финал ветки. Поверх обеих веток: 🔸 HMM (forward-backward, self-log emission), вес HMM_W 🔸 kriging по датум-сдвигу b_w (locked-конфиг: TH=2.2166, ANISO=2.0, RNG=500, K=25, anisotropic variogram), вес krige_w; работает только за счёт соседей ближе ~500 ft (при исключении их из lookup сигнал схлопывается) 🔸 gold/contact-override - прямое восстановление TVT из формаций для скважин-дублей train <-> hidden 🔸 seed-branch hedge: когда посмертное распределение 128 PF-сидов бимодально (masса меньшей моды ≥0.25, разделение мод 4–40 ft), сдвигаем предсказание к взвешенной середине веток, капом ±2 ft; срабатывает на ~12% скважин Финальная формула: pred = w_sp45·[(1−HMM_W)·anchor + HMM_W·hmm] + (1−w_sp45)·fleongg, затем + krige-сдвиг, + gold-override, + seed-hedge. Валидация: Итоговые веса финального сабмита были заточены под кросс-валидацию с GroupKFold(folds=5) по скважинам, при этом валидация была настроена для каждой части отдельно, итоговая валидация всей модели делалась на пересечении (по итогу на CV оценивались 370 скважин). Как показали результаты, CV отлично коррелировала с Private (итогова модель имела 9.004 против 9.038 на Private), но корреляция с LB была отрицательная, что и привело к огромному LB шафлу после соревнования. Главный вывод: Trust Your CV. Public LB - маленькая (52 скважины), шумная подвыборка скрытого теста; CV370 - выборка на порядок больше. Ретроспективная проверка на private-скорах топ-89 сабмитов дала корреляцию Pearson +0.90 между CV и private LB - и отрицательную (−0.61) между public LB и private. Несколько раз в процессе мы отказывались от CV-оптимальных конфигов в пользу тех, что лучше смотрелись на public LB - и каждый раз это было ошибкой в противоположную от истины сторону. Смелая попытка довериться CV до конца, невзирая на посредственный public-скор, принесла +168 позиций и бронзу. При этом ни оверфита, ни случайного выброса не произошло именно благодаря стабильности этой CV: 370 скважин с честными групповыми фолдами - выборка того же порядка, что и сам скрытый тест, поэтому и скачок получился большим, но объяснимым по величине, а не подарком генератора случайных чисел. #соревнования
585
8
1/2 Привет всем!👋 Вчера закончилось соревнование - ROGII - Wellbore Geology Prediction. По результату соревнования наша кома
1/2 Привет всем!👋 Вчера закончилось соревнование - ROGII - Wellbore Geology Prediction. По результату соревнования наша команда забрала бронзу 🥉 заняв 525/6191 место. На Private LB мы поднялись на 168 мест. Немного предыстории: Я начал соревнование соло, но после общения в чате Псевдолейблинга на меня вышел парень, который случал мое выступление в МФТИ "Я профессионал" и предложил поучаствовать вместе. Я согласился, также в рамках соревнования я начал впервые активно использовать вайбкодинг. Fun Fact: Это соревнование - первое мое соревнование, в котором 90% работы за меня выполнил Claude Code. Времени много кодить у меня не было, благодаря Claude я делал вечером дела в параллель, высвободив себе немного свободного времени, по сути руководя им как тимлид. Мы сделали довольно таки годный репозиторий, в который каждый сабмит и прогон логировался с комментариями, сохраняя версию ноутбука, проверяя кросс валидацию. Из смешного: файл с логированием сабмитов submission_history.csv начинался строго на английском, имел четкий численный идентификатор эксперимента (exp_001), но в конце уже полностью перешел на русский с потерей четкой структуры идентификации. Множественная потеря контекста привела к хаосу в документе и его пришлось в момент переписывать, это достаточно забавно. Об экспериментах: Их было много, спаршены все топ паблик кернелы, сгенерированы признаки из подсказок в discussions (далее по тексту physfeats), даже попробованы нейросетевые подходы. Топ-1 взяла UNet архитектура, мы тоже ее пробовали, но при увеличении кол-ва скважин, модель банально взрывалась по метрикам, побороть это нам не удалось. Об итоговом сабмите: Fun Fact: Сабмит, который принес нам бронзу был сделан последним, за пару часов до дедлайна. Он на Private показал топ-1 скор из всех, что у нас были. По итогу, бросив нейросетевые подходы (решения аналогичного соревнования прошлого года и архитектура с Attention, Unet, поиск предобученных на HF), мы остановились на бленде из классических моделей (линейки, бустинги) с физическими фильтрами. Последние дни боролись именно за стабильность решения, в т.ч используя усреднение предсказаний по куче сидов (да-да finetuning сидов это база для Kaggle). О итоговом сабмите и выводах ниже #соревнования
497
9
СЮДА БЛИН, LET’S GO Пост нормальный завтра напишу уже, как проснусь #соревнования
СЮДА БЛИН, LET’S GO Пост нормальный завтра напишу уже, как проснусь #соревнования
480
10
От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-то дождались 🗿 Чуть больше года наз
От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-то дождались 🗿 Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях. Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science. Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить. Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов: 1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке? 2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать? 3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом? 4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно? 5️⃣ Как часто дата-сайентисты *** и связано ли это с доходом и удовлетворённостью работой? Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты. Спасибо «Start Career in DS», «DziS Science | Data Science», «girafe.ai», «Artificial stupidity», «LightAutoML framework» и «Борис опять» 👉 Читать на Хабре
457
11
Всем привет!👋 Мы дождались, обзор на вилки вышел! #карьера
527
12
Привет всем!👋 Сегодня одним из главных челленджей создания стратегии внедрения ИИ является постановка правильных и адекватных KPI для улучшения процессов без ущерба качеству. И мне всегда интересно, что для этого делают на рынке. Яндекс запускает программу 75/75/75, которая должна сделать ИИ новым стандартом разработки внутри компании. И это, пожалуй, один из самых прямолинейных KPI по внедрению ИИ, что я видел. - Что значат эти цифры? 🔸К концу 2026 года 75% процентов разработчиков будут использовать ИИ инструментарий для написания кода. 🔸ИИ должен принимать участие не менее, чем в 75% изменений в кодовой базе. 🔸В этих 75% изменений 75% процентов кода должно быть сгенерировано ИИ. Выглядит как массовая ИИ-трансформация работы сотрудников, в которой классическая разработка остается только в редких, я бы даже сказал, особенных случаях. Во остальных ситуациях подразумевается, что разработчик уже выступает в роли Product Engineer, т.е продукт лидируется человеком с точки зрения кода и бизнеса, но реализация возлагается на агентов. - Какие вводные сейчас уже имеются? Сегодня 73% разработчиков Яндекса регулярно используют ИИ, а более 50% нового кода в компании создается с помощью генеративных моделей. При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений кода. Сегодня так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом. То есть стратегия 75/75/75 уже имеет место быть в Яндексе, но до целевых показателей еще далеко. Поэтому следующий этап - масштабировать этот подход на всю компанию. - Есть ли реальные кейсы, когда такой подход помог ускорить разработку? 🔸 Яндекс Еда — создание ИИ-хостес за 2 месяца, разработка итогового продукта ускорилась в 2 раза 🔸Яндекс Браузер — 80% кода новой архитектуры перевода видео от ИИ, вместо 2-3 недель — 2 дня 🔸Яндекс Лавка — кабинет франчайзи собрал один человек за 3 недели, спринты ускорились в 3,3 раза Ответственность за реализацию и архитектуру всё еще остается на человеке. Подразумевается, что ИИ берет на себя именно рутинную разработку. И это переворачивает игру. Сдвиг рынка происходит в сторону специалистов, отлично умеющих в архитектуру и код-ревью. При этом функции тимлида начинают выполнять гораздо больше инженеров: каждый «агентовод» становится своего рода руководителем собственной команды ИИ-помощников. Вот тут интересно, как в данной парадигме будет происходит обучение и рост сотрудников (а компания, по последним новостям, планирует нанять рекордные 3200 стажеров в 2026 году), ведь больше кода, больше проектов требует больше операторов ИИ, но если сразу взять курс на "сеньорность", то произойдет кадровый разрыв. - Как достигаются такие цифры? Яндекс также активно развивает внутренних агентов и агентские платформы, которые направлены не только на разработчиков, а на всех сотрудников, например на бизнес аналитиков, продактов. Из примеров внутренних агентов: 🔸GENA - сама доводит тикеты до готового кода 🔸"Стефания" - работает виртуальным сотрудником для 5 тысяч человек в неделю Платформы для внешней аудитории: 🔸SourceCraft - платформа с встроенным агентским режимом для кода 🔸Yandex AI Studio - платформа для создания ИИ-агентов и приложений Интересным является то, что платформенные решения сразу упаковываются в продукты для рынка. По-моему, это круто, учитывая, что у нас только начали появляться инструменты, разработанные в РФ, которые потенциально могут на дистанции составить конкуренцию зарубежным решениям. Да, всем очевидно, что условноза неделю LLMки не обучишь, но любой шаг в этом направлении - шаг к тому, чтобы громко заявить о себе. Мне нравится идея программы, но как она покажет себя в реальности - вопрос времени.
603
13
Привет всем! 👋 Прямое включение из отпуска. Нижний Новгород - классный город. Красивые закаты, вкусная еда. Из минусов тольк+9
Привет всем! 👋 Прямое включение из отпуска. Нижний Новгород - классный город. Красивые закаты, вкусная еда. Из минусов только колени - в среднем за день часы показывают 40+ пройденных этажей (кстати Кремль мы прошли полностью по кругу с перепадами высоты, аналогичными 20ти этажному дому). Fun Fact: В Нижнем Новгороде есть довольно-таки большой аквапарк. Принципиально выключился из какой-то профессиональной движухи на неделю, надо немного перезагрузиться. Так что ждите новостей, думаю со следующей недели. А на десерт ловите микро фото отчет. #офтоп #life
686
14
Привет всем! 👋 После работы я очень люблю во что-то залипать, отвлеченное, медитативное. Вчера залип в материалах Magellan TT24 - первую полноразмерную цифровую копию обломков «Титаника», лежащих на глубине 3800 метров. Они даже игру в Steam выпустили (в РФ стоит 880р). Параллельно провалился в хронологию самого крушения, и тут меня осенило... Мы все крутили titanic.csv на первом же курсе/соревновании по ML: Pclass, Sex, Age, Survived... Строим baseline, радуемся accuracy +-0.79, идём дальше. Датасет настолько привычный, что воспринимается почти как синтетический - набор фичей для тренировки классификатора, а не история реальной ночи 14-15 апреля 1912 года. А реальность оказалась куда абсурднее любого train/test split. Что удивило больше всего - катастрофа не была одним фатальным событием, которое можно списать на «айсберг виноват». Это классический кейс для causal inference: длинная цепочка решений и совпадений, где каждое звено - небольшой, казалось бы, независимый фактор, но именно их совместное воздействие и породило итоговый исход. Уберите любое одно звено из цепи - и в таблице Survived могли бы стоять совсем другие цифры: 🔸 Судно шло почти на предельной скорости через зону, где было получено семь ледовых предупреждений за один день. 🔸 Бинокли для вперёдсмотрящих лежали в сейфе, ключ от которого случайно увёз офицер, снятый с рейса в последний момент. 🔸 Радист проигнорировал последнее и самое важное ледовое предупреждение - просто отмахнулся от коллеги с соседнего судна, который пытался передать координаты. 🔸 Шлюпок на борту хватало меньше чем на половину пассажиров - не из-за нехватки места, а потому что владельцы посчитали лишние шлюпки формальностью, загромождающей палубу. 🔸 Первые шлюпки спускали полупустыми - офицеры не знали точную вместимость и действовали не согласованно. 🔸 Ближайшее судно, способное успеть на помощь, «Калифорниэн», выключило единственную рацию на ночь - за 10(‼️) минут до столкновения. Ни одно из этих решений само по себе не выглядело катастрофическим. Но сложившись вместе, они и дали ту самую строчку Survived = 0 для тысяч людей в датасете. И вот к чему я это всё: когда мы обучаем модели на исторических данных, легко забыть, что за каждой строкой - не абстрактная фича, а зачастую результат цепочки решений, повлиявших на судьбу реального человека. Наши модели в итоге и есть то самое событие, которое влияет на судьбы людей - просто мы видим его не как айсберг в ночи, а как скоринг, рекомендацию или отказ в кредите. Так что делайте ваши модели хорошими, а главное применимыми к той бизнес цели, которую перед вами поставили, а я очень близок к покупке модельки Титаника, как напоминании, что наша работа меняет жизни людей. Если соберусь, с меня отчет о итоговом результате. P.S. Ну еще я поехал в отпуск. #офтоп
602
15
Летняя конференция для ML- и Data Science-сообщества 2 августа в Москве пройдет «Урбан ML» — масштабное мероприятие для специ
Летняя конференция для ML- и Data Science-сообщества 2 августа в Москве пройдет «Урбан ML» — масштабное мероприятие для специалистов по машинному обучению и Data Science. Участников ждут 18 докладов по современным направлениям ML, выступления экспертов MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний, а также мастер-классы, спортивные активности, афтерпати и возможности для профессионального общения. Участие бесплатное по предварительной регистрации (на площадку необходимо взять с собой паспорт или права): [ссылка] 📍 Москва, офлайн 🕚 11:00–21:00 (первый доклад в 12:00)
669
16
Привет всем!👋 Я к вам сегодня с китайской мудростью: "Абсурднее ИИ фильтров на резюме могут быть только попытки их обойти."
Привет всем!👋 Я к вам сегодня с китайской мудростью: "Абсурднее ИИ фильтров на резюме могут быть только попытки их обойти." -Скрин Инг, 4й спринт до н.э #fun #трудовые_будни
695
17
Привет всем!👋 Небольшой вечерний отчет по соревнованиям, которые берем количеством иногда качеством. Все еще боремся за меда
Привет всем!👋 Небольшой вечерний отчет по соревнованиям, которые берем количеством иногда качеством. Все еще боремся за медали в ROGII - Wellbore Geology Prediction. На данный момент находимся на 80 месте и уже начинаем верить в бога шафл. Особенная гордость, что в ЛБ мы выше, чем Chris Deotte. Очень боюсь, что на привате слетим, поэтому не сильно упарываемся в донастройти, а тестим разные гипотезы. #соревнования
762
18
Ситуация Kaggle во время полуфинала Итак, как вы думаете, кто кого? 🇦🇷 - 🔥 🏴󠁧󠁢󠁥󠁮󠁧󠁿 - 👍 #fun
Ситуация Kaggle во время полуфинала Итак, как вы думаете, кто кого? 🇦🇷 - 🔥 🏴󠁧󠁢󠁥󠁮󠁧󠁿 - 👍 #fun
740
19
Привет всем!👋 Сегодня я с очередным мероприятием! 📆 8 августа пройдем IT-пикник 2026 от 🏦. На мероприятии будет много спикеров, в т.ч из нашей области и области продукта. Обещают большое количество интерактивных зон, где можно познакомиться с компаниями и пообщаться по поводу карьеры (отдельная зона карьерных консультаций). Подробнее о спикерах можно посмотреть тут 📍Где: Москва, Музей-заповедник "Коломенское" 👨‍💻Формат: Офлайн🕺 💰Стоимость: после одобрения заявки, 3000р ✍️Регистрация: по ссылке #мероприятия
958
20
Забыл написать, что в последнее время ловлю лютый гиперфикс на КиШ. Честно говоря, прям серьезно никогда не слушал, наверное
Забыл написать, что в последнее время ловлю лютый гиперфикс на КиШ. Честно говоря, прям серьезно никогда не слушал, наверное с репертуаром серьезно познакомился, как пришел в Альфа-Банк. И вот уже последний месяц вообще ничего другого не слушаю (даже учитывая что все стриминги иностранные подключены). Переклинило и все. Отдельный фаворит - Хозяин леса из-за темповости трека (что присуще панк-року), что заставляет сильнее и быстрее по клавишам тыкать, да и в целом, мотор под припев урчит сильнее, тарелочки в треке отдельный кайф.
771