Запрети мне псевдолейблить
Открыть в Telegram
Канал о пути к Kaggle competitions (теперь уже) GrandMaster и поте, которым обливаешься в процессе Последний авторский канал про мл, претендующий на искренность и позволяющий ставить клоунов Для контакта пишите в сообщения канала, они бесплатные
Больше4 130
Подписчики
+324 часа
+177 дней
+17830 день
Архив постов
Все, кто учился DL по слайдам постсоветской матшколы знают про Nesterov Accelerated Gradient. Статья вышла еще в 1983 году, но оценить ее реальный вклад можно только в последние лет 10-15. Производные от него методы оптимизации, к сожалению, не стали железным стандартом в индустрии, но довольно популярны у знающих людей
Так вот, за свой вклад в математику Юрий Нестеров получил премию Гаусса, с чем я его горячо поздравляю. Это буквально нобелевская премия, но для математиков и высшая форма признания вклада в науку.
О том, как работает метод оптимизации и в чем идея, лучше посмотреть вот в этом посте, а я хотел бы примерно рассказать, как так вышло, что метод с лучшей теоретической оценкой не стал стандартом.
Мои три подписчика с ММП скажут, что у Adan/NAdam не нормируют градиенты и из-за этого менее устойчивы к правильному LR -> хуже проскакивают турбулентные участки гиперповерхности лосса. Кстати, возмущенные неточностью подписчики с ммп ставьте обезьяну, узнаем сколько вас.
Но фатальным ударом для этих методов был таймлайн.
Статья про Nadam появилась в 2016, и в этот момент Attention is all you need (Aiayn) уже находилась в процессе написания, так что в ней использовали проверенный Adam как оптимизиатор. После, все побежали воспроизводить результаты у себя и следовали рецепту, описанному в статьей. У нас есть десятки тысяч статей, которые развивают идеи Aiayn и большая часть использует именно Adam. А значит ученых больше наблюдений для Adam и его имплементации больее оптимизированы под современное железо.
По практике скажу, что Nesterov momentum мне буста в качестве давал ровно ноль раз, так что приглашаю попустить меня в комментах и объяснить, почему нужно всегда учить именно с Adan.
Как устроены ИИ-агенты, которые умеют программировать сами?
27 августа в 19:00 встречаемся в кампусе Центрального университета на митапе про кодинговых ИИ-агентов.
На митапе:
⚫️ узнаем, почему кодинговые агенты превращаются в отдельные сервисы и как устроены распределенные агентные системы;
⚫️ разберем протоколы ACP и A2A и посмотрим, как разные агенты и клиенты могут взаимодействовать между собой;
⚫️ на практическом мастер-классе создадим собственного автономного агента с помощью Deep Agents от LangChain — с планированием, управлением контекстом, файловой системой и параллельной работой сабагентов.
Мастер-класс — с ноутбуками, так что получится не только посмотреть, но и попробовать собрать агента своими руками.
Спикеры:
⚫️Денис Артюшин — технический владелец продукта агентской платформы в Т-Банке
⚫️Полина Реброва — ведущий инженер по разработке, Сбер
⚫️Александр Шахов — инженер-преподаватель и академический руководитель направления «Разработка» в Центральном университете
📍 27 августа, 19:00
📍 Кампус Центрального университета, Москва
Зарегистрироваться по ссылке
Разбор ROGII - Wellbore Geology Prediction начнем с сетапа соревнования.
Представьте, что Герр Дональд Трамп сказал нам 'drill, baby, drill', а мы и поверили. И вот уже бурим скважину для исследования недр где-то в Техасе: у нас есть идеальный план бурения и наш бур напичкан кучей датчиков. Буром управляет опытный оператор, который знает, что у пласта породы плотность неравномерная: встречаются камни, пустоты и включения других пород. Из-за этого бур немного (или много) поворачивает внутри скважины и отклоняется от модельной траектории. Оператор смотрит на датчики и подруливает буром, чтобы оставаться как можно ближе к модельному плану бурения- его цель как можно корректнее разведать датчиками на буре показания как можно ближе к траектории.
Наша задача- понять, как глубоко в пласте мы находимся, зная предыдущие наблюдения + текущие показатели датчиков. В общем смысле это надо, чтобы бур не выскочил в другой пласт (нам не интересный) и не насобирал ненужной информации. Ну и спланировать, как мы будем качать нефть, сжигать попутный газ и с этой бесплатной энергии майнить битки
И того, у нас есть:
1. Координаты в каждый момент времени для бура для каждой скважины. Доступна информация до тех пор, пока бур спускается в целевой пласт и для часть скважины уже внутри пласта. Это наш train кусочек для авторегрессии. Еще для каждого участка скважины знаем длину пути от поверхности и оценочное расстояние в футах до границ всех нам известных пластов (оценивается по typewell, последний пункт).
2. Значения Gamma Ray (GR) на протяжении всего пути. Работает так: у каждой породы свой уровень гамма-радиоактивности, так что регулярно снимая показатели фоновой радиации с бура, мы можем по изменениям понять, что состав породы меняется. Для каждого пласта мы знаем примерны состав и показатель радиоактивности по typewell (следующий пункт), так что можем довольно неплохо понять, что слишком близко подошли к границе пласта и рулить назад.
3. Знаем те же показатели для ближайшей измерительной скважины (typewell): глубину, значение GR на этой глубине и метку того, в каком пласте находимся. Предполагается, что она пробурена вертикально вниз.
При этом данные реальные и близкие скважины переиспользуют одни и те же typewell и вообще у них направление и траектория бурения похожа, потому что пласты породы расположены друг на друге и это сильно влияет на оптимальную траекторию.
Можно было бы сказать, что в Техасе все данные по скважинам обязательно нужно сдавать правительству, но организаторы об этом позаботились и к каждой скважине и ее координатам добавили индивидуального шума, так что относительное расстояние между скважинами исказилось. И кажется даже немного перемешались ближайшие typewell. Мало того, скважины еще и обрезали, так что матчить их долго и совсем не ясно, какие скважины попали в тест, а какие нет, потому что это Code Comp.
Как решать будете?
Наконец-то новый RL-мем в моем паблике по RL.
Создано специально для Азата, который не уйдет на пенсию, пока на каггле не кончится РЛ
Ого, ну раз пошла такая пьянка, придется ответить. Спасибо кстати, но поздравлять пока рано...
такой вот примерно рецепт усредненный получился:
- имитация на топовых игроках, точность около 85% была на валидации, давало 950-1100 эло за день игры
- ppo с подгрузом чекпоинта из имитации, где-то 400 топовых дек, играют все против всех, но с вероятностью 90% берем и меняем часть карт на рандомные - так учим эмбеды карт которых не было в имитации (а это процентов 80) ну и учимся играть против мусора чтобы не отлетать типам с 450 эло.
- ppo с подгрузом предыдущего шага, все против всех но теперь только 10% что карты будут меняться, плюс фриз эмбедов. дальше чемпионат по итогам которого я удалил 50% дек.
Сабмиты давали 1000-1100, примерно, какие-то лучше имитации, какие-то хуже, хрен поймешь.
- грузим прошлый чекпоинт, берем top 1 деку по итогам чемпионата (flg 55456110) и опять PPO, но один из игроков всегда играет топовую деку, другой одну из оставшихся 200
на хитрые штуки типа кастомных голов и MCTS времени совсем не осталось, фактически первый сабмит последнего шага был за 4 часа до делайна. ну и я нуб в RL, так что решение довольно ванильное, разве что я потырил некоторые штуки у топов orbits
учил на 4090, за неделю до конца снял 8x5090, итоговый пайплайн со всеми шагами двое суток где-то учился.
исходя из логов надеюсь на 3-8 место, из забавного так как по-сути 50% времени я тренировал деку flg и модель училась против него играть, то на играх за сутки винрейт больше 80% против него, лол. и с luca каким-то образом 55%, этого я уже никак не могу объяснить, возможно везет пока
совет молодым кто пойдет ферму решать, если позволите:
не торопитесь идти делать RL
сначала отточите пайплайн на имитации - он должен вас сходу закидывать в золото. если не закидывает - идите ловите ошибки, досыпайте и чистите данные. я что на orbits, что тут потратил 90% времени на это. codex/claude пишут довольно странный код если детально не смотреть, типа ставят LN после GELU, weight decay на эмбеды, при том что за батч 95% карт не будет сыграна и тд. если ваш пайплайн не способен тупо скопировать стратегию, то и все остальное вряд ли поможет. /goal на ночь и оптимизация кода на трейнах по 30 минут аля nanogpt speedrun часто давала фиксы и неожиданно полезные решения.
И помните, у самурая нет цели, только путь
У покемонов прошлой ночью настал дедлайн сабмитов. Через две недели будут зафиксированы финальные места, но по моей оценке вас будет шатать на +-30 вверх и вниз от текущего уровня. Разбор соревнования сделаю в текстовом виде, чтобы закрепить все находки.
Ожидаю, что мы останемся с командой на ~100 месте, так что я видимо подфармил еще одно серебро. Уже восьмое
Что у нас работало:
BC
PSRO
Поиск мата за один ход (внезапно)
Тупо скейлить модель в ширину
AUX-голова на победу в матче (так называемая value-head для бедных)
AUX-голова на взятие приза
Что не работало:
Хитрый анализ колод
PPO
MCTS
AWR (вообще никак)
До 20 августа еще открыт прием заявок в ИТ-магистратуру Центрального университета!
Это отличная возможность учиться на реальных бизнес-кейсах, а также совмещать учебу с развитием в карьере.
У всех абитуриентов есть шанс получить грант до 75% на весь срок обучения.
Регистрируйся в грантовом конкурсе по ссылкам:
➡️Офлайн программа
➡️Онлайн программа
Тем временем Мистраль стал первой моделью, которая автономно выиграла соревнование на Kaggle, взяв top-7 в Rogii Wellbore. Французская команда уже опубликова разбор решения модели:
14 из 22 кагглеров улетают из золота на привает
А из призов выкинуло буквально всех
Все считается/парсится прямо на бизибаре, ему нужен только ваш токен каггла и желание фармить медальки
На каггле захостили новую RSNA Knee Abnormality Detection:
https://www.kaggle.com/competitions/rsna-knee-abnormality-detection
Традиционно челлендж посвящен МРТ данным в 2.5D формате. На этот раз надо обнаруживать 12 видов остеопорза в коленках пациентов
570 ГБ снимков в высоком разрешении, самое время нафармить золото за счет ваших бесконечных ресурсов (ну и помахаться с NVIDIA заодно). Главное, чтобы инференс влез в 9 часов на кагл гпу.
Соревнование проходит уже 8 лет подряд, так что массив опыта в нем накоплен титанический. Возможно, и мне пора вкатиться и поучаствовать, но в прошлые годы, признаюсь, меня просто пугал объем хаков, в которые надо вкатиться.
