Блог постолимпиадника
Open in Telegram
328
Subscribers
+124 hours
No data7 days
No data30 days
Posts Archive
Про бот
Ботаю DLS. Пока вот разбираюсь со сверточными нейронками, прогресс вроде есть, но в меру загруженности так сказать. Поботал каггл в итоге на прошлой неделе, у меня получилось добиться хорошего скора и 500 места в общей таблице (и это реально 500 место кстати, ага), Планирую доботать наконец свертки и позаниматься классификацией изображений (датасет с симпсонами, дааа), плюсом у вышки скоро курс по NLP на 10 дней, может стоит посмотреть.
Соревнований по ML в последнее время видимо не особо много, потому буду ботать курсы и повышать квалификацию так сказать. Очень хочу попробовать себя в каком-нибудь соревновании, вообще это было и раньше, просто как-то не получалось, но сейчас я вроде как решил взяться за бот серьезнее, потому было бы круто если что-нибудь найду.
Хочу серьезнее задуматься о стажировках. В плане, наверное даже понять для себя конкретнее куда хочу пойти стажиться и как устроены стажировки в таких компаниях. Всякие сильные челиксы говорят что стажиться лучше в небольших компаниях, якобы что в яндексе, что в сбере может не повезти с командой и опыт стажки будет не очень, а в компании поменьше будет больше опыта разработки и так далее.
Кроме Точки (из которой собственно все крутые датасайентисты которых знаю) на том же data dojo оч хорошо отзывались о Авито, например. Один из плюсов Авито, насколько я понял — возможность работать удаленно из любого места в мире, появляется так сказать мобильность если уж туда идти. Но в Авито, видимо, очень мало берут датасайентистов(. Тем не менее, посмотрим.
Остальное
Давно не писал сюда мысли о чем-то эфимерном по типу дальнейших планах и т.д. Возможно, уже то самое время.
Я уже не помню того момента когда мне приходилось заново вкатываться в какую-то новую для себя деятельность. С олимпиадами все было достаточно просто, но это было давно, уже как три года прошло, всякие же начинания во время бота олимпиад сопровождались именно олимпиадными успехами и, ну, чувствовались по-другому.
Поступление в вышку же сильно меняет жизнь в этом плане. Олимпиады закончились и достижений надо уже добиваться в новом деле, как и собственно перестраивать свою жизнь вообще. Олимпиадное прошлое помогает, но сильно это не выражается, максимум проще дается материал на первых порах и поступивших на пилоты знаешь почти всех. Достижения в олимпиадах больше не роляют, максимум указать в резюме что вот в школьные годы был в этом хорош, но билета в будущее в плане БВИ для людей не из школы еще не придумали и вряд ли придумают вообще. Можно, конечно, податься в прошлое и жестко заниматься ICPC, однако это не в моем вкусе и как дело достаточно узконаправленная вещь, хоть и знаю тех кто занимается этим, дак ведь и даже уважаю их и их выбор.
Немного трудно психологически. Нет прошлых масштабов: раньше вот посты были каждую неделю, мол, написал то, написал это, рейтинг поднял, на финал вышел, затащил, а сейчас и со временем были траблы, да и в предметную часть MLя надо достаточно сильно вникать. Начинаю корить себя за то что не круто продвигаюсь, хоть и отговорки есть, но обманывать себя это вещь опасная, лучше так не делать.
А ведь еще рядом есть люди, которые себе работают на первом курсе, как и добиваются кучи целей. Для меня это отчасти минус олимпиад — казалось бы, ботай себе дальше и не смотри на других, но работать продуктивнее проще когда видишь что у других получается. В этом есть некоторый диссонанс: с одной стороны надо любить себя и двигаться самостоятельно, не смотря на других челов, с другой стороны а как это абстрагироваться от успехов других и не комплексовать когда у тебя тоже может получиться — собственно, вещь достаточно сложная.
Не хочу снова зажить прошлым, ведь олимпиады это была веселая история и надо двигаться дальше. ICPC и преподство меня счастливее не сделают, причину почему уже давно объяснял. Ну и в целом хочется уже наконец успехов в MLе, но это, собственно, требует времени.
Пост как в старые добрые будет состоять из нескольких тем. Поехали
Про Data Dojo
Одним из самых впечатляющих событий за последнее время для меня стало очное участие в Data Dojo — тренировки от Яндекса по ML, о которой я писал выше. Так как это?
Во-первых, data dojo это атмосферно. Сами тренировки проходят в офисе Яндекса на улице Льва Толстого 16, сам по себе офис в центре и вообще очень большой, атмосферы придает. Для нас же выделили крутой зал совмещенный с ... кухней?) Впервые такое вижу, может быть челики внутри Яндекса просто после лекций всегда идут себе готовить и им для этого прямо кухня нужна.
Отмечу, что на прошедшую тренировку зарегистрировалось огромное количество из индустрии и при этом всех позвали участвовать очно. Могу сказать, что как маленький первокур из ВШЭ не очень привык к такому обществу). Все такие взрослые дяди с огромным опытом разработки, а ты ходишь такой умг пук приветик как дела я тут начинающий мл девелопер)). Тем не менее, люди встречаются интересные и очень разные: кто-то пишет себе софты для ТЭЦ и пришел на тренировку для общего развития, кто-то закончил физфак а потом переквалифицировался себе в дата сайентиста и работает уже полгода джуном, кто-то работает в мегафоне дата инженером, кто-то в маге учится, ну а кто-то просто студент первокур как я, да. Кстати, общение на тренировке Яндекс тоже предусмотрел, добавив наклеечки "хочу общаться". Впервые такое вижу и мера, на самом деле, очень крутая, все же лучше не лезть в личное пространство чем лезть.
Сама тренировка делится на несколько лекций по теме ML. Собственно, я застал три лекции — разбор решения по рекомендации музыки от автора топ 2 решения Yandex Cup'a, разбор топ 2 решения на хакатоне AgroHack (кейс поиска земель для виноградников) и спич о AI CTF — собственно, CTF по AI (короче говоря как привлечь людей, занимающихся MLeм, к занятию CTF и информационной безопасностью в целом и наоборот)
Спич про топ 2 решение Yandex Cup'a мне понравился. Все же мне как человеку, который хотел бы научиться писать kaggle соревнования в своей жизни, достаточно полезно понимать как строить крутое решение здорового человека. А вообще ощущение от данного спича было как от разбора какой-нибудь новой темы на лекции по алгоритмам, все же, автор использовал энное количество уже готовых решений о которых я, как новичок, не знаю, а гуглить во время презентации грозит потерей линии повествования (!!). Короче, вот.
Понял для себя что мне достаточно интересна тема рекомендаций. Возможно, она также интересна как и в целом то, с чем работал и о чем знаю хоть что-то, однако вот предчувствие есть что рекомендательные системы можно поботать)). У меня даже есть мысли как это делать, но в целом посмотрим как будет с планами.
Остальные спичи были крутыми, но не так сильно зацепили. Тем не менее, лекции были оч крутыми и вообще спасибо data dojo за лекции, особенно очные.
Ну а еще яндекс стандартно выдал мерча и даже покормил (!!!), прикиньте. Спасибо яндексу за возможность покушать в холодный снежный вечер.
Господа, сегодня в этот знаменательный день я выиграл яицо! Десять реакций и я его выложу!!!
А еще кстати как благодарность за рекомендацию оставлю тут линк на крутой канал Сережи Вольнова о том как он тащит всякие хакатоны и соревки по ML. https://t.me/sergak_blog
Хотел попробовать поботать каггл на этой неделе.
(именно каггл, а не продолжать продвижение по курсу DLS)
Почему? Потому, что
1.) понимаю что у меня есть бреши в понимании классического ML, а DL все же складывается из классического ML, соответственно его было бы круто доосмыслить так сказать. Дело ведь в том, что я подхожу к боту MLя и всего далее основательно, мне же с этим типо достаточно долго работать в перспективе, потому в этом контексте лучше потратить неделю на дополнительное осознание всего что прошел чем гнаться по курсу DLS как не в себя
2.) потому что kaggle для меня это новый формат. Если с хакатонами я уже знаком, то kaggle для меня новая вещь и просто достаточно интересная)
3.) потому, что хочу попрактиковать свой ML и порешать на ML задачки, вот.
В планах взять два обучающих соревнования с каггла и поделать их всю неделю. Баянистый титаник брать не хотелось бы)) Но вообще посмотрим, может есть прям крутые обучающие таски которые можно было бы поделать
Кроме обучения MLю так сказать, зарегистрировался на data dojo. Зачем? Чтобы посмотреть, что это такое отчасти: никогда не был на всяких ML-конференциях-сборах-киберкотлет, а это еще и в офисе Яндекса будет проходить. Да и просто интересно с людьми пообщаться.
Тренировка data dojo будет проходить в четверг. Планирую скататься очно чтобы набрать себе впечатлений и познакомиться с кем-нибудь, было бы неплохо.
Вот, такие дела)
Еще понял насколько мало всего знаю в визуализации данных с датасета и о том как это интерпретировать в используемые метрики, вообще не очевидная история на самом деле
Скажу, что сдавать задачку на каггле не зашло тем, что чтобы набрать скор побольше надо чисто параметры в catboost крутить)). Надеюсь это не на всем каггле так
В остальном же на каггл стоит обратить внимание имхо, может, порешаю еще что-то дополнительно ближайшее время, на каггле же есть всякие задачки
Первая (нет) посылка на kaggle 🥳
На самом деле скор не особо удивительный, вроде как можно покрутить параметры и побольше набрать
Приветик
Прошло больше недели с воскрешения блога и начала написания постов по поводу бота. Что же в моей жизни изменилось и что я могу по этому поводу сказать? Услышите далее.
Вышечка и контрольные работы
Второй модуль первого курса в вышке, как я понял, характеризуется кучей контрольных и коллоквиумов, навешивающихся на учеников. Хорошо ли это? Ну, скорее это просто данность, с которой нужно жить). Собственно, прошлая неделя не была исключением.
На прошлой неделе бедные ПМИшники сдавали коллоквиум по матанализу и писали кр по экономике. Да, не особо густо учитывая, что на этой неделе у нас две таких достаточно важных контрольных (по матанализу и линалу), тем не менее. Данные формы контроля забрали у меня достаточно времени на неделе, но зато заботал это я успешно, за коллок по матанализу даже 10 получил, круто да. Ну и вроде это даже значит, что у меня больше шансов получить за предметы желаемую оценку, да.
Коллоквиум, запомните, лучше начать ботать сильно заранее чтобы все успевать). А лучше, наверное, схватывать на лекциях заранее и перед коллоквиумом все вспомнить. Что коллоквиумы, что контрольные ботаются тем проще, чем больше человек вовлекается на лекциях имхо. Это уже зависит от способностей человека, имхо.
С другой стороны начинаю ценить сунцовскую базу. Весь текущий матанализ, исключая всякие сложные штуки по типу строгих определений пределов функций, топологии прямой, сходимости рядов и т.д определяются и даются в сунце достаточно базово. В сунц урфу матанализ двухгодичные матинфы обычно проходят до теоремы Лагранжа о среднем, что как мне кажется появится у нас в матанализе к концу второго модуля, имхо.
Короче говоря, все заботал, я молодец :3.
Машинное обучение
Это уже часть про поныть, потому что существенного в этом деле не произошло ничего. В этом есть конкретно моя вина, конечно.
Основная вещь, которую мне нужно заботать конкретно сейчас — это продвинутый поток DLSа. Почему? Потому, что это база а базу нужно понимать чтобы двигаться дальше по жизни, я еще многого не знаю из теории чтобы заниматься машинным обучением на практике, потому нужно заниматься подобной историей.
Как продвижение? Не очень. Точнее, за прошлую неделю его не произошло совсем. Из-за того, что на этой неделе у меня уже прогорают дедлайны домашек (просрочил бот DLSа по максимуму, так сказать), решил отказаться от идеи лично взяться за какую-нибудь сореву по типу яндекс капа и по крайней мере на этой неделе экстренно поботать DLS чтобы не умереть. Мне вообще понравилось описание кейса яндекс контеста, никогда не работал с музыкой как с объектом, не думал как выделять в нем признаки и что можно выделить, не знакомился с подходами к рекомендации этой штуки в частности, однако переоценивать себя тоже нельзя — стараюсь в своей нынешней жизни тратить на все время +- равномерно, иначе можно и выгореть.
Короче, до пятницы нужно сдать баянистую задачку на каггле про чистый мл а также сдать ноутбук с нейроночьками, а то будет уже совсем грустно. Тем не менее чувствую сильную стагнацию в направлении своего бота машинного обучения — вроде я и хочу заботать, а за неделю ничего не сделал. Ну, это надо править.
Ботаем?
