Заскуль питона (DA/DS/ML) 🐸
Open in Telegram
Канал про Python, анализ данных, SQL и многое другое Чат: https://t.me/my_it_frogs
Show moreThe country is not specifiedThe category is not specified
1 909
Subscribers
+524 hours
+317 days
+28430 days
Posts Archive
😤 Ну что ж, закончились соревнования по Data Science. В целом, эмоции неоднозначные, но это были мои первые соревнования, хоть какие-то.
🔥 5 место
Далее буду участвовать на Kaggle, раскачиваться в RecSys, CV, NLP, возможно поучаствовать в Хакатоне от Вышки
По планам параллельно заботать алгоритмы, сами понимаете для чего 🤐
🍴 Пишите, что бы вы хотели увидеть в следующих постах, а я пока настроюсь на подкастик от @redpf, который пройдёт в это воскресенье в 20:00. Ссылка на пост
Возвращение короля текстов или как 5 аналитиков решали NLP 🤴
История о том, как я с командой участвовал в соревнованиях по Data Science (NLP). Расскажу о трудностях и о том, к чему пришли.
Относительно недавно я начал ботать DL / ML и решил, а почему бы не поучаствовать в NLP. Раскидали задачи и начали активно работать.
Основная задача - алгоритм ранжирования комментариев под текстом публикации.
Изначально, я думал, что речь идет по RecSys, как с карточками на маркетплейсах, когда вам предлагают похожие товары, но пока не будем про это 😢
Первый этап: EDA
Похоже на танцы с бубном и поиск зависимостей в данных. Было выделено несколько фич: количество стоп-слов, слов, предложений, читабельность, тональность и кучу других.
Какие инсайты получили?
Длина текста, определенная тональность и наличие других символов определяют Score на размеченных данных. Дисбаланса классов не было, к over_sampling не приходили 🤨
Второй этап: Обработка текста
Стеминг, лемматизация, создание эмбедингов (Word2Vec, TF-IDF, BERT, CountVectorizer), удаление знаков препинания (прикреплю классный слайд с презентации, который нашел на просторах GitHub). «Мешок слов» не использовали, потому что получается матрица, которая сжирает 1 терабайт памяти 😢
Третий этап:
Перебор сочетаний с Logistic Regression, KNN, RandomForest, GradientBoosting. Самый лучший NDCG Score = 0,92. При обработке через BERT, возможно, получили бы результат лучше. Имеем, что имеем, ждём результатов 🍷
Накидайте реакций, а я накачу пост про Deep Learning, а то немного выбился из режима 🗒
Почему нужно вписываться во все IT-инициативы?
Привет всем, в этом посте я расскажу о том, почему важно участвовать во всяких кейс-чемпионатах, хакатонах и прочей DS-движухе 💼
Я поучаствовал в немалом количестве чемпионатов, где-то даже занимал призовые места, привет 💙. Треки были посвящены маркетингу, продвижению продукта. Вроде бы классно, однако, несмотря на то, что твоя идея могла решить проблему, ты все равно оставался недопонятым жюри, что печально. Есть специализированные кейс-школы, которые обучают по шаблонам как нужно решать задачи, оформлять презы, нет какой-то своей изюминки, а мыслишь ты абстрактными понятиями, которые непонятно откуда рождаются в твоей голове 🤔
Мой путь в аналитике начался с Хакатона, который длился 7 месяцев. Казалось бы, что очень много, но за это время можно было предложить столько гипотез, так покрутить данные, чтобы максимально быстро влиться в то, чем занимаются аналитики 🍴
P.S: Была проблема с GPU, пришлось выкручиваться, залутал за хакатон money
Сейчас я работаю аналитиком и хочу подтянуть Machine Learning и Deep Learning для расширения кругозора и возможной переквалификации 😎
Для этого я участвую в кейс-чемпионате по Data Science, задача связана с NLP, Machine Learning 💃
Команда, кстати, называется «Заскуль Карпова»
Прохожу большое количество курсов, чтобы максимально быстро можно выйти на нормальный уровень в области ML, DL 🍷
Это значительно бустит вас, поскольку вы работаете с реальными инструментами в области DS, а не крутите условные игрушечные данные и джойните таблички 😮
Но как выжить в таком хаосе? Узнаем чуть позже 😨
Накидайте реакций, а я напишу про то, как мы решаем кейс-чемпионат, к чему пришли и какие инсайты нашли в предложенных данных 🤔
Дорогие девушки, от имени лягушки-аналитика, поздравляю вас с Международным женским днём!
Хочу пожелать вам невероятных успехов в нашей общей страсти - Data Science! Не останавливайтесь на достигнутом, следите за новыми открытиями и не бойтесь экспериментировать 🙅
Ведь именно благодаря вашей интуиции и креативности в Data Science можно достичь уникальных результатов. Пусть ваше знание Python, SQL и других аналитических инструментов всегда помогает вам решать сложнейшие аналитические задачи и приводит к блестящим результатам! 🤩
Хочу пожелать вам всегда оставаться улыбчивыми и позитивными, ведь ваше настроение и энергия – это то, что заставляет нас вдохновляться и двигаться вперед. Желаю вам не только успешных и точных дешбордов, но и тех, которые будут не только информативными, но и красивыми 😘
А ваше умение проводить классные A/B эксперименты – это несомненно круто. Пусть выборка всегда будет репрезентативной, а метрики – прекрасными, такими же, как и вы! 😘
Пусть Accuracy (то, как вы точно знаете, как сделать мир лучше),
Precision (ваше остроумие), Recall (ваша забота) и F1-Score (ваш женский инстинкт) были всегда на высоте и стремились к 1 😸
Atomic Heart в реальности?
Всем привет, в этом посте напишу о том, как решил спринтануть ML, чем я пользовался и к чему вообще пришёл. Оговорюсь сразу, мой марафон не закончился 🤓
Представьте, у вас есть волшебная таблетка, проглотив которую вы получаете сразу знания по любой интересующей вас области: ML, DA, DE, DL и др.
Согласитесь, это достаточно круто, ведь можно значительно сократить время 🏋️
Прикольная штука, но пока у нас нет подобных технологий, жаль. Ну, приходится довольствоваться тем, что имеем 🙆
Вдохновившись тем, что ML, нейронные сети - крутое направление, вписался в различные курсы такие, как:
> Deep Learning School от МФТИ
> REU ML School
> ИИ старт от МФТИ
> Основы машинного обучения от ВШЭ
> Основы Data Science и машинное обучение
Используя ChatGPT и параллельно просматривая документацию, курсы, ноутбуки на Kaggle, видео на английском от индусов, я продолжал наращивать свои знания по этому направлению. Я даже составлял RoadMap’у для себя, ну и конечно же, сформировал базу знаний, основываясь на структуре различных курсов 🧑🎓
Что посмотрел за 3 недели?
Градиентные спуски, Scalers, Encoders, эмбединги, A/B тесты, алгоритмы, перцептроны, линейные и нелинейные модели, кросс-валидация и сплитование, нейросетки, различные лайфхаки кеглеров, работа с дисбалансом классов, бустинги, сокращение размерности, EDA для моделей, тюн моделей и подбор гиперпараметров, скоры для оценки моделей, кластеризация (из Unsupervised) и многое другое 😬
Конечно же, не в совершенстве, я же не ИИ, я лягушонок. Думал и думаю перейти к NLP и CV 😶
Вообще, к чему я веду. Если вы думаете, что всемогущи и можете заботать что-то без базы, вэлком в мой мир. Делаю week-off по ML, готовлюсь морально к чемпионату по DS 🔒
В сжатые сроки можно все выучить, понимать полезность действий для бизнеса, но смотрите на моральное состояние, а то, возможно, превратитесь в уголь 😈
Накидайте реакций на этот пост, делитесь историей своего обучения, пока пойду отдохну на собесах 🎁
P.S: Обещаю вернутся с чем-то интересным для вас 😘
🔤🔤🔤🔤 🔤🔤🔤🔤🔤
На днях я начал задумываться над тем, что ждет всё айти в течение десятилетия. Возможно, все будем жить без еды, кто-то выберет путь наименьшего сопротивления и уйдет в небытие 😐
Ужаснула мысль о том, что с выходом ChatGPT и других AI продуктов в свет, можно по-разному с этим играться. Например, создать платформу, которая будет выступать в роли консалтинга и находить какие-то зависимости в данных и подстраиваться под каждый бизнес. Безусловно, здесь должна идти речь о какой-то конфиденциальности, поскольку никто не хочет в очередной раз видеть слитый ГИТ на 42 гб, как в Яндексе 😈
Интересно вообще понимать, может ли данная платформа, если она будет существовать, разорить бедных аналитиков и тех, кто просто пишет запросики в БД. Что же тогда будет с рынком? Пока неясно 😶
Как на основе каких-то нейросетей, которые обучаются на примерах, например, ищут инсайты в данных и являются promt-инженерами, можно выстроить эффективную работу и реализацию поставленных задач внутри компании? Не могут же уйти просто менеджеры, лиды, ведь именно они занимаются постановкой задач, которые необходимы бизнесу в настоящее время. Возможно, нас будет ждать нечто страшное, способное подстраиваться под любой бизнес и обучаться, спустя какое-то время, возможно, всех не станет 🔒
Безусловно, сейчас мы имеем работу с инструментами, которые позволяют в кратчайшие сроки обучаться и искать новую информацию. А что, если вместо этого будет сидеть AI, который будет подстраиваться под данные компаний (если возможно это будет сделать максимально безопасным) и в зависимости от этого, парсинга предстоящих мероприятий, например, будет продумывать решения и закидывать их в ChatGPT или обучаться на них 🏋️
А что думаете вы по этому поводу? Пишите в комментариях!
🔤🔤 🔤 🔤🔤 2️⃣🔤
Пошла вторая неделя моего изучения Machine Learning и Deep Learning.
😌 Потихоньку разбираюсь с метриками машинного обучения. В различных случаях использование одной метрики ничего не даёт. Например, accuracy в задаче классификации для дисбаланса классов. Узнал про то, как можно это пофиксить: например, с помощью over sampling и synthetic data
😏 Оказывается, GridSearch для поиска гиперпараметров - не панацея, работает очень медленно, если датасет большой или перебирать надо много. Лучше использовать другие инструменты для тюна (Optuna, например)
😳 Услышал про эмбеддинг товаров, начал копать в эту сторону. Word2vec (King - Man + Woman = Queen)
🤩 Готовлюсь к кейс-чемпионату по DS от Changellenge (заполняем GitHub)
🧐 Посмотрел пару задач на Kaggle, покрутил всеми любимый Titanic. Accuracy = 0.82 для логистической регрессии
🫠 Продолжаю плавиться в Deep Learning School и ИИ старт от МФТИ.
😦 Взял проект на работе по ML с предиктом уходящих пользователей, пока готовлю витрину данных.
В планах:
1️⃣ Установить и разобраться с AirFlow, DAGs
2️⃣ Продолжить ботать матан и линал для ML
3️⃣ Пройти курс по Docker для разворачивания ML-моделей
😇 Как ускорить своё обучение в несколько раз?
Мотивационный пост? Нет, практический.
😡 Смотря на тенденции IT-рынка, мы скоро придём к тому, что всем будет заправлять ChatGPT и компании, которые используют соответствующие ИИ. Смерть кожаным мешкам? Не думаю, хотя сокращение сотрудников говорит об обратном.
😱 Сейчас из под каждого утюга слышно про какие-то «прикольные» AI-инструменты, которые могут написать курсовые, решить задачу или просто рассказать про то, как сделать самый вкусный в мире плов или отредактировать CV. Предлагаю использовать их с пользой для себя, но это не волшебная таблетка, лишь дополнительный инструмент в арсенал.
Что для своего обучения в Machine Learning и Deep Learning использую я?
🔤🔤🔤🔤🔤🔤
Открытые датасеты, решения других пользователей, можно что-то взять для себя, топовые соревнования
🔤🔤🔤🔤🔤🔤
Речь идёт про зарубежные форумы, на которых выкладываются различные решения по запросам пользователей. Скорее всего, на вашу проблему напарывались другие люди.
🔤🔤🔤🔤🔤🔤🔤
Promt-инженеры обрадовались. На самом деле, очень классный инструмент, которым нужно пользоваться здесь и сейчас. Пишем запросы и радуемся ответу чудо-машины, берём что-то для себя.
🗒 Например:
оценка качества модели для машинного обучения на примере…
зачем нужна кросс-валидация и т.д.
🔤🔤🔤🔤🔤
Не ЖПТ, просто чаты с реальными людьми. Цель - познакомиться с крутыми специалистами, влиться в сильное комьюнити и вместе развиваться.
🔤🔤🔤
Документация, конечно же. Сидим, практикуем английский, если есть вопросы, пишем в чатики и отправляем запрос в AI
😌 Использование этих инструментов в синергии, пока что, даёт какой-то космический буст, имхо
А как обучаетесь вы? Пишите в комментариях, ставьте реакции 🥺
🧑🎓 Ссылка с прошедшего митапа по ML, который был 16 февраля. Приятного просмотра!
https://youtu.be/XyfIE77JQzU
🔤🔤 🔤 🔤🔤 1️⃣🔤
Всем привет, выпускаю пилотный пост своего погружения в Machine Learning и Deep Learning. В целом, пока идёт всё нормально, смотрю про линал. Вопрос к тем, кто знает, зачем нужен линал в ML и DL, если мы все равно засовываем матрицы фич в модель, пытаясь добиться высоких показателей метрик качества? Или это нам нужно для того, чтобы понимать, как все работает под капотом?
Что посмотрел?
🧑🎓 Теория вероятностей и статистика
🧮 Линейная алгебра (вектора и матрицы)
💻 ООП в Python, повторение синтаксиса с либами
💻 Рассмотрел KNN задачу классификации, линейную и логистическую регрессию
😱 Transform, Scalers
😨 Я также продолжаю решать алгоритмы для структуризации действий
Прохожу курс ИИ Старт на Stepik от МФТИ и Deep Learning от МФТИ также, пользуюсь стандартной документацией под библиотеки (sklearn, pandas, numpy)
😇 Расскажите, как практикуетесь вы? Ставьте реакции, если такой формат вам нравится
🚗 Спринт Machine learning и Deep Learning или как не сойти с ума
😅 Всем привет, пока что я готовлюсь по алгосам в 😀, параллельно просматриваю материалы по ML и DL с нуля. Хочу пройти этот путь и создать своего чат жпт, конечно же.
🤔 Как вообще я это вижу?
Беру курс, читаю статейки, делюсь с вами и вместе мы идём к изучению сложных направлений. Например, посмотрел линал, нашёл интересные конструкции на 👩💻, поделился с вами, Поучаствовал в соревнованиях, поделился своим видением и т.д.
Предлагаю выкладывать результаты каждую неделю, чтобы можно было более корректно отследить что-то новое.
😇 Пишите свои идеи по такому формату, поддержите реакциями если интересно будет посмотреть реалити-шоу с манагером из РАНХиГС (мой бекграунд, да-да)
