es
Feedback
Заскуль питона (DA/DS/ML) 🐸

Заскуль питона (DA/DS/ML) 🐸

Ir al canal en Telegram

Канал про Python, анализ данных, SQL и многое другое Чат: https://t.me/my_it_frogs

Mostrar más
El país no está especificadoLa categoría no está especificada
1 909
Suscriptores
+524 horas
+317 días
+28430 días
Archivo de publicaciones
😤 Ну что ж, закончились соревнования по Data Science. В целом, эмоции неоднозначные, но это были мои первые соревнования, хоть какие-то. 🔥 5 место Далее буду участвовать на Kaggle, раскачиваться в RecSys, CV, NLP, возможно поучаствовать в Хакатоне от Вышки По планам параллельно заботать алгоритмы, сами понимаете для чего 🤐 🍴 Пишите, что бы вы хотели увидеть в следующих постах, а я пока настроюсь на подкастик от @redpf, который пройдёт в это воскресенье в 20:00. Ссылка на пост

Продолжаем 😘 P.S: 10-е место. Увидимся в финале на презенташке)
Продолжаем 😘 P.S: 10-е место. Увидимся в финале на презенташке)

Возвращение короля текстов или как 5 аналитиков решали NLP 🤴 История о том, как я с командой участвовал в соревнованиях по D
Возвращение короля текстов или как 5 аналитиков решали NLP 🤴 История о том, как я с командой участвовал в соревнованиях по Data Science (NLP). Расскажу о трудностях и о том, к чему пришли. Относительно недавно я начал ботать DL / ML и решил, а почему бы не поучаствовать в NLP. Раскидали задачи и начали активно работать. Основная задача - алгоритм ранжирования комментариев под текстом публикации. Изначально, я думал, что речь идет по RecSys, как с карточками на маркетплейсах, когда вам предлагают похожие товары, но пока не будем про это 😢 Первый этап: EDA Похоже на танцы с бубном и поиск зависимостей в данных. Было выделено несколько фич: количество стоп-слов, слов, предложений, читабельность, тональность и кучу других. Какие инсайты получили? Длина текста, определенная тональность и наличие других символов определяют Score на размеченных данных. Дисбаланса классов не было, к over_sampling не приходили 🤨 Второй этап: Обработка текста Стеминг, лемматизация, создание эмбедингов (Word2Vec, TF-IDF, BERT, CountVectorizer), удаление знаков препинания (прикреплю классный слайд с презентации, который нашел на просторах GitHub). «Мешок слов» не использовали, потому что получается матрица, которая сжирает 1 терабайт памяти 😢 Третий этап: Перебор сочетаний с Logistic Regression, KNN, RandomForest, GradientBoosting. Самый лучший NDCG Score = 0,92. При обработке через BERT, возможно, получили бы результат лучше. Имеем, что имеем, ждём результатов 🍷 Накидайте реакций, а я накачу пост про Deep Learning, а то немного выбился из режима 🗒

Почему нужно вписываться во все IT-инициативы? Привет всем, в этом посте я расскажу о том, почему важно участвовать во всяких кейс-чемпионатах, хакатонах и прочей DS-движухе 💼 Я поучаствовал в немалом количестве чемпионатов, где-то даже занимал призовые места, привет 💙. Треки были посвящены маркетингу, продвижению продукта. Вроде бы классно, однако, несмотря на то, что твоя идея могла решить проблему, ты все равно оставался недопонятым жюри, что печально. Есть специализированные кейс-школы, которые обучают по шаблонам как нужно решать задачи, оформлять презы, нет какой-то своей изюминки, а мыслишь ты абстрактными понятиями, которые непонятно откуда рождаются в твоей голове 🤔 Мой путь в аналитике начался с Хакатона, который длился 7 месяцев. Казалось бы, что очень много, но за это время можно было предложить столько гипотез, так покрутить данные, чтобы максимально быстро влиться в то, чем занимаются аналитики 🍴 P.S: Была проблема с GPU, пришлось выкручиваться, залутал за хакатон money Сейчас я работаю аналитиком и хочу подтянуть Machine Learning и Deep Learning для расширения кругозора и возможной переквалификации 😎 Для этого я участвую в кейс-чемпионате по Data Science, задача связана с NLP, Machine Learning 💃 Команда, кстати, называется «Заскуль Карпова» Прохожу большое количество курсов, чтобы максимально быстро можно выйти на нормальный уровень в области ML, DL 🍷 Это значительно бустит вас, поскольку вы работаете с реальными инструментами в области DS, а не крутите условные игрушечные данные и джойните таблички 😮 Но как выжить в таком хаосе? Узнаем чуть позже 😨 Накидайте реакций, а я напишу про то, как мы решаем кейс-чемпионат, к чему пришли и какие инсайты нашли в предложенных данных 🤔

Дорогие девушки, от имени лягушки-аналитика, поздравляю вас с Международным женским днём! Хочу пожелать вам невероятных успехов в нашей общей страсти - Data Science! Не останавливайтесь на достигнутом, следите за новыми открытиями и не бойтесь экспериментировать 🙅 Ведь именно благодаря вашей интуиции и креативности в Data Science можно достичь уникальных результатов. Пусть ваше знание Python, SQL и других аналитических инструментов всегда помогает вам решать сложнейшие аналитические задачи и приводит к блестящим результатам! 🤩 Хочу пожелать вам всегда оставаться улыбчивыми и позитивными, ведь ваше настроение и энергия – это то, что заставляет нас вдохновляться и двигаться вперед. Желаю вам не только успешных и точных дешбордов, но и тех, которые будут не только информативными, но и красивыми 😘 А ваше умение проводить классные A/B эксперименты – это несомненно круто. Пусть выборка всегда будет репрезентативной, а метрики – прекрасными, такими же, как и вы! 😘 Пусть Accuracy (то, как вы точно знаете, как сделать мир лучше), Precision (ваше остроумие), Recall (ваша забота) и F1-Score (ваш женский инстинкт) были всегда на высоте и стремились к 1 😸

Atomic Heart в реальности? Всем привет, в этом посте напишу о том, как решил спринтануть ML, чем я пользовался и к чему вообще пришёл. Оговорюсь сразу, мой марафон не закончился 🤓 Представьте, у вас есть волшебная таблетка, проглотив которую вы получаете сразу знания по любой интересующей вас области: ML, DA, DE, DL и др. Согласитесь, это достаточно круто, ведь можно значительно сократить время 🏋️ Прикольная штука, но пока у нас нет подобных технологий, жаль. Ну, приходится довольствоваться тем, что имеем 🙆 Вдохновившись тем, что ML, нейронные сети - крутое направление, вписался в различные курсы такие, как: > Deep Learning School от МФТИ > REU ML School > ИИ старт от МФТИ > Основы машинного обучения от ВШЭ > Основы Data Science и машинное обучение Используя ChatGPT и параллельно просматривая документацию, курсы, ноутбуки на Kaggle, видео на английском от индусов, я продолжал наращивать свои знания по этому направлению. Я даже составлял RoadMap’у для себя, ну и конечно же, сформировал базу знаний, основываясь на структуре различных курсов 🧑‍🎓 Что посмотрел за 3 недели? Градиентные спуски, Scalers, Encoders, эмбединги, A/B тесты, алгоритмы, перцептроны, линейные и нелинейные модели, кросс-валидация и сплитование, нейросетки, различные лайфхаки кеглеров, работа с дисбалансом классов, бустинги, сокращение размерности, EDA для моделей, тюн моделей и подбор гиперпараметров, скоры для оценки моделей, кластеризация (из Unsupervised) и многое другое 😬 Конечно же, не в совершенстве, я же не ИИ, я лягушонок. Думал и думаю перейти к NLP и CV 😶 Вообще, к чему я веду. Если вы думаете, что всемогущи и можете заботать что-то без базы, вэлком в мой мир. Делаю week-off по ML, готовлюсь морально к чемпионату по DS 🔒 В сжатые сроки можно все выучить, понимать полезность действий для бизнеса, но смотрите на моральное состояние, а то, возможно, превратитесь в уголь 😈 Накидайте реакций на этот пост, делитесь историей своего обучения, пока пойду отдохну на собесах 🎁 P.S: Обещаю вернутся с чем-то интересным для вас 😘

🔤🔤🔤🔤 🔤🔤🔤🔤🔤 На днях я начал задумываться над тем, что ждет всё айти в течение десятилетия. Возможно, все будем жить без еды, кто-то выберет путь наименьшего сопротивления и уйдет в небытие 😐 Ужаснула мысль о том, что с выходом ChatGPT и других AI продуктов в свет, можно по-разному с этим играться. Например, создать платформу, которая будет выступать в роли консалтинга и находить какие-то зависимости в данных и подстраиваться под каждый бизнес. Безусловно, здесь должна идти речь о какой-то конфиденциальности, поскольку никто не хочет в очередной раз видеть слитый ГИТ на 42 гб, как в Яндексе 😈 Интересно вообще понимать, может ли данная платформа, если она будет существовать, разорить бедных аналитиков и тех, кто просто пишет запросики в БД. Что же тогда будет с рынком? Пока неясно 😶 Как на основе каких-то нейросетей, которые обучаются на примерах, например, ищут инсайты в данных и являются promt-инженерами, можно выстроить эффективную работу и реализацию поставленных задач внутри компании? Не могут же уйти просто менеджеры, лиды, ведь именно они занимаются постановкой задач, которые необходимы бизнесу в настоящее время. Возможно, нас будет ждать нечто страшное, способное подстраиваться под любой бизнес и обучаться, спустя какое-то время, возможно, всех не станет 🔒 Безусловно, сейчас мы имеем работу с инструментами, которые позволяют в кратчайшие сроки обучаться и искать новую информацию. А что, если вместо этого будет сидеть AI, который будет подстраиваться под данные компаний (если возможно это будет сделать максимально безопасным) и в зависимости от этого, парсинга предстоящих мероприятий, например, будет продумывать решения и закидывать их в ChatGPT или обучаться на них 🏋️ А что думаете вы по этому поводу? Пишите в комментариях!

🔤🔤 🔤 🔤🔤 2️⃣🔤 Пошла вторая неделя моего изучения Machine Learning и Deep Learning. 😌 Потихоньку разбираюсь с метриками машинного обучения. В различных случаях использование одной метрики ничего не даёт. Например, accuracy в задаче классификации для дисбаланса классов. Узнал про то, как можно это пофиксить: например, с помощью over sampling и synthetic data 😏 Оказывается, GridSearch для поиска гиперпараметров - не панацея, работает очень медленно, если датасет большой или перебирать надо много. Лучше использовать другие инструменты для тюна (Optuna, например) 😳 Услышал про эмбеддинг товаров, начал копать в эту сторону. Word2vec (King - Man + Woman = Queen) 🤩 Готовлюсь к кейс-чемпионату по DS от Changellenge (заполняем GitHub) 🧐 Посмотрел пару задач на Kaggle, покрутил всеми любимый Titanic. Accuracy = 0.82 для логистической регрессии 🫠 Продолжаю плавиться в Deep Learning School и ИИ старт от МФТИ. 😦 Взял проект на работе по ML с предиктом уходящих пользователей, пока готовлю витрину данных. В планах: 1️⃣ Установить и разобраться с AirFlow, DAGs 2️⃣ Продолжить ботать матан и линал для ML 3️⃣ Пройти курс по Docker для разворачивания ML-моделей

😇 Как ускорить своё обучение в несколько раз? Мотивационный пост? Нет, практический. 😡 Смотря на тенденции IT-рынка, мы скоро придём к тому, что всем будет заправлять ChatGPT и компании, которые используют соответствующие ИИ. Смерть кожаным мешкам? Не думаю, хотя сокращение сотрудников говорит об обратном. 😱 Сейчас из под каждого утюга слышно про какие-то «прикольные» AI-инструменты, которые могут написать курсовые, решить задачу или просто рассказать про то, как сделать самый вкусный в мире плов или отредактировать CV. Предлагаю использовать их с пользой для себя, но это не волшебная таблетка, лишь дополнительный инструмент в арсенал. Что для своего обучения в Machine Learning и Deep Learning использую я? 🔤🔤🔤🔤🔤🔤 Открытые датасеты, решения других пользователей, можно что-то взять для себя, топовые соревнования 🔤🔤🔤🔤🔤🔤 Речь идёт про зарубежные форумы, на которых выкладываются различные решения по запросам пользователей. Скорее всего, на вашу проблему напарывались другие люди. 🔤🔤🔤🔤🔤🔤🔤 Promt-инженеры обрадовались. На самом деле, очень классный инструмент, которым нужно пользоваться здесь и сейчас. Пишем запросы и радуемся ответу чудо-машины, берём что-то для себя. 🗒 Например: оценка качества модели для машинного обучения на примере… зачем нужна кросс-валидация и т.д. 🔤🔤🔤🔤🔤 Не ЖПТ, просто чаты с реальными людьми. Цель - познакомиться с крутыми специалистами, влиться в сильное комьюнити и вместе развиваться. 🔤🔤🔤 Документация, конечно же. Сидим, практикуем английский, если есть вопросы, пишем в чатики и отправляем запрос в AI 😌 Использование этих инструментов в синергии, пока что, даёт какой-то космический буст, имхо А как обучаетесь вы? Пишите в комментариях, ставьте реакции 🥺

🧑‍🎓 Ссылка с прошедшего митапа по ML, который был 16 февраля. Приятного просмотра! https://youtu.be/XyfIE77JQzU

🔤🔤 🔤 🔤🔤 1️⃣🔤 Всем привет, выпускаю пилотный пост своего погружения в Machine Learning и Deep Learning. В целом, пока идёт всё нормально, смотрю про линал. Вопрос к тем, кто знает, зачем нужен линал в ML и DL, если мы все равно засовываем матрицы фич в модель, пытаясь добиться высоких показателей метрик качества? Или это нам нужно для того, чтобы понимать, как все работает под капотом? Что посмотрел? 🧑‍🎓 Теория вероятностей и статистика 🧮 Линейная алгебра (вектора и матрицы) 💻 ООП в Python, повторение синтаксиса с либами 💻 Рассмотрел KNN задачу классификации, линейную и логистическую регрессию 😱 Transform, Scalers 😨 Я также продолжаю решать алгоритмы для структуризации действий Прохожу курс ИИ Старт на Stepik от МФТИ и Deep Learning от МФТИ также, пользуюсь стандартной документацией под библиотеки (sklearn, pandas, numpy) 😇 Расскажите, как практикуетесь вы? Ставьте реакции, если такой формат вам нравится

🚗 Спринт Machine learning и Deep Learning или как не сойти с ума 😅 Всем привет, пока что я готовлюсь по алгосам в 😀, параллельно просматриваю материалы по ML и DL с нуля. Хочу пройти этот путь и создать своего чат жпт, конечно же. 🤔 Как вообще я это вижу? Беру курс, читаю статейки, делюсь с вами и вместе мы идём к изучению сложных направлений. Например, посмотрел линал, нашёл интересные конструкции на 👩‍💻, поделился с вами, Поучаствовал в соревнованиях, поделился своим видением и т.д. Предлагаю выкладывать результаты каждую неделю, чтобы можно было более корректно отследить что-то новое. 😇 Пишите свои идеи по такому формату, поддержите реакциями если интересно будет посмотреть реалити-шоу с манагером из РАНХиГС (мой бекграунд, да-да)