uz
Feedback
DataFrog: Data Science

DataFrog: Data Science

Kanalga Telegram’da o‘tish

Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks Мы отбираем самые лучшие посты на тему DS и ML из других телеграм каналов и сайтов и публикуем у себя. @viktorreh

Ko'proq ko'rsatish
2 379
Obunachilar
Ma'lumot yo'q24 soatlar
-97 kunlar
-5330 kunlar
Postlar arxiv
Любители красивой математики, вам посвящается: (1 + 2 + 3 + 4 + 5 + 6 + 7 + 8 + 9)² = 2025 1³+ 2³+ 3³+ 4³+ 5³+ 6³+ 7³+ 8³+ 9³
Любители красивой математики, вам посвящается: (1 + 2 + 3 + 4 + 5 + 6 + 7 + 8 + 9)² = 2025 1³+ 2³+ 3³+ 4³+ 5³+ 6³+ 7³+ 8³+ 9³ = 2025 (20 + 25)² = 2025 2025/ (2 + 0 + 2 + 5) = 225 А еще если сложить первые (20+25) нечетных чисел, тоже получится 2025 С Новым Годом, что-ли 🎄

Gradient Accumulation Из-за ограничений памяти всегда рекомендуется обучать нейронную сеть с небольшим размером батча. Но что
+5
Gradient Accumulation Из-за ограничений памяти всегда рекомендуется обучать нейронную сеть с небольшим размером батча. Но что, если мы скажем вам, что можно увеличить размер батча без увеличения размера батча? 👉 DataFrog | #datascience

А вы тоже все еще выбираете направление для своей карьеры в 2025 году? 🙄 Маркетинг или программирование? 🙄 Логистика или фи
А вы тоже все еще выбираете направление для своей карьеры в 2025 году? 🙄 Маркетинг или программирование? 🙄 Логистика или финансы? 🙄 … или аналитика? 2024 год показал: аналитика — профессия будущего. Принимать решения на коленке больше никто не хочет, даже в условиях турбулентности. Темп роста рынка — более 30% в год! Джуны со знанием SQL, Python и BI-систем получают от 100 000 рублей, а уверенные мидлы — более 250 000. Кстати, аналитика – тоже IT-профессия. Итого, если при виде зарплат в аналитике у вас загораются глаза, то мы поможем определиться с направлением, которое вам точно подойдет! 🔮 Предлагаем вам пройти бесплатный тест на профориентацию, он займет всего 3 минуты и сразу выдаст результаты. Представляйте себя на месте любимых киногероев, отвечайте на вопросы и узнайте, какой вы аналитик! 🧚‍♀️ Кстати, в конце теста вас ждет промокод на скидку до 30 000 рублей на обучение аналитике в школе Changellenge >> Education, чтобы начать погружаться в любимое направление было еще приятнее! Пройдите бесплатный тест до 15 декабря и узнайте, какой вы аналитик 🪄 Пройти тест »

Там Anthropic предложили новую технику для RAG. Разбираемся: Как работает обычный RAG: 1. Документы в корпусе разбиваются на
Там Anthropic предложили новую технику для RAG. Разбираемся: Как работает обычный RAG: 1. Документы в корпусе разбиваются на чанки 2. Из каждого такого чанка мы достаем эмбеддинг и кладем его в векторную БД 3. Когда поступает запрос (промпт), мы ищем в этой БД семантически близкие к нему чанки и добавляем их в промпт, чтобы модель могла использовать эту информацию для ответа В чем тут проблема? Дело в том, что таким образом мы можем упустить важный контекст и детали запроса. Например, пользователь запрашивает "Error code TS-999". Поиск найдет информацию про коды ошибок в целом, но может упустить точное совпадение «TS-999». К тому же, при возвращении конкретного чанка из базы может случится так, что он будет вырван из какого-то важного контекста, и это может помешать модели. Что предлагают Anthropic? Во-первых, они предлагают извлекать не только обычные эмбеддинги, но и делать TF-IDF энкодинг чанков с помощью BM25. TF-IDF утроен так, чтобы как раз отбрасывать наиболее "общие" вещи в тексте, и фокусироваться на редких и самых важных словах. Это поможет не упускать детали при поиске, как в примере с ошибкой TS-999. Во-вторых, чтобы избавиться от проблемы отсутствия контекста, они предлагают этот контекст добавлять искусственно (то есть делать из такого: "Прибыль росла на 3%." ... такое: "Этот чанк относится к отчету компании ACME за Q2 2023; прибыль росла на 3%."). Для этого перед извлечением эмбеддингов и TF-IDF энкодингом каждый чанк аннотируется с помощью отдельного запроса к модели (в случае Anthropic это делается с помощью Клода). Да, дорого. Но с помощью фишки Prompt Caching, которую недавно завезли в API, можно хорошо скостить цену. В итоге все это дает достаточно ощутимый прирост к метрикам качества поиска. Например, фактических ошибок становится меньше на 35%, а это ничего себе! 👉 DataFrog | #datascience

Еще некоторые детали про o1 aka Strawberry aka Q* ➡️ Сейчас на юзерах с подписков крутится не сама o1, а ее preview версия. Т
Еще некоторые детали про o1 aka Strawberry aka Q* ➡️ Сейчас на юзерах с подписков крутится не сама o1, а ее preview версия. Также для ChatGPT Plus будет доступна модель o1-mini (более дешевая и шустрая). o1-mini также обещают раскатить и для бесплатных аккаунтов. ➡️ Даже несмотря на то, что самой o1 пока на проде нет, лимиты в чате и цены в API уже достаточно жестокие: 30 сообщений в неделю для o1-preview, 50 для o1-mini 😳. В API вообще песня: 20 запросов в минуту, и при этом платить придется не только за коллы, но и за сами размышления модели (reasoning tokens). ➡️ Саму o1 тоже обещают раскатить скоро. Она уже дообучена и протестирована, но, видимо, OpenAI все еще приходится решать вопросы связанные с затратами на ее инференс, и (может быть) безопасностью. ➡️ OpenAI обращают внимание на то, что промптинг с новой моделью отличается от промптинга со старыми. Они даже выкатили свой гайд с советами о том, как правильно общаться с o1. Основная мысль сводится к «Больше не надо уловок вроде "думай шаг за шагом" или "построй план решения". Формулируйте свои инструкции ясно и прямолинейно, а дальше модель все сделает сама.» ➡️Ну и напоследок то, на что могло ускользнуть от глаз: OpenAI решили скрыть от пользователей мыслительный процесс модели. То есть те рассуждения, которые видны в чате – это выборочный материал. Остальные необработанные цепочки мыслей пользователям не видны. 🍓🍓🍓 👉 DataFrog | #datascience

Приглашаем на Яндекс Analytics after dark — камерный митап для аналитиков В конце ноября Еком и Райдтех Яндекса проводит ламп
Приглашаем на Яндекс Analytics after dark — камерный митап для аналитиков В конце ноября Еком и Райдтех Яндекса проводит ламповый митап — участники и спикеры поговорят об успехах, провалах и сложностях в работе над сервисами с многомиллионной аудиторией. Митап начнется с докладов-историй об успехах в аналитике: Аня Хрущева расскажет о персонализации пушей на всех этапах жизни пользователей на примере Яндекс Маркета. Катя Меркушева объяснит, как в Лавке анализируют ассортимент и как может помочь Customer Decision Tree. Вечер продолжится стендапами о факапах, активностями на afterparty и нетворкингом в неформальной атмосфере. • 29 ноября, 18:00 • Москва, только офлайн Регистрируйтесь и зовите коллег! Обратите внимание, количество мест ограничено. После регистрации обязательно дождитесь подтверждения заявки. Реклама. ООО «Яндекс.Такси» ИНН 7704340310

Что такое аугментация данных? Это один из методов регуляризации нейронных сетей через внесение изменений в данные. То есть, е
+1
Что такое аугментация данных? Это один из методов регуляризации нейронных сетей через внесение изменений в данные. То есть, если мы внесем небольшие адекватные изменения в данных, мы можем спасти нейросеть от переобучения и увеличить ее обобщающую способность. Но почему это работает? Разбираемся на попугаях. Бонусом оставляем отличную библиотеку, позволяющую производить аугментацию изображений. 👉 DataFrog | #datascience

❓Как научиться извлекать максимальную пользу из данных? Приходите на курс "Основы Data Governance" с Александром Бараковым от
Как научиться извлекать максимальную пользу из данных? Приходите на курс "Основы Data Governance" с Александром Бараковым от BI Consult и получите актуальные навыки в трендовой теме управления данными! Data Governance позволит вам навести порядок в данных, ускорить разработку в ИТ-системах, повысить надежность и качество данных, аналитики и отчетности. 📆Даты: 4-13 декабря 2024 года. Формат курса: 5 встреч по 3 часа интенсива в онлайн формате для CDO, CIO, Data stewards, BI-менеджеров, Операционных директоров и всех кому тема близка. Автор курса: Александр Бараков - эксперт с 10-летним опытом ведения Data Governance проектов. Курс позволит сформировать глубокое понимание темы Data Governance и 'примерить' все это на бизнес реалии вашей организации. По итогам курса у каждого слушателя будет сформирована готовая стратегия по внедрению Data Governance в свою компанию и понимание того, как настроить управление данными в любом бизнесе. 🗂На курсе мы погрузимся в темы: • Information Management (IM) • Data Quality (DQ) • Data Governance (DG) (основные элементы, технологии и практики) • Master Data Management (MDM) • Управление и оценка эффективности DG Каждый участник будет заполнять excel-гайд своего проекта Data Governance, применяя разделы курса на контекст своей компании. 📌Почему стоит выбрать этот курс?Сильная база: Вы поймете почему данные - это важно, в чем их реальная ценность и как 'продавать' проект менеджменту. • Практическая направленность: Курс включает реальные кейсы и задачи из бизнеса. • Нетворкинг: Участвуйте в активном обмене опытом с другими участниками курса и расширьте свою профессиональную сеть. На нашем курсе обучаются CDO и CIO таких компаний, как Максидом, Сбербанк, ВК, Sunlight и KFC. 🔝Записаться на курс

Там на Kaggle завезли новые ачивки 😇 Появились значки за активности под названием Badged (например, год на Kaggle, засабмити
Там на Kaggle завезли новые ачивки 😇 Появились значки за активности под названием Badged (например, год на Kaggle, засабмитил в командное соревнование, создал Python ноутбук и прочее). Полный список тут. Кроме этого появились так называемые Awards: это больше про фактические достижения типа мест в рейтингах, организации соревнований, публикации датасета и тд. Полный список тут. Делитесь, кто сколько уже насчитал у себя? 👉 DataFrog | #datascience

В Твиттере завирусилось исследование 1978 года о том, что врачи якобы не могут решить простую статистическую задачу Она звучи
В Твиттере завирусилось исследование 1978 года о том, что врачи якобы не могут решить простую статистическую задачу Она звучит так: "Если тест на выявление заболевания, распространенность которого составляет 1 из 1000, имеет false positive rate в 5%, какова вероятность того, что человек с положительным результатом на самом деле болен?". Утверждается, что верный ответ – 2% (Из 1000 будет 1 больной и 50 человек с ложноположительным тестом -> 1/51 ~ 2%). Тот же ответ получается по теореме Байеса. Однако так ответили только 2/10 медиков. Остальные давали ответ "95%", аргументируя это примерно так: "В задаче рассматривается не случайный человек из выборки, а только тот, который уже получил положительный результат теста. В таком случае, раз false positive rate = 5%, то вероятность наличия заболевания получается 95%". Кстати, подобное исследование проводилось еще один раз в 2014 году. Вопрос задавали уже другой: "Представьте себе гипотетического бейсболиста. Он проваливает тест на наркотики, который точен на 95 процентов. Какова вероятность того, что бейсболист действительно виновен?". И опять верный ответ дали только 14 из 61 опрошенных. А вы бы как ответили? 👉 DataFrog | #datascience

Liquid AI представили новое семейство моделей с оригальной архитектурой: они выбивают SOTA метрики в своих классах Самое инте
Liquid AI представили новое семейство моделей с оригальной архитектурой: они выбивают SOTA метрики в своих классах Самое интересное: это НЕ трансформеры, а так называемые ликвидные сети. Ликвидными (то есть жидкими) их называют потому, что, в отличие от обычных нейросетей, где веса – это просто числа, в ликвидных моделях веса вообще может не быть: здесь обмен сигналами между нейронами — вероятностный процесс, управляемый нелинейной функцией. Такие подходят для моделирования любых последовательных данных, включая видео, аудио, текст, временные ряды и сигналы. Всего доступно три модели: 1.3B, 3.1B, 40.3B MoE. Все они, судя по бенчмаркам в релизе, показывают себя очень неплохо, особенно на математике и длинном контексте. На схеме наверху – метрики по MMLU, а более детально можно посмотреть здесь. Если все действительно так, как представлено, то перед нами очень многообещающая альтернатива трансформерам (спойлер: r в "Strawberry" все равно посчитать не может). Еще одна хорошая новость: модели уже можно попробовать. Они доступны в Liquid Playground и Perplexity Labs. P.S. Если хотите почитать про архитуктуру подробнее, то вам сюда. По этой ссылке ресерчеры Liquid AI оставили упорядоченную подборку статей (собственных и не только) о том, как развивались ликвидные нейросети. 👉 DataFrog | #datascience

Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали: ➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели. ➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений. ➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей. ➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше. ➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения. 👉 DataFrog | #datascience

Как работает ML в Авито: интервью с руководителями ведущих команд Авито – это не просто доска объявлений. Почти во все процес
+8
Как работает ML в Авито: интервью с руководителями ведущих команд Авито – это не просто доска объявлений. Почти во все процессы компании вшит ИИ. Модерация, рексис, автоматизация написания объявлений и ответов поддержки, эффективность монетизации... Чтобы приоткрыть для вас капот этих процессов, мы поговорили с руководителями нескольких ведущих команд и написали статью. В ней вы найдете подробный технический рассказ о том, как в Авито работают LLM, рекомендации и алгоритмы продвижения объявлений. Полезно и интересно будет всем, и новичкам, и опытным инженерам. Сохраняйте и читайте: https://datasecrets.ru/articles/15 👉 DataFrog | #datascience

⚙️ Нужно ли высшее образование в ML? Отвечает руководитель машинного обучения ОК, AI VK – Андрей Кузнецов Андрей – яркий пред
+5
⚙️ Нужно ли высшее образование в ML? Отвечает руководитель машинного обучения ОК, AI VK – Андрей Кузнецов Андрей – яркий представитель сразу двух миров: индустрии и академии. Он кандидат технических наук, преподаватель ИТМО и руководитель ML в Одноклассниках. В VK Андрей пришел в 2019 году,а в 2023-м стал управлять разработкой всех ML-систем ОК (их ML-канал: @mlvok). Мы спросили у него, какое место высшее образование занимает в ML. Нужно ли его получать? Повышает ли диплом шансы на оффер? Зачем действительно нужно учить математику и учиться вообще? Ответы – в карточках. А если хотите поработать у Андрея в команде, то скорее переходите на наш сайт: там мы уже оставили подходящие вакансии. 👉 DataFrog | #datascience

🚀 OpenAI выпустили Canvas – надстройку над ChatGPT для работы с кодом и текстом По дизайну Canvas походит на Anthropic Artefacts: это отдельное окно рядом с чатом. Инструмент предназначен для задач, где нужно много править или пересматривать один и тот же проект. Он, в отличие от чата, будет лучше запоминать контекст + работать над конкретными разделами. Например, при работе с текстом он может предложить правки конкретных кусочков, отредактирует длину, тон повествования или грамматику. Но самое интересное – это, конечно же, код. Canvas просто идеально подходит для программирования: — исправление багов — код-ревью — добавить комментарии — перевести на любой другой ЯП — добавить логи В общем, мини VSCode прямо в чате на основе GPT-4o. И уже раскатили на Plus и Team! 👉 DataFrog | #datascience

Tesla показала нового робота Optimus В целом, изменилось мало что: роботы все так же ходят, машут, танцуют. Единственное: в этот раз некоторых из них еще поставили в качестве барменов за стойку, но о том, что при этом они управляются людьми, опять тактично умолчали... В продажу обещают к 2027 году (чему, зная Маска, не очень-то стоит верить). Роботы будут стоит 20-30 тысяч долларов и смогут справляться со всеми бытовыми задачами, интегрируясь с системами умного дома. 👉 DataFrog | #datascience

Что делать с НЕнормальным распределением? Как известно, моделям (особенно линейным) нравится, когда данные имеют нормальное р
+4
Что делать с НЕнормальным распределением? Как известно, моделям (особенно линейным) нравится, когда данные имеют нормальное распределение. Но что делать, если это не так? Рассказываем про два варианта: простой и посложнее. #train #analytics #python

👀Хотите освоить инструменты для построения и применения моделей машинного обучения на больших наборах данных? Ждем вас на от
👀Хотите освоить инструменты для построения и применения моделей машинного обучения на больших наборах данных? Ждем вас на открытом вебинаре 8 октября в 20:00 мск, где мы разберем: - обзор возможностей Spark; - как разрабатывать модели на Spark ML; - как выводить модели в промышленное использование. Урок для инженеров данных, ML-инженеров и Data Scientist'ов. Спикер Вадим Заигрин — опытный разработчик, Data Engineer и Data Scientist. Team Lead команд инженеров данных на разных проектах. Встречаемся в преддверии старта курса «Spark Developer». Все участники вебинара получат специальную цену на обучение! ▶️Регистрируйтесь прямо сейчас, чтобы не пропустить мероприятие: https://vk.cc/cC4TON Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru

Еще одна мотивирующая биография в вашу коллекцию: Эндрю Ын Просто основатель Coursera, DeepLearningAI, Google Brain и большой
+4
Еще одна мотивирующая биография в вашу коллекцию: Эндрю Ын Просто основатель Coursera, DeepLearningAI, Google Brain и большой любитель кошек.

Группа «Интер РАО» запустила ТурбоХакатон по обработке данных в сфере электроэнергетики. Участвуйте в соревновании с 10 октяб
Группа «Интер РАО» запустила ТурбоХакатон по обработке данных в сфере электроэнергетики. Участвуйте в соревновании с 10 октября по 26 ноября и получите шанс разделить призовой фонд в 500 000 рублей. Регистрация уже открыта Приглашаем на хакатон специалистов в области Data Science и Machine Learning от 18 лет. Участвовать можно индивидуально или в команде до 5 человек. На соревновании вас ждет: 🔸 Решение задач, основанных на реальных датасетах Группы «Интер РАО». 🔸 Менторство от ведущих экспертов отрасли, готовых поделиться своими знаниями. 🔸 Возможность получить предложение о работе в Группе «Интер РАО». 🔸 Авторы лучших проектов смогут запустить свои решения на суперкомпьютере Питерского политехнического университета Петра Великого. Задачи ТурбоХакатона: 1️⃣ Цифровой ассистент – система «вопрос\ответ» для быстрого поиска ответов во внутренней документации компании через вопросы, заданные в свободной форме 2️⃣ Система рекомендации технологических параметров для оптимизации режимов работы ТЭС 3️⃣ Анализ аномалий в платежах за тепловую энергию 4️⃣ Оптимизация маршрутов обхода многоквартирных домов для проверки состояния приборов учета и контроля достоверности показаний 5️⃣ Оптимизация процесса планирования закупки топлива на электростанциях на основе прогнозирования цены электричества и объемов его выработки Расписание мероприятия: 🔹 08.10 – старт ТурбоХакатона и открытие задач; 🔹 10.10-04.11 – работа над задачей; 🔹 08.11-12.11 – отбор лучших решений для участия в финальном питчинге; 🔹 19.11 – итоговая питч-сессия и презентация решений для жюри ТурбоХакатона; 🔹 26.11 – объявление результатов и награждение победителей. Успейте подать заявку до 4 октября