en
Feedback
Градиентное погружение

Градиентное погружение

Open in Telegram

Обсуждаем новости, рассказываем про ML с кодом и колабом, выигрываем соревы 🏆 Контакты: @Cucu_LaPraline, @Cene655

Show more
The country is not specifiedTechnologies & Applications21 231
4 492
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Repost from Dealer.AI
Self-supervised learning book. Ну, что, други. Прошли сутки, пора выдыхать и тянуть нашу DS'ную лямку дальше. Работку работать. Поэтому я со свежими новостями. Тут давече, Мета, выпустила на arxiv книжку по самообучению. ;) Напомню, что мой любимый metric-learning, contrastive learning и обучение LM'ок в тч сводится к self-supervised. Поэтому берём на вооружение книженцию, я уже посмотрел чутка. Точно будет полезно, особенно есть как математические выкладки, так и полезные usefull хинты для практики. Налетай!

Tweets for Stocks Вы наверняка слышали о том, как сообщения известных личностей могут повлиять на цены акций. Нашел проект, в
Tweets for Stocks Вы наверняка слышали о том, как сообщения известных личностей могут повлиять на цены акций. Нашел проект, в котором решили проверить существует ли зависимость между твитами и изменением цен на акции. Для этого они использовали несколько моделей, включая catboost, tr roberta и naive bayes. Наилучший результат на классификации (повышение/понижение цены) составил 0,58. @data_morning В репозитории есть все ноутбуки. Страница проекта

Ограничения искусственного интеллекта OpenAI считают (и заявляли в дискуссиях с правительствами), что запуск процесса тренировки подобных моделей должен сопровождаться сообщением о нём государству и/или регулятору. [2023] Если вы думаете, что только сейчас начали стандартизировать искусственный интеллект, то вы сильно ошибаетесь. Вот пример: The AI Methods, Capabilities and Criticality Grid [2021] Документ, который описывает возможное применение искусственного интеллекта в бизнесе и его последствия. Это своего рода переводчик с языка программистов на язык бизнеса, который поможет понять, что можно ожидать от разработки и какие преимущества она может принести. Несколько других интересных событий: ИИ системы могут получать патенты в соответствии с австралийским патентным законодательством [2021] Апелляционный суд США окончательно разрешил собирать публичные данные в Интернете [2022] @data_morning Также стоит упомянуть историю с Copilot, где разработчики жаловались на то, что модель просто повторяет их код без изменений. Новости об этом были актуальны недавно, но последний апдейт по этой теме был 4 ноября 2022.

💡 Metric Learning (Туториалы в конце) 👉 Одно из направлений в глубоком обучении, которое нацелено на качественное кодирование модальностей. ☝️Активно применяется в задачах ранжирования, поиска, детектирования выбросов и кластеризации. 📎 Отличается от классического подхода к обучению тем, что наша главная задача - минимизировать расстояние между векторами похожих объектов основываясь на деталях, семантике. Выделяют 2 основных подхода к обучению: 1️⃣ Контролируемое - мы хотим создать границу между классами, учитывать расстояние до ближайшей границы другого класса и объектами внутри классов. 2️⃣ Обучение без учителя - нелинейная техника для понижения размерности c сохранением структуры данных. Может быть интересно: Active Metric Learning - алгоритм сам решает, на чем лучше обучаться и экономит ресурсы пользователя. Laplacian Eigenmaps - метод понижения размерности для сохранения локальной геометрии объектов (ближайшие объекты остаются близкими). @memorial_edition Metric Learning Tutorial [Parag Jain] Практический Metric learning sklearn-metric-learn

Repost from Complete AI
🔥Мы тут подсчитали - на текущий момент (10.04.2023) модель Kandinsky 2.1 собрала 2 млн. уникальных пользователей и создала больше 10 млн. изображений. Это наш самый масштабный и результативный проект🚀 My Sber AI Team - one love🙏❤️ @complete_ai

Repost from NLP Core Team
Новая SOTA модель для русского языка FRED-T5 доступна на HuggingFace. 🚀🚀🚀 FRED-T5-1.7B FRED-T5-large (820M) Модель 1.7B показала лучший скор на RussianSuperGLUE и на текущий момент является SOTA для русского языка. FRED-T5 основана на базе архитектуры T5. Изначально мы целились в ПРОМопригодность модели при выборе архитектуры. Мы использовали bbpe токенайзер от ruGPT3 (до large размера). Модель обучалась на миксе денойзеров. Денойзеры похожие, как в пейпере UL2. Если не слышали про UL2, то можно тут прочитать. Мы использовали равномерное распределение в задачах span corruption при выборе длины спана. И у нас было 7 денойзеров на каждый вариант семплирования (в UL2 было 3). Модель первую часть тренировки обучалась на 3.5Gb данных (чуть больше 1% от всего сета 300Gb). После она была дообучена на всем сете. Всего модель видела 1.5T токенов. Вот такие денойзеры: ‘<LM>’:(µ = L/4, r = 0.25) ‘<SC1>’:(µ = 3, r = 0.15) ‘<SC2>’:(µ = 8, r = 0.15) <SC3>’:(µ = 64, r = 0.15) ‘<SC4>’:(µ = 3, r = 0.5) ‘<SC5>’:(µ = 8, r = 0.5) ‘<SC6>’:(µ = 64, r = 0.5) µ — это средняя длина спана в токенах, а r— это доля удаленных токенов Ничего не поняли?) Через пару дней выйдет наша статья на Хабре, где мы расскажем детали. Как можно юзать модель? Берем токенизатор GPT2 и модель T5 из HF. tokenizer = GPT2Tokenizer.from_pretrained('ai-forever/FRED-T5-1.7B',eos_token='</s>') model = T5ForConditionalGeneration.from_pretrained(('ai-forever/FRED-T5-1.7B') Не забывайте руками добавлять ‘</s>’ если он нужен вам. GPT2Tokenizer не делает это по умолчанию. Советы по файнтюну. При файнтюне модели можно использовать префиксы денойзеров, которые использовались при обучении ‘<LM>’, ‘<SC1>’,...’<SC6>’. Добавляете в начале текста, подаваемого на энкодер. Если задача LM, то лучше использовать префикс ‘<LM>’, в остальных случаях можно без префикса. При файнтюне на RSG мы не увидели значимых различий в предиктах в зависимости от префикса и без его использования. Если ваша задача похожа на одну из задач денойзинга, то конечно стоит попробовать взять соответствующий префикс. Мы часто при файнтюне используем оптимизатор Adafactor c постоянным lr=0.001. Он чаще дает лучшие результаты чем AdamW.

Кандинский 2.1 на 4 месте в Github trending!

Обсуждать генерации кандинского можно здесь https://t.me/betterdatacommunity/13731

Repost from Complete AI
🚀Kandinsky 2.1🚀 Наступил день, которого ждала вся команда (вовсе не тот, который стал всплывать в разных каналах на прошлой неделе😂). Сегодня мы официально выпускаем новую лучшую версию нашей диффузионной генеративной модели, которая претерпела существенные изменения относительно предшественницы 2.0. Отличительные особенности включают: 📌3.3B параметров 📌Разрешение генераций - 768x768 📌Image prior трансформер 📌Новый автоэнкодер изображений MoVQ 📌Дообучение на очень чистом сете из 172M пар «текст-изображение» 📌Режимы работы: генерация по тексту, смешивание изображение, генерация изображений по образцу, изменение изображений по тексту, inpainting/outpainting Всё это позволило добиться впечатляющего качества на различных доменах генераций. FID на датасете COCO_30k достигает значения 8.21🔥 По публичным данным на сегодняшний день лучше только eDiffI (NVidia) и Imagen (Google Reseacrh). Детально о модели можно прочитать в статье на Хабре, а протестировать Kandinsky 2.1 можно тут: 📍Телеграм-бот 📍FusionBrain.AI 📍GitHub 📍HuggingFace 📍rudalle.ru 📍MLSpace Спасибо всей команде за слаженную и качественную работу - испытываю несказанное признание каждому🔥 @complete_ai

🕊Twitter Recommendation Algorithm #Twitter disclosed the sources of its recommendation engine. GitHub: https://github.com/tw
🕊Twitter Recommendation Algorithm #Twitter disclosed the sources of its recommendation engine. GitHub: https://github.com/twitter/the-algorithm Blog post: https://blog.twitter.com/engineering/en_us/topics/open-source/2023/twitter-recommendation-algorithm #recommenders #recsys #recommendation

Repost from Reliable ML
Проблема оценки финансовых эффектов от дата-команд стала критичной Gartner Data & Analytics Conference 2023 - Review В мире прекрасного будущего ИИ все только и говорят, что об ошеломительных эффектах от анализа данных и вообще деятельности дата-команд. А видели ли вы в реальности эти эффекты: конкретные потоки денег как результат внедрения проектов по анализу данных? Знаем, что многие сейчас задумаются. Ответ неоднозначен. Вот и Gartner на своей ведущей конференции по Data & Analytics в этом году задумались о проблеме оценки эффектов от дата-команд. Согласно их исследованию, начиная с 1975 г. неуклонно снижается доля компаний, которые измеряют конкретный финансовый эффект от проектов по анализу данных (рост выручки, снижение издержек, рост производительности и снижение рисков). Уже в 2020 г. более 90% инвестиций в данные (против 17% в 1975 г.) обосновывалось так называемыми стратегическими целями: созданием инноваций, данных как актива, веса бренда. Такой вот интересный тренд. И дальше можно много рассуждать о том, как и почему мы к этому пришли и что же будет дальше на фоне сгущающихся туч в мировой макроэкономической конъюнктуре. Позвольте и нам поделиться своими мыслями. О том, почему сформировался тренд - Светлая сторона - погоня за конкурентным преимуществом. Обосновывать эффект от анализа данных стратегическими целями во многих случаях вполне нормально. Развитие отрасли за последние годы стало очевидно уже, кажется, всем: ChatGPT здесь делает контрольный выстрел последним сомневающимся. В момент прорыва ни одна компания, которая хочет выжить, не хочет остаться в числе безнадежно отстающих, а значит, проигравших. - Темная сторона - реальные сложности с оценкой эффекта дата-команд. Обосновывать эффект стратегическими целями иногда приходится вынужденно, когда не вкладываешься в понимание того, какие реальные финансовые эффекты могут принести инвестиции в данные и как это можно измерять. Множество компаний вкладывают колоссальные деньги в проекты по улучшению бизнес-процессов на основе данных, но при этом экономят на создании методологии оценки эффектов от этих проектов (АБ-тестирование, пост-инвест анализ дата-проектов, и др.). С каждым новым проектом такие компании всё сильнее увязают в ловушке неопределенности - для них растет риск итогового банкротства всей активности по работе с данными, или чрезмерного раздувания штата дата-команды без понимания успешности их деятельности. При этом на нашей практике внедрение подобных методологий - всегда в итоге было сопряжено с наибольшими среди всех дата-проектов эффектами. Поскольку отсеивать миллиарды лишних инвестиций на старте или при пилотировании, как правило, довольно ценно 🙂 Что будет дальше - Темная сторона - рост уязвимости дата-команд в условиях сложной макроэкономической ситуации на мировых рынках. Если 90% эффектов работы каких-то типов команд нельзя “пощупать руками”, поскольку они где-то в прекрасном будущем, при усилении экономического кризиса именно такие команды первыми попадают под удар. К сожалению, начало этого тренда во многом подтвердилось 2022м годом и рядом масштабных lay-offs в крупных компаниях (тут даже ссылки приводить не будем, всё на слуху). - Светлая сторона - повышение интереса к оценкам реального финансового эффекта. На фоне всего вышеперечисленного мы ожидаем, что в 2024-2025 гг. возникнет перелом тренда - больше инвестиций будут обосновываться реальным финансовым эффектом. А это будет означать рост интереса к методикам типа Reliable ML: к тому, как организовать работу дата-команд, чтобы эффект от их деятельности был измеримым и финансово положительным. Для этого нужно думать про: ML System Design (чтобы не попасть в заведомо неприбыльные или нереализуемые проекты), Causal Inference (чтобы не попасть в ловушку ложных закономерностей), и АБ-тестирование (чтобы корректно понять, принесет ли ваш прототип деньги при масштабировании). Ваш @Reliable ML

🧹 Автоматическая чистка данных Cleanlab и CleanVision - это два мощных инструмента для автоматической чистки датасетов. Clea
🧹 Автоматическая чистка данных Cleanlab и CleanVision - это два мощных инструмента для автоматической чистки датасетов. Cleanlab - инструмент способный находить в наборах проблемные метки используя популярные фреймворки (torch, hf, sk-learn) и такие модальности как текст, изображения, табличные данные и звук. CleanVision - позволяет находить копии и пересветы изображений, а также другие артефакты в датасетах компьютерного зрения. Я попробовал второй инструмент во время участия в соревновании по классификации. Пара строк кода помогла мне найти и визуализировать проблемные места за 20 минут на датасете из 80к картинок. CleanVision Cleanlab Демонстрация label issue ImageNet

Поддержим опенсурс, тут делается важная штука - открытая русскоязычная инструктивная модель, ребята нагенерили через gpt инструкцй и теперь просят вашей помощи в фильтрации! Вот небольшая инструкцич по использованию: Когда задание можно считать плохим: - Из него непонятно, что нужно делать. - Оно невыполнимо языковой моделью. Например, описание несуществующей картинки. - Задание и вход не согласуются. Например, задание предполагает предложение на русском, а подаётся предложение на английском. Если задание написано просто неграмотным русским языком, но из него ясно, что нужно делать - это ок. Когда ответ можно считать плохим: - Когда ответ некорректный или неполный. - Когда модель в ответ на личные вопросы притворяется человеком. Например, говорит, что она вчера была в Париже. - Когда ответ написан неграмотно. Бот где размечать: @InstructAnnotBot Уже готовый грязный сет: https://huggingface.co/datasets/IlyaGusev/ru_turbo_alpaca

YTsaurus Яндекс выпустил в открытый доступ «Вайтизавр» - платформу распределённого хранения и обработки больших данных с откр
YTsaurus Яндекс выпустил в открытый доступ «Вайтизавр» - платформу распределённого хранения и обработки больших данных с открытым исходным кодом, которую они делали почти 10 лет. Вычислительный кластер YTsaurus способен: -> хранить эксабайты данных -> использовать HDD, SSD и RAM для хранения данных -> обрабатывать данные на сотнях тысяч Hyper Threading ядер -> решать задачи машинного обучения на тысячах GPU -> хранить и обрабатывать данные десятков тысяч пользователей Топовые кейсы: — Показ рекламы — Обучение моделей на суперкомпьютерах — Построение поискового индекса — Построение хранилища данных Github | Сайт

Repost from DL in NLP
PyTorch 2.0 release Блог Github release notes Сегодня pytorch 2.0 вышел с nightly на релиз. Вот его новые фичи, часть всё ещё
+2
PyTorch 2.0 release Блог Github release notes Сегодня pytorch 2.0 вышел с nightly на релиз. Вот его новые фичи, часть всё ещё в бете: 1. Полная backward compatibility и никаких серьёзных изменений стандарнтых API типа torch.nn — всё ещё наш любимый торч 1. Быстрее чем 1.X благодаря тому что куски переписали на Triton и C++ 1. Accelerated Transformers (i.e. Better Transformers) — фичи для быстрого и эффективного exact attention, такие как Flash attention. 1. Лучшая поддержка MPS на MacOS и оптимизации для AWS Graviton3 1. Jax-like torch.func Главная фича: torch.compile, который заменяет старые torchscript и jit. Обещает быть более user-friendly. Но по-настоящему самая главная фича (потому что её я написал) это что __repr__ ModuleList теперь выглядит компактно когда модули повторяются.

Kandinsky 2.1
+9
Kandinsky 2.1

Repost from Complete AI
🔥Не перестаю гордиться нашей командой, которая заряжена строить крутые решения с горящими глазами и испытывать восхищение от
+5
🔥Не перестаю гордиться нашей командой, которая заряжена строить крутые решения с горящими глазами и испытывать восхищение от получающихся результатов. Продолжаем подогревать Kandinsky 2.1😊 🤫Скоро раскроем подробности!

Если вы сми - журналист - блогер - инфлюнсер и хотите получить early access - пишите в личку @alexwortega

💃Уже скоро будет релиз модели Kandinsky 2.1! Мы в Sber AI скоро представим новую диффузионную модель, которая генерирует кар
+9
💃Уже скоро будет релиз модели Kandinsky 2.1! Мы в Sber AI скоро представим новую диффузионную модель, которая генерирует картинки. Что он может: 1) Генерировать картинки по тексту🤔 2) Смешивать картинки⌛️ 3) Смешивать картинки и тексты🃏 Ждите релиз на следующей неделе, будет полный опенсурс всех весов и кода обучения)

Reverse Engineering Google Colab Искал способ сделать из колаба https proxy сервер без применения ngrok и localtunnel. Наткнулся на статью, в который парень разобрал запросы из DevTools и понял, что колаб имеет внутренний прокси, который связывает jupyter socket и виртуальную машину. Как нам сделать публичный диск, api и открыть jupyter lab из web ui? Достать вытащить id туннеля, cookie и выполнить pkill -f colab-fileshim . Подробности в статье. От себя добавлю, что решение очень костыльное и медленное. У меня скорость скачивания на yandex vm была в районе 1 мб/с. Jupyter долго грузится и способен только на чтение файлов, но не их запуск, т.к. гугл ограничил post запросы. @gradientdip Статья