Мишин Лернинг 🇺🇦🇮🇱
Open in Telegram
Субъективный канал об искусстве машинного обучения, нейронных сетях и новостях из мира искусственного интеллекта.
Show more7 965
Subscribers
No data24 hours
-77 days
-4930 days
Posts Archive
7 965
🐣 Text-2-Image для генерации векторных изображений в формате SVG надо? VectorFusion от Berkeley
Помните, недавний подход DreamFusion от Google? Они взяли Imagen и превратили его в 3D при помощи NERF. Вчера еще Meta сделала их реплику.
По сути это такой подход в дифференцируемой графике. Ее можно ведь применять и к 2D векторной графике. Создаете первичные векторные формы (по факту цветные закорючки) любого цвета и размера в любом количестве. Рендерите в растр, и похожим методом как в случае с DreamFusion! Через бекпроб к звездам, как говорится. А градиенты берутся из Stable Diffusion! Еще бы, пока что единственный актуальны Text-2-Image опенсорс!
Так что мы с вами увидим много крутых подходов в ближайшее время, благодаря тому, что кто-то все таки опенсорсит image -генеративные модели!
📄 paper
🐣 project
💐 gallery
🧸 м и ш и н л е р н и н г
7 965
🦚 Nvidia представила Magic3D — 3D по текстовому описанию!
Самое крутое в таких работа то, что для них не требуется обучать новую Text-To-3D диффузию. Для задачи вполне подходят уже обученные:
— 2B DALL-E от OpenAI
— 2B Imagen от Google
— 2B eDiff-I от Nvidia
— И конечно же готовящийся новый ?? ** от *******
Работа по своей сути является eDiff-I-ким гомологом Гугловского Imagen-овского DreamFusion.
👾 Принцип работы очень и очень простой:
Этот алгоритм я уже описывал, так что просто повторю. Это градиентный метод, основанный на Loss-функции, такой как DeepDream. По факту происходит оптимизация рандомно инициализированной 3D модельки (a Neural Radiance Field, or NeRF) через градиенты 2D диффузионных генераций.
То есть по факту, проворачивая такой трюк, не нужно иметь 3D данных вообще!
Подробнее:
1) Рандомная фигура рендерится через NERF (плотность, освещение, цвет)
2) Этот изначальный бред (так как это начало) рендерится в 2D проекцию
3) Затем к картинке подмешивают шум, и все это подается на Text2Image диффузионный Unet
4) После чего Unet предсказывает необходимый денойз
5) Затем из пересказанного денойза вычитается подмешанный шум. и ВУАЛЯ! Дальше все дифференцируемо! Можно пускать градиенты обратно на 3D-модель
📇 project
📄 paper
7 965
Repost from Denis Sexy IT 🤖
Ночью выкатили совершенно офигенную фичу для пользователей нейролава: тренировка своих моделей для арт генерации, aka Dreambooth.
Работает примерно так: вы учите ее на 20+ фотографиях объектов, или одном стиле, и после этого получаете модель где текстом можете указывать «что именно с объектом происходит и в каком он стиле».
В отличие от конкурентов, мы позволяем не только натренировать модель каждому желающему, но и использовать ее после на сайте, как и обычный арт генератор (и со всеми улучшалками что мы встроили в базовую SD).
Помимо этого, бонусом идет база промптов которые наша команда подготовила – то есть можно просто сидеть и рандомно выбирать, что понравилось.
Например – я, один раз обучив модель на 20 своих фотках, больше не нуждаюсь в новых аватарках, потому что могу теперь их производить в фабричных масштабах по тысяче в день.
Играться тут, фича платная:
https://neural.love/train-a-model
(Инструкция по ссылке)
P.S. Очень горжусь командой, параллельно обслуживать тренировки моделей, которые могут длится по часу и больше, та еще задача
7 965
🚀 Встречайте новую SOTA Text-2-Image eDiffi: Диффузионные "Эксперты" от NVIDIA
Новый Text-to-Image. В данном случае на классических диффузионных пиксельных каскадах. Модель является гибридом DALL-E от OpenAI 2 и Imagen от Google.
Модель по прежнему использует 3 каскада:
1) Text-To-64pix
2) 64pix-To-256pix
3) 256pix-to-1024pix
Но в данном случае все три модели могут брать любую комбинацию кондишенов из следующих моделей:
— T5 XXL
— CLIP Text
— CLIP Image
Это позволяет использовать сеть в режиме генерации вариаций (Привет DALL-E 2), а так же юзать легковесный CLIP вместо T5 XXL (который имхо весит неоправданно много). Вообще интересно показано, что T5 работает в связке с CLIP-L/14 Text лучше, чем просто T5. И (спойлер) это действительно так (не скажу откуда знаю).
Кроме того, сеть использует модели — Диффузионные Эксперты для разных этапов денойзинга. Тут смысл такой, если не жалко видеопамять, то можно сделать моделт под разные этапы денойза, например одну под первые 256 шагов, вторую под следующие 256 и так далее. Такие 4 модели буду работать лучше, чем одна. Но и в памяти нужно будет держать их всех.
👑 Используя все эти фишки модель
eDiffi-Config-D 9.1B (Вместе с CLIP-L/14 и T5-XXL Enc) бьет Zero-shot FID ↓ на COCO-30K 2014 valid SOTA:
GLIDE : 5B FID↓ 12.24 MakeAScene : 4B FID↓ 11.84
DALL·E 2 : 6.5BFID↓
10.39
StableD : 1.4B FID↓
8.59
Imagen : 7.9B FID↓
7.27
Parti : 20B FID↓
7.23
eDiffi D: 9.1B FID↓ 7.04Ну вот такие новости. Очень много полезных вещей попробовали, советую почитать статью. 🥑 eDiffi от NVIDIA 📇 Paper eDiffi 👾 М И Ш И Н Л Е Р Н И Н Г
7 965
Repost from Neural Shit
Там на huggingface появилось пространство с text2music
Мелодии вполне годные выходят, генерация быстрая (при условии, что нет очередей и нагрузка не большая).
А если очередь большая, то можно запустить в колабе
7 965
Repost from AI для Всех
Нейрокомпрессия звука
Сжатие является важной частью современного Интернета, поскольку оно позволяет людям легко обмениваться высококачественными фотографиями, прослушивать аудиосообщения, транслировать любимые передачи и многое другое.
Сегодня, исследователи из Мета совершили прорыв в области гиперкомпрессии аудио с помощью ИИ. Представьте себе, что вы слушаете аудиосообщение друга в районе с низким качеством связи, а оно не тормозит и не глючит.
Они создали трехкомпонентную систему и обучили ее сжимать аудиоданные до заданного размера. Затем эти данные могут быть декодированы с помощью нейронной сети.
Они добились примерно 10-кратной степени сжатия по сравнению с MP3 при 64 кбит/с без потери качества. Хотя подобные методы уже применялись для речи, они первыми применили их для стереофонического аудио с частотой дискретизации 48 кГц (т.е. качество CD), которое является стандартом для распространения музыки.
Pied Piper только что стал реальностью, более того - опенсорсной.
🦦 Блог-пост
📖 Статья
🤤 Код
7 965
Repost from Denis Sexy IT 🤖
Всем любителям нейро-музыки – тут выкатили клевую генерацию аудио в реалтайме, веса, и инстуркцию как на своих данных доучить алгоритм 🌚
Даже в LoFi умеет
Код: https://github.com/marcoppasini/musika
Онлайн демка: https://huggingface.co/spaces/marcop/musika
7 965
🛼 Microsoft представили Designer — первый профессиональный Text-to-Image инструмент основанный на DALL•E2
Представьте, “ламантины группой плещутся на закате”. Или “старый слепой китаец красиво делает свое ушу.” Добавьте artstation и 4K, Выберите шрифты и стили, создавайте открытки, постеры, иллюстрации и слайды за мгновения!
Microsoft 🛼 Designer является частью пакета Office 365! То есть он находится в одном ряду с Microsoft Word, Microsoft Excel, и обладает тесной интеграцией с PowerPoint!
А еще вдумайтесь в то, насколько громкое это название — 🛼 Designer! AI революция наступила, это уже не будущее, это уже сейчас.
И изменения ландшафта рабочих мест — лишь одно проявление этой революции. Такие инструменты как 🛼 Designer привнесут AI в массы и сделают Text-to-Image новым стандартом, новой нормой создания визуального контента.
К тому же поговаривают, что скоро в открытом доступе появится нечто на голову превосходящее DALL•E 2, не говоря уже о стебле. Так что 🛼 Designer не будет единственным таким инструментом.
🛼 Designer (уже можно оставить заявку)
🤖🎓 м и ш и н л е р н и н г
7 965
Допожемо ЗСУ! Сьогодні ця допомога особливо важлива!
🇺🇦 https://savelife.in.ua/en/donate-en/
💳 from Ukraine, from abroad, cryptocurrency
7 965
🚀 IMAGEN VIDEO — Диффузии уже не остановить!
tl;dr
Помните Make-A-Video от MetaAI? Так вот — забудьте! Команда Google Brain только что создало лучшее Text-to-Video решение!
Если вкратце, то это имагеновый гомолог далишного Make-A-Video 🤖
Ну, а если чуть подробнее:
— Text Prompt подается в T5 энкодер
— Затем Base Model (5.6B ❤️) диффузит 16 кадров 40x24 pix в скромных 3 fps
— Затем темпоральный апсемплер TSR (1.7B) делает 32 кадра 40x24pix уже в 6 fps
— И пространственный апскейлер SSR-1 (1.4B) готовит предыдущие 32 кадра в разрешении 80x48 pix, и сразу второй SSR-2 (1.2B) делает 320x192
— Затем следуют еще два стейджа временного и один каскад пространственного суперреза и в итоге мы получаем 128 кадров в разрешении 1280x768 в 24fps
Основной фишкой такого подхода является Video U-Net — архитектура, пространственные операции которого выполняются независимо
по кадрам с общими параметрами (батч X время, высота, ширина, каналы), тогда как временная операции сработают уже на всему 5D тензору (батч, время, высота, ширина, каналы).
Сделаю потом более подробный пост, а пока рекомендую всем посмотреть результаты на сайте проекта!
🚀 Imagen Video
📄 paper
🤖 мишин лернинг
7 965
❤️🔥 AudioGen: диффузионная нейросеть для генерации аудио по текстовому описанию
Очень много работы по визуальным диффузам, так что буду краток. Мета сделал то, что все мы ждали!
Как отметил Александр Шульгин, альфа-метилированные триптамины AudioGEN можно рассматривать как триптаминовые гомологи амфетамина аудиальный гомолог визуального стебеля диффузии. И действительно, Александр Шульгин тут очень точно подметил!
Дело тут именно в том, что АудиоГена не гомологичен Имагену. Работа ведется не в пространстве пикселей — звуковой волны, и не в пространстве интегрального преобразования (фурье, вейвлет), а в VAE, в данном случае RVQ*
1) Сначала аудио конвертируется при помощи VAE в латент.
2) Затем трансформер предсказывает дискретные токены RVQ, через кроссаттеншен с текстового энкодинга, которые потом превращаются обратно в звук при помощи RVQ-декодера.
📯 Примеры слушать обязательно: тут
📰 Пейпер Аудиогены
💻 код / будет тут?
🤖 м и ш и н л е р н и н г
7 965
👾 Мысли вслух про диффузионные модели
Я озвучу основную мысль из этого блог поста, а потом немного разовью ее. Мысль наивная, но все же:
Диффузионные модели — это автоэнкодеры. Особенно, если немного прищуришься.
Что еще можно сказать про диффузионные модели:
▪️Обучение скор-функции
∇x log p(x) распределения сводится к предсказанию денойзинга распределения, которое изначально зашумили
▪️В сравнении с вариационными автоэнкодерами (VAE), диффузиям не нужно делать боттлнэк
▪️На разных этапах денойзинга модель может сосредоточиться на разных задачах:
— На ранних шагах заниматься формой объектов
— На поздних прорисовывать детали
К чему я это веду? К тому "Почему Диффузии круче, чем VAE для обучения генеративок?"
1) Диффузу не нужен боттленек.
А без него намного проще обучать. Не нужно накладывать ограничения на глубину и размер, на vq-словарь и прочее, занимать репараметризацией. А в добавок можно кидать резидиулы, делая полноценный юнет. И вот это все вместе прям очень-очень упрощает сходимость!
2) Многопроходные подходы лучше однопроходных.
Однопроходные сети (VAE, GAN) должны решить задачу генерации (или проявки изобрадения) за, простите за тавтологию, один forward pass. Диффузии же делают от 50 до 4000 шагов, имея возможность постепенно переходить от генерации формы к содержанию и деталям.
#мысли
🤖 м и ш и н л е р н и н г
