Мишин Лернинг 🇺🇦🇮🇱
Open in Telegram
Субъективный канал об искусстве машинного обучения, нейронных сетях и новостях из мира искусственного интеллекта.
Show more7 965
Subscribers
No data24 hours
-77 days
-4930 days
Posts Archive
7 965
⚠️ В твиттере происходит что-то необычное! Новые «*этики» пытаются закенселить Нейронную Сеть!
После выхода stable diffusion у художников бомбануло пукан. Забавно. Когда художников спрашиваешь: «может ли нейросеть заменить художника?», то ответ обычно такой «нет, нейросеть не испытывает вдохновения, это не искусство» или «машина не может заменить человека, она бездушна».
Как бы то ни было, бездушная машина вызвала настоящую панику, типа «AI нас всех уничижит!». Это даже забавно, что в сфере искусства возникла сильнейшая реакция, а не среди молчаливых жителей Москвы, где тоталитарная власть использует face-id совместно с re-id.
1) 10,800 репостов, 87,300 лайков, 3,672 комментария у поста некого RJ Palmer: «Новая нейросеть делает изображения, которые выглядят на 100% как нарисованное человеком. Я, как артист, экстремально обеспокоен». Забавно, что «экстремально обеспокоенный артист» сам мечтал о доступе к DALLE2! А теперь пишет, что генерить как реальные художники «это просто мерзко».
2) Ян Лекун крестный Отец Свёрток, поддержал проект, а Андрей Карпаты, который один из первых получил веса, уже во всю играет с SD и пилит код для анимаций! ❤️
3) Чел, который каждый легко спускал по 750$ на токены DALLE2, комментируя процесс из покупки незамысловатыми комментарием «🤤», придумал хэштеги: #cancelstablediffusion и #dontreleasetheweights … Могу сказать только что его аккаунт почти целиком состоит из генераций DALLE2. Отвечу ему на его же языке «😒»
4) Больше всего меня поразил полупоц из OpenAI, который сравнил Stable Diffusion с «Ядерным Оружием»!! Аллё, у вас там совсем крыша поехала от оруэлловского нейминга: Open это Closed, Closed это Open? Картинки не убивают людей, не уничтожают Мариуполь, не оккупируют Херсон, не казнят военнопленных, не занимаются ядерным шантажом, не устраивают геноцид!!
Такими сетями генерируют кота в шлеме космонавта или эльфийку с сиськами. Это ядерное орудие?
🚫 Что думаешь ты по этому поводу? Пиши в комментарии. Объективна ли паника, нужно ли кенселить нейросеть?
🤖 Мишин Лернинг
7 965
Repost from Нейроэстетика
🚘 Кто-то слил в сеть скриншоты готовящейся GTA VI
✨ Поговорим про prompt-инжиниринг или создание текстовых описаний на примере GTA VI.
На самом деле, чтобы сгенерировать именно то, что вы придумали, нужно применять очень много текстовых трюков. Например, в интернете ещё нет скриншотов GTA VI. И поэтому при создании описания придётся использовать хитрости.
Нейросеть ничего знает про сеттинг игры, но мы ведь можем его описать. Я выбрал следующие фразы:
- GTA Vice City graphics mods
- GTA Vice City 2024 remaster
- Miami, palms and Miami buildings
Теперь про графику. Сначала выходило очень примитивно, так как сеть цеплялась за GTA Vice City. Но в отличие от реального ремастеринга GTA Vice City, графику наших генераций ещё можно спасти:
- next-gen ps5 game
- unreal engine
- rtx reflection
- artstation
Изображения получились уже достаточно качественные, но, в них не хватало реализма, слишком отдавало нарочитой компьютерной графикой. Вернуть же реализм достаточно просто:
- photorealistic screenshot
- still
- 50mm
- bokeh
В итоге я получил следующее текстовое описание: «still next-gen ps5 game Grand Theft Auto 6 2024 remaster, graphics mods, rain, red sunset, people, rtx reflections, GTA VI, Miami, palms and Miami buildings, photorealistic screenshot, unreal engine, 4K, 50mm bokeh, close-up ford mustang, gta vice city remastered, artstation
-W 704 -H 512 -n 9 -C 9 -s 100»
Где:
-W 704 -H 512 ширина и высота
-n 9 количество генераций за раз
-C 9 classifier free guidance scale 9
-s 100 количество денойзинг шагов
p.s.: Я заметил, что подбор prompt’ов для Stable Diffusion очень отличается от DALL•E 2, скорее всего дело именно в датасетах. Дерзайте!
Канал про генеративные нейронные сети
🌊 Н е й р о э с т е т и к а
7 965
🗃 Смогут ли нейросети частично заменить стоковые фото сервисы? Здесь я не имею в виду исторические снимки или фото знаменитостей или хронику и т.д. Именно частично: что для постов или статей изображения будут все чаще генерить, чем искать и скачивать.
7 965
Repost from Нейроэстетика
Давайте честно: Нейросети смогут частично заменить иллюстраторов / фотографов; приведёт ли дальнейший прогресс в ИИ к изменениям на рабочих местах?
7 965
Repost from Neural Shit
Мне тут прилетел доступ к Stable Diffusion (спасибо, Миша!)
Первым делом поигрался со своими любимыми Пепе лягушатами (естественно).
1)Пепе в GTA SA
2)Пепе в Симпсонах
3)Пепе под LSD
4)Пепе в картине "Американская Готика"
5)Пепе в картине "Девушка с жемчужной сережкой"
6)Пепе в стиле Лавкрафта
Генерация оооочень быстрая, а самое главное, не нужен пердолинг с апскейлом — можно сразу выбрать произвольный нужный размер генерируемого изображения.
Кстати, эта штука умеет в инпэйнтинг (дорисовывать уже существующие изображения). Получается очень годно, глянуть пример можно тут.
7 965
🎥 Смотрите что CompVis творит с Text Video Editing
Как я уже показывал, Stability Diffusion готовит Inpainting версию своей модели.
Теперь Patrick Esser поделился интересным прогрессом. Посмотрите, я реально залип..
7 965
🧲 Бэкбоны на трансформерах уже Detectron 2 от Facebook AI Research
Трансформеры (ViT, Swin) для задач компьютерного зрения уже стали новой нормой. Вот и претрененные бэкбоны для Mask R-CNN и Cascade Mask R-CNN завезли!
Я по-прежнему считаю, что ViT одна из самых гениальных архитектур современности! Вы просто посмотрите на эти метрики:
📣 ViTDet — ViT-H Cascade
(multiscale) 53.1 в задаче Instance Segmentation on COCO без обученияна дополнительных данных!
Новость взял у эйай ньюз
📑 Paper: Exploring Plain Vision Transformer Backbones for Object Detection
🗃 ViTDetот Facebook AI Research (код и веса моделей)
7 965
✨ Вышел StableDiffusion — Разбираем подробно что нас ждет дальше и что это такое!
📇 Начнем с новостей:
StableDiffusion вышел в Stage I: ресерчеры смогут получить доступ к модели уже сегодня! Для этого веса нужно будет запросить. Но не стоит расстраиваться.
Публичный релиз состоится в ближайшее время, как только будут завершены последние этапы подготовки модели к "публичной жизни". А еще сегодня ожидается последняя волна инвайтов на закрытое бета тестирование в котором уже приняли участие 10,000 юзеров, генерируя около 1,7M изображений за сутки. 🤗
🌬 Что такое StableDiffusion?
StableDiffusion — это самая удачная смесь в Text2Image, а именно гибрид Latent Diffusion и Imagen:
> Latent Diffusion (LDM) позволяет в производить диффузию на в пространстве пикселей, а в латенщине. Вместо разрешения 64х64 — выходит сразу 512, благодаря Encoder-Decoder подходу. Если короче: деталей больше, а вычислений меньше.
> От LDM StableDiffusion отличает тот факт, что интформация от текста течет с frozen LM (а именно CLIP), как в случае с T5 в Imagen.
> Оказалось что CLIP вектора куда лучше шарят изображения и они выходят прям очень-очень крутыми (все же клип учился на изображениях и LM косвенно тоже)! И хотя понимание отношений (кто слева, кто справа, и тд) объектов чуть лучше и T5, но качество картинки у CLIP лучше на порядок!
Модель сделали ребята из StabilityAI и CompVis, обучая SD на супере компьютере Ezra-1 AI UltraCluster, состоящим из 4,000 A100, используя для трена 2B пар изображения-текст из датасета LAION 5B, файнтюня модель на LAION-Aesthetics (сабсете)
📇 Blog Post
💻 Code StableDiffusion
👁 Веса Модели (model card)
🤖 Мишин Лернинг ✖️ Н е й р о э с т е т и к а
7 965
Субъективно: результаты генераций какой модели тебе кажутся более интересными и красивыми? Если выбирать одну модель, то:
7 965
Repost from Нейроэстетика
🌙 Прощай DALL•E 2 ✨ Stable Diffusion в каждый дом! Скоро!
Ну что, ребята, задачу text2image можно считать практически решенной?
Stable Diffusion гениален! Работать в латентном пространстве вместо пространства пикселей, получая такую высокую детализацию объектов и фона практически без артефактов! Это действительно NextGen!
prompt: anime fine details portrait of {Object and description}, bokeh. anime masterpiece by Studio Ghibli. 8k, sharp high quality classic anime from 1990 in style of Hayao Miyazaki --cfg_scale 13.5 --steps 150 --height 512 --width 640
Н е й р о э с т е т и к а ✖️ Мишин Лернинг
7 965
🧙♂️ Blizzard, увольняйте ваших иллюстраторов
Stable Diffusion разрывает DALL•E 2! Такого арта я ещё нигде не видел! Мне кажется, что время когда, нейронными сетями можно делать полноценные иллюстрации настало.
Представляю: Коллекцию генеративного арта «Blizzard WarCraft». Более 50 артов, сгенерированных нейронной сетью. Выложил все в канал Н е й р о э с т е т и к а.
🫵 Коллекция Blizzard WarCraft
7 965
Repost from Нейроэстетика
👁 Давайте разберемся с параметром cfg_scale в Stable Diffusion
Объесняю самый важный параметр в Stable Diffusion на примере космических артов с Miles Davis
👉 full-length portrait of miles davis in a space suit, fashion studio lighting, 35mm --height 768 --steps 150 --seed 5 --cfg_scale 9
--seed 5 — генерит шум, из которого начнется диффуз, это позволяет получить похожие резалты
--steps 150 — дает самый качественный резалт (но время!)
--cfg_scale 9 — параметр отвечает за схожесть с текстом, платить будем Деталями и Реализмом
cfg — это Classifier Free Guidance. Генерятся 2 картинки: одна по текстовому описанию, другая — без. И делается шаг усиливающий движение в сторону текста!
Получил 9 картинок на шагах
1, 3, 5, 7, 9, 11, 13, 15, 17
1, 3, 5 - бред, слишком хаотично
7, 9, 11 - реалистично и оптимально
13 — уже начинаются проблемы с контрастностью гипертрофированием признаков
15, 17 — гипертрофирование признаков, низкий FID (реализм), гиперконтрастность
Н е й р о э с т е т и к а ✖️ Мишин Лернинг
7 965
📣 Photoshop будущее здесь!! Inpainting в Stable Diffusion
Stable Diffusion на подходе, и да! Там будет Inapainting как в DALL•E 2!
Но вот ещё супер новость — инструментарий для:
• Генераций и инпеинтинга!
Инструментарий уже на голову превосходит то, что предлагает OpenAI!
Я решил протестить его:
• Сгенерил поп арт портреты Miles Davis (выбрал произвольную форму)
• Затем рядом портрет John Coltrane
• И объединил их при помощи инпеинтинга!
Можно брать реальные фотки, сгенерированные, изменять, соединять, расширять!
🚀 Ждем, все будет очень скоро! Сразу скину и поделюсь!
автор генерации: Н е й р о э с т е т и к а ✖️ Мишин Лернинг
7 965
Repost from Нейроэстетика
🎺🌌 Miles Davis Jazz Astronaut
Stable Diffusion на подходе, вот параметры, с которыми можно будт играть:
-- height [512] height of image
-- width [512] width of image
📲 да, можно будет создавать вертикальные или горизонтальные полтна
-- cfg_scale [7.0] CFG scale factor
🎛 Наверное самый важный параметр:
1,2 — мясо, бред, хаос
3,4 — перегруженное фото
5,6 — оптимум по деталям и целостности
7,8 — объекты целые, но синтетичные
> 9 — уже совсем скучно становится
--steps [50]
🪜 Сколько шагов семплирования пройдено:
50 — быстро и достаточно качественно
100 — оптимум времени / качеству
150 — медленно и супер детально
prompt: full-length portrait of miles davis in a space suit, studio lighting --height 768 --cfg_scale 6 --steps 150
🚀 Ждем, все будет очень скоро 😉
автор: Н е й р о э с т е т и к а ✖️ Мишин Лернинг
7 965
⚠️ Важные новости в мире Text 2 Image !
Мишин Лернинг 🎓 делится очень полезной информацией:
1. Вышел новый чекпоинт сети Stable Diffusion!
2. Доступы будут раздаваться приблизительно 8го августа!
3. Stable Diffusion ~800M будет OPEN SOURCE!
Да, у меня уже есть доступ. Пишите, будет время — сгенерю что-то для вас..
Модель Stable Diffusion — Latent Diffusion Model с концепцией Imagen (frozenCLIP) и DALL•E 2. Из-за LDM подхода модель сразу генерит 768х768, а не 64 > 256 > 1024 как DALL-E 2 и Imagen! Генерации занимают секунды! Для генерации уже используется classifier free guidance!
👉 Записаться на бетку можно тут (доступ будет ~8го августа)
p.s: узнаёте игры, в которые я помести Дарта Вейдера?
Н е й р о э с т е т и к а ✖️ Мишин Лернинг
7 965
Repost from Нейроэстетика
💿 M U S I C \\\ R E C O M E N D A T I O N S
Друзья, посоветуйте интересной интеллектуальной музыки
Что-то их этого будет идеально:
- modern jazz
- XX-XXI academic
- prog \\\ experimental rock
- experimental avant electronic
➖ д я к у ю ➖
p.s.: в комменты занесу и свои рекомендации
7 965
👾 А у нас NextGen Text2Image: Retrieval-Augmented Diffusion Models от CompVis
Я не мог писать об этом раньше, но теперь все выложили. Хотя написать очень и очень хотелось..
Идея лежала на поверхности: DALL•E 2 💦 RETRO = ❤️
Если чуть подробнее разберём на примере:
> Нужно сгенерировать «Медведя-Жирафа на скейтборде»
❕DALL•E 1/2, Imagen принимали текст, и на основе него генерировали изображения. А что если имеет возможность подглядывать в реальную базу данных?
❗️Для этого нам поможет CLIP и kNN: Ищем в датасете ближайшие изображения и подаём их (или их эмбеддинги) в качестве кондишн для генерации.
Новый LDM, натренированный в таком режиме, что можно использовать:
> Unconditional генерацию
> Class и Retrieval кондишн
То есть: Сожно использовать только текстовое описание, а можно и помочь сети, похожими реальными примерами (найдя похожие картинки, из которых можно взять что-то, как с референсов)
Ну не круто ли?
📰 paper
🔬 Code
@Mishin Learning
7 965
DeepMind ❤️ YouTube
Самое важное и интересного из 📇 блог поста DeepMind про интеграцию DL-проектов для платформы YouTube:
🗄 MuZero улучшил кодек VP9 на 4%
Работая вместе с YouTube, DeepMind изучили потенциал на MuZero для улучшения кодека VP9 (👈 подробнее) и применили MuZero к живому трафику YouTube!
После запуска, снижение битрейта составило ~4%. Улучшив кодек VP9 на YouTube, DeepMind помогли сократить интернет-трафик необходимое для загрузки видео.
А благодаря оптимизации миллионы людей смогут смотреть больше видео, загружая их быстрее!
🎞 AutoChapters — Автоматическая разбивка видео на главы
Главы позволяют находить нужный контент, но их создание было медленным и трудоемким ручным процессом.
Представленная на Google I/O 2022 технология автоматического создания главы уже сегодня используется для 8,000,000 видео, и YouTube обработает > 80,000,000 видео в этом году.
AutoChapters экономит время на поиск контента зрителя, и создателям на разбиение глав.
@Мишин Лернинг
