Performance artist
Open in Telegram
A step-by-step story about the formation of a new type of artist.
Show more217
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Сходил на эфир радио «КП»
Говорили мы про нейросети и почему всё так быстро меняется. Планировали про искусство, а в итоге обсуждали воздействие на общество.
В процессе я поймал себя на мысли, что людей в ИИ интересуют не столько картинки и тексты, а сам фактор изменения окружающего мира. «ИИ заменит, отнимет творчество, заполнит фейками» – все эти разговоры потому, человек уже готов, но не знает, как быть. И чем дольше идёт хайпогонка с ИИ, тем больше все теряются. Понять прогресс всё сложнее.
Представьте, как долго придётся обучать общество, чтобы ему было комфортно жить в новой реальности.
#реальность
Навёрстываю видео – GEN-1
Три месяца назад я подавался на бета-тест этой video2video модели, но так и не получил доступ в Дискорде.
Штош, пришлось регаться с другой почты и пробовать на официальном сайте Runway.
И тут нам показывают инструмент будущего для видео генерации и AI-арта. Принцип очень прост – закидываешь свой ролик, загружаешь картинку-референс, настраиваешь силу её влияния на результат, выбираешь подходящее превью и генеришь лучший вариант.
В бесплатной версии длина ролика всего 4 сек, в самой дорогой – 15 сек, но качество 4k и разные плюшки.
В примере готовое видео с моим лицом после осознания перспектив этой технологии.
Картинка реф в комментах.
Попробуйте GEN, такой шаг нельзя пропустить. Скоро у них выйдет вторая, более совершенная версия.
Вот тут:
https://app.runwayml.com/signup
#video2video
BARK это хороший text2voice
Полгода я не выкладывал звуковых нейронок – и примерно с декабря перестал за ними следить. Пришла пора наверстать. Тем более такие полезные штуки выходят.
Вот например Барк.
Опенсорс проект, переводит текст в голос. Понятно, что на английском работает лучше всего, но фишка в том, что он мультиязычный. Даже на русском можно получить приемлемые результаты.
Есть простенькое управление эмоциями и паузами в тексте, есть разделение на мужской и женский голос. В базовой версии на HuggingFace есть выбор из списка голосов, максимальная длина ролика 14 секунд. Хватает чтобы попробовать возможности. Также есть Google.Colab, чтобы не стоять в очереди на HuggingFace.
У Bark-а часто получаются аудио с посторонними шумами. Их можно бесплатно убрать вот тут в Adobe Podcast.
В примерах отрывок из моего текста от GPT4 и отрывок из Жванецкого.
#text2audio
Удобный CLIP в Midjourney
Позволяет извлекать из картинки-референса 4 варианта её текстового описания. Запускается командой
/describe
Работает просто. После запуска команды ты грузишь свою картинку по клику, через 15 секунд получаешь результат. Обычно он неидеальный, но его текст можно поправить в отдельном окне. Удобно.
Сегодня с помощью этой функции я за 5 минут сгенерил шапку для пресс-волла. В основе рандомная картинка с образцом корейской живописи из поиска Гугла.
В галерее пример выдачи, референс и готовый результат.
#midjourneyОтправная точка для экспериментов в генерации
PEZ Dispenser это скрипт, на вход которого вы подаёте картинку или свой старый промпт. На выходе получаете текст, в котором PEZ пытается сохранить начальные данные, но переписать их по-своему.
Диспенсер выдаёт шизофреничные промпты с эмодзи, арабской вязью, многоточиями и т.п.
Этот элемент хаоса/случайности отвечает за творчество. Значение Prompt length – тоже поле для экспериментов. Optimization steps лучше оставить 1000, быстрее работает.
Можно запустить в Google.Colab
Тут вы можете отсматривать все варианты текстов и выбирать себе промпт по вкусу.
По-разному выглядит в разных нейросетках. В Midjourney ругается на отдельные слова, например fag.
Шикарный инструмент для творчества, снимает проблему «чистого листа» и «чего бы сгенерить». Однозначно в закладки.
Пример: на входе нецке из SDXL и результат PEZ в Midjourney.
Промпт:
snake holistic thoughtful raven oregon ball lmfa👽bwogorilla nangbuddha statues meditation unsplash gamescom
#полезное
#midjourneyА вот так гитары выглядели в декабре. Примеры из Midjourney и StableDiffusion. Это лучшие варианты, в первых двух + Photoshop.
#археология
Прогресс в генерации картинок
Можно легко заметить на примере рук, гитар, рельсов и проводов.
В декабре, с помощью доученных моделей StableDiffusion сообщество решило проблему с количеством пальцев. В феврале появился ControlNet. С ним это стало уже рутинной операцией – благодаря проекции скелета и вкладке Joints.
Midjourney все три месяца отставал. Только в марте появился их пятый движок, где руки получаются почти хорошо при базовой генерации портретов.
Нормальную гитару в руках персонажа мне не удавалось получить до апреля. Даже ControlNet с такой задачей не особо помогает. Главная проблема это пальцы на грифе и струны. Они переплетаются между собой и со всем, что попало в пятно внимания. На картах глубины в ControlNet струн тупо не видно, они слишком тонкие и параллельные.
Но тут я опять купил подписку на Midjourney – и получилось.
#midjourney
Настоящая человеческая статья
Я вместе с @godofhoudini сходил рассказать про генеративные картинки и тексты. Было интересно посмотреть на реакцию людей, которые читали про успехи нейросетей, но мало кто пробовал их в деле. Мы генерили мнение о Владивостоке, описание компании в стиле Пелевина и прикольные картинки с рыбаками.
Наблюдение: взрослая аудитория в новой сложной теме, без одновременной практики с инструментом ловит информационный перегруз через полтора часа. Мне было бы сложно сидеть и слушать про чужие кейсы – и не пробовать что-то сгенерить. Не представляю, как выдерживают мастер-классы длиннее пары часов.
Статья про нас вот тут.
#реальность
Универсальные советы по работе с текстовыми нейросетками
Я попросил их сформулировать GPT4 на основе его нынешнего опыта. Итак.
Будьте ясны и конкретны в своих вопросах:
ChatGPT отлично подходит для получения ответов на широкий круг тем, но лучше всего работает, когда вы задаете четкие и конкретные вопросы. Избегайте двусмысленных или открытых вопросов, поскольку они могут привести к неуместным или не относящимся к теме ответам.
Используйте правильную грамматику и пунктуацию:
хотя ChatGPT предназначен для понимания естественного языка, использование правильной грамматики и пунктуации может помочь ему лучше понимать ваши вопросы и давать более точные ответы.
Предоставьте контекст:
Предоставление контекста по вашему вопросу или теме может помочь ChatGPT генерировать более релевантные ответы. Например, если вы задаете вопрос о конкретной области или отрасли, предоставьте некоторую справочную информацию, чтобы помочь ChatGPT понять контекст вашего вопроса.
Избегайте предвзятых или наводящих вопросов:
ChatGPT предназначен для создания непредвзятых ответов на основе предоставленной ему информации. Избегайте задавать наводящие или предвзятые вопросы, которые могут повлиять на его ответы.
Будьте краткими:
ChatGPT с большей вероятностью предоставит точные и актуальные ответы на краткие вопросы. Не задавайте длинных или запутанных вопросов, которые ChatGPT может быть трудно понять.
Используйте правильный язык:
ChatGPT может генерировать ответы на нескольких языках. Убедитесь, что вы используете правильный язык для своего вопроса, чтобы гарантировать, что ChatGPT может понять и предоставить соответствующие ответы.
Оставляйте отзывы:
ChatGPT предназначен для обучения на полученных отзывах. Если вы обнаружите, что ответы, которые он генерирует, неактуальны или неверны, предоставьте отзыв, чтобы помочь ему учиться и улучшать свои ответы в будущем.
В целом, чем конкретнее, яснее и лаконичнее вы будете задавать вопросы, тем лучше ответы вы получите от ChatGPT. Удачи!
#полезное
#chatgpt
Open Assistant как альтернатива ChatGPT
Сегодня утром его наконец запустили. Эксперимент получился нормальным, сетка работает сильно лучше чем Bard от Google (это несложно). Но в очереди на генерацию уже придётся постоять.
Open Assistant обучали не на выдаче из GPT, а на текстах реальных людей, которые создавали для этой цели. Он хорошо справляется с придумыванием и литературным описанием, составляет легко читаемые саммари. Для деловых писем, каких-то докладов или описания на сайте я точно выберу его. В текстовом креативе он показался мне "человечнее" GPT4, который больше похож на робота. Так Assistant работает только на английском. С другими языками дружит плохо, слабо умеет в факты и перевод, часто врёт и теряется.
Скоро к нему прикрутят модули под разные задачи, как в ChatGPT. Уже сейчас вы можете поучаствовать в работе сообщества и протестировать ответы Open Assistant, в отдельной вкладке. За это дают рейтинг и какие-то уровни, но я так и не понял, на что это влияет.
Как итог, получился опенсорс-проект, уже сейчас реально полезный и приятный в работе. И на основе которого можно будет дообучать варианты текстовых личностей под свои задачи.
#openassistant
Небольшая коллекция фигурок нецке от современных японских мастеров.
#sdxl
#stablediffusion
Генерация изображений text2vector
В декабре у нас на лекции был вопрос, когда сделают генерацию векторных картинок. Я тогда ответил, что через три месяца кто-то обязательно допилит. Подождать пришлось четыре.
Вот вам онлайн сервис, который пока бесплатно даёт погенерить векторные картинки. И даже сохранить их в приличном качестве. Длинные промпты понимает плохо, но ему и не нужно. Вы максимум будете название предмета писать.
Интерфейс понятный: рабочий стол и окна, в которых генеришь разные детали и двигаешь их в композиции. Потом сохраняешь на комп и собираешь готовый вариант.
Есть 5 стилей:
иконки (норм),
фоны (нестабильно и проклято),
пиктограммы (проклято),
иллюстрации (норм)
3D иллюстрации (хорошо).
В иллюстрациях и 3D можно вырезать фон и сохранить результат как .png
Мне даже поругать нечего, ну может качество генераций хотелось бы стабильнее. Приятный сервис с будущим развитием.
А потом их купит Adobe, чтобы не мешал Firefly.
#text2vector
Определитель сгенерированных картинок
Не знаю, кому это понадобилось, но тут вот запилили сайт, куда можно отправить картинку и тебе ответят, генерация ли это и в какой нейросети сделана.
Я закинул туда прошлогодние и свежие примеры, плюс свои фотки.
Печальное зрелище.
Свежий фотореализм из Firefly, Deliberate или SDXL не видит никогда. В лучшем случае пишет, что «Не смог понять, наверное вы сильно поменяли картинку».
Определяет древние генерации из мая-сентября, там где вырвиглазные артефакты, но подписывает их как «Made by Midjourney». На картинки из MJ пишет Stable Diffusion. Кандинский всегда MJ.
Реальные фото узнаёт неплохо, но стоит в кадре появиться какой-то абстракции, бликам или артефактам, сразу начинает страшно тупить и не понимать.
Возможно, эту анти-ИИ в будущем попробуют улучшить. А через какое-то время забросят, потому что никому не будет до неё дела.
#реальность
#noAI
Тест на космонавта
В честь 12 апреля я решил прогнать простейший промпт
soviet cosmonaut in outer space
сразу в нескольких нейросетках.
Лучше всего справился SDXL (картинки 1 и 2). Знает форму советских скафандров и лиц.
Dreamlike (картинка 3) сделал приятную стилизацию, да и форму скафандра тоже узнал.
А дальше веселье.
Политкорректный Firefly.
Кандинский, который пытается усидеть на двух флагах.
Ну и Шедеврум как всегда стабилен.
#stablediffusionМеня внезапно позвали в закрытый бета-тест AI Workspace Labs от Google
Видимо оценили мой фидбек в бета-тесте LaMDA и Bard месяц назад. Там можно было описывать свои впечатления на точность ответов, чистоту текста, связность сюжета – и отправлять обратной связью. Или забить на это и просто потыкать новые Гуглоподелки. Но я честно написал, в чём и где недоволен Бардом – и умеренно доволен LaMDA. Потратил где-то час.
А теперь в Google зачем-то решили пойти дальше и прикрутить эти сырые продукты к уже работающим инструментам Workspace. Получился Labs.
Тут добрый корпоративный AI будет помогать тебе писать тексты в Google Docks, делать саммари на Ютюбе, юзать интуитивный поиск, предложит умный Assistant – всё в таком духе. ХЗ, что из этого выйдет.
На этой неделе обещали пустить. Посмотрю что как, отпишусь по итогу.
#google
#реальность
Новый шаг к облегчению работы дизайнера и ретушера
Я затестил удалялку фона RemoveBG (нужен VPN) и генератор фонов для продуктовой съёмки Flair.
С первой ничего особенного. Удаляет фон с фото. Есть кисть для точных коррекций. Работает норм, косячит часто.
А вот со второй интереснее. Загружаешь фото на сайт, а затем вокруг него генеришь любое окружение. Такой конструктор сцены в браузере.
Есть готовые промпты – и можно писать свои. Есть база ходовых предметов, вроде бутылок, косметики и упаковки. Для незнакомых предметов лучше писать свои промпты, готовые работают плохо.
Качество так себе, но для Инсты и показать клиенту наброски идеи – вполне.
Под капотом ControlNet (первый прогон не даёт картинки, т.к. генерится карта глубины) + SD1.5 (смотри артефакты на фото с бутылкой).
Как первый шаг – просто шикарно. Зайду через месяц посмотреть на развитие идеи.
#реальность
#controlnet
#stablediffusion
Я затестил Shedevrum от Яндекса
Камон, это просто игрушка-мемогенератор. Такую функцию выполняет прекрасно, ни для чего другого не годится. Что-то на уровне Craiyon из 2021 года – хорош только своей проклятостью.
Технически это тот же Кандинский со своим дообученным датасетом на основе StableDiffusion 1.5 и размеченным автопереводом на русский. Попробуйте сгенерить «ладонь руки», например – получите пальму. Потому что «palm hand».
Качество – его нет. Но уже врубили NSFW фильтр и синиц генерить не дают.
По словам одного из разработчиков причина такого шедеврума – руководство Яндекса заставило их срочно выпустить сырой продукт, чтобы не отстать от Сбера с их Кандинским. Последние 2 недели допиливали всё в страшной спешке и до сих пор продолжают.
Качать и ставить на Андроид тут.
На iOS тоже есть.
#шедеврум
#проклято
Пример, как сделать видео из генераций Midjourney в стиле Balenciaga
Получить такой результат проще, чем вы думаете, но посидеть за продакшеном придётся.
Вы увидите, что всё упирается в знание современных ИИнструментов и как они работают в связке друг с другом. Особенно наглядно про ChatGPT в самом начале – как автор ускоряет для себя самую кропотливую часть разработки идеи.
Отдельно хочу отметить – вот ролик совершенно бесплатно лежит на Ютюбе. Бери, делай красиво, всё к твоим услугам. А раньше на таком кейсе разработали бы целый мастер-класс и продавали по подписке.
#chatgpt
#midjourney
#видео
https://youtu.be/TGD8zKvRxc4
Про плёнку в генерациях
Есть такая проблема – получить видимое плёночное зерно в чистой генерации. Причина: разрешение исходных фотографий в датасете 512×512. Плёночный шум не улавливается на такой картинке. Проблему пытаются решить магическими практиками с промптом – добавлять названия плёнок или фотографов, снимавших на ISO выше 1600, например Морияму. Но это не помогает, только повышает контраст.
Adobe Firefly решил эту проблему. Датасет у них тренирован на собственных картинках 768×768, среди которых много плёночных портретов. Даже проблемы с анатомией мало заметны. В примерах это первые две картинки.
Также мой промпт один из разработчиков прогнал в ещё не релизнутой сетке IF, она же DeepFloyd. Можете оценить, какое качество нас ждёт в следующем поколении txt2img генераций.
Бонусом тот же запрос в новом Кандинском и Шедевруме. Проклято.
#firefly
#deepfloyd
#IF
#kandinsky
