5 323
Підписники
Немає даних24 години
-97 днів
-4230 день
Архів дописів
5 323
Irbis-7B v0.1 - казахская ЛЛМ 🇰🇿
Мы тут обратили внимание, что опенсорс языковые модели отвратительно работают с казахским языком и решили исправить это недоразумение. Работа еще не окончена, но уже из интересного есть, что рассказать и показать. Сейчас моделька не дурно отвечает на простые вопросы и извлекает информацию из контекста, невзирая на те трудности, с которыми пришлось столкнуться при подготовке данных и тренировке.
О том что и как было сделано (в т.ч. примеры и сравнения) можно ознакомиться в статье на Хабре.
🤗 Base: model
🤗 Instruct: lora
5 323
Sora
Анонс модели для генерации видео от OpenAI.
+ Универсальность: возможность генерировать видео разных разрешений, соотношений сторон и длительности.
+ Понимание: короткий промпт, написанный на разных языках, будет дополнен деталями, точно описывающими сцену (как это было в Далли3).
+ Редактирование: можно создавать зацикленные видео, продлевать их, менять окружение и объекты, делать плавный переход между двумя видео, а так же анимировать статичные изображения (которыми уже никого не удивишь).
+ Когерентность: невероятная согласованность кадров, от чего объекты сохраняют свою позицию в пространстве. Это особенно чувствуется, когда камера вращается вокруг какого-нибудь места или объекта.
+ Взаимодействие: модель способна симулировать действия, которые влияют на состояние мира в сцене. Например, художник наносит мазки на холст. С появлением новых мазков старый сохраняются.
- Из минусов выделяют просадки с точным моделированием физики основных взаимодействий и поддержанием согласованности в длительных выборках
По мере развития Sora обещает стать еще более мощным симулятором физического и цифрового миров.
Дополнительно почитать и посмотреть можно тут: https://openai.com/research/video-generation-models-as-world-simulators
#news
5 323
Instructor
Ждать от ГПТшки структурированного ответа не самое приятное дело. Поэтому ОпенАИ и выкатили поддержку вызова функций. Заполнил ДжейСОН-Схему и получил структурированный ответ. Новая проблема возникает тогда, когда нам нужно писать более 3 таких схем (а так же функций для них) и наш код разрастается до каких-то страшных объемов, которые еще и сложно читать. В таком случае возникает потребность в поиске иной структуры извлечения данных. И тут на помощь к нам приходит Instructor (обертка над Pydantic). Гораздо более удобный формат взаимодействия с функциями, имхо, который имеет множество фич, таких как, например, валидация ответа. Код сокращается незначительно, но обслуживать его становится сплошным удовольствием. Дополнительно можно потестировать Kor (выглядит аналогично впечатляюще).
#useful
5 323
Langflow и FlowiseAI
Всем любителям ноу-кодинга и пользователям Comfy посвящается. Нет, это не про картинки, а про ЛЛМ и LangChain (который я всей душой не люблю). С одной стороны для быстрых тестов подходящий фреймворк, но как только прикидываешь время на правки шаблонов промптов и кучи всего прочего, то понимаешь, что это сравнимо с тем, если бы все писал сам с нуля.
Энивей, многие пользуются. Этих многих могло бы быть больше, если бы они знали, что есть возможность собирать эти чейны нодами без единой строчки кода. Быстро и удобно (ведь весь ваш пайплайн потом можно экспортировать в виде кода, если вдруг решите встроить в свой сервис). Речь идет о Langflow и FlowiseAI. На отдельные посты делить их не хочется ибо они мало чем друг от друга отличаются, поэтому предлагаю попробовать оба и выбрать тот, который покажется интересным больше.
#useful
5 323
{guidance}
Хотел бы поделиться инструментами, которые сам часто использую. Начну с прекрасного тула для ЛЛМок, позволяющего структурировать выходные данные. Называется он Guidance. На самом деле это больше чем просто контроль аутпута, это целая парадигма взаимодействия с языковыми моделями, позволяющая легко строить логику над полученными ответами. Так, например, всего в несколько строк можно получить классификатор, вместо того, чтобы писать кучу условий в промпте и надеяться, что модель не напишет отсебятины:
from guidance import models, select
llama2 = models.LlamaCpp(path)
llama2 + 'Who loves their owner more? Answer: ' + select(['cat', 'dog'])
Иными словами мы смотрим на самый вероятный токен из представленных вариантов, а не всех, что есть в словаре. Такие варианты можно определять как списком, так и, например, регулярными выражениями. И это лишь толика того, что можно вытворять с помощью этой штуки. Еще один пример использования я прикреплю картинкой, но лучше заглянуть в репу и ознакомиться со всем функционалом (благо в ридми много подробных примеров). Эта либа прекрасно дружит и с Transformers, и с llama.cpp.
Допом можно ознакомиться с LMQL (аналог с кучей своих преимуществ).
#useful5 323
MLArt
Привет всем! Целый год я ничего не писал сюда, ибо столкнулся с внутренними ограничениями, которые сам себе создал. Раньше, когда у меня было всего 8 подписчиков, я писал про дизайн, проводил интервью с интересными мне людьми, делал пересказы книг по воспитанию детей (все это еще осталось на канале). Я писал про все, к чему душа лежала (в особенности про нейросети). Я с большим удовольствием тестировал их и продолжаю тестировать по сей день.
Большой поток подписчиков пошел тогда, когда я начал постить Колаб ссылки на ноутбуки, которые я собирал для тех, кто хочет познакомиться с новинками в области машинного обучения, но не обладает навыками программирования. Это было полезным делом, ведь я чувствовал ответственность перед теми, кто ради этого и подписался. Я несколько раз писал о том, что хочу поэкспериментировать с форматами постов, но всегда останавливался, ибо боялся, что многие из вас отпишутся. Это было нечестно как перед вами, так и перед собой.
Затем на арену вышли генераторы изображений и ЛЛМки, а делать однотипные посты о том, как новая моделька на долю процента обогнала предыдущую не хотелось и я решил не писать ничего. Потом я запустил новый канал, где без зазрения совести писал о разных фреймворках, которыми сам пользуюсь, однако в чем смысл делиться ссылками с самим собой, когда есть место, где наверняка найдутся те, кому это будет интересно. Я решил вернуться сюда, честно вас предупредить, что Колабов будет меньше и, скорее всего, на не самые популярные проекты, высокую регулярность постов тоже обещать не могу, ибо все зависит от свободного времени. Посты с нового канала перенесу сюда до конца недели, а дальше как пойдет.
Всем, кто решит отписаться, хотел бы сказать спасибо за эти прекрасные годы, что вы читали меня, обсуждали со мной различные новинки и делились своим опытом. Возможно добавлю обсуждения, о которых многие просили, но это позже. Сейчас я плавно поменяю имя, описание и картинку канала, закину первый пост и буду надеяться, что не начну снова ставить себе рамки.
5 323
🧸 AI Interior Designer 🧸
Не прошло и недели, а на канале новый колаб. На этот раз дизайнер интерьеров. Все просто: подаешь фото, выбираешь один из 84 стилей дизайна (либо пишешь свой) и получаешь прекрасный результат. Под капотом КонтролНЕТ (выбрал те модели, которые дают хороший результат). Колаб адаптировал именно под интерьеры, поэтому менять дизайн одежды или обуви можно даже не пытаться. В довесок прикрутил автопереводчик, поэтому можете писать названия каких-то новых стилей на любом языке. В общем, милости прошу тестить:
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/AI_Interior_Designer.ipynb
5 323
💠 ComfyUI 🏞
Я тут колаб принес, пользовательский интерфейс которого позволит вам проектировать пайплайн стабильной диффузии, используя интерфейс на основе нод (да да, прям в колабе). Если это кажется сложным, то предлагаю ознакомиться с этими примерами. Может работать асинхронно, куча оптимизаций, поддержка ckpt и safetensors, эмбэды, контролнеты и кучу всего другого.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/SDNode_v_1_0.ipynb
5 323
С появлением Далли и Стебля все поняли, что совсем скоро большинство художников, иллюстраторов и дизайнеров заменят современные технологии. На днях OpenAI выкатили новую языковую модель ChatGPT (которую уже можно пощупать) и я решил не просто протестировать ее, а еще и расширить список тех, кому также стоит начать немного переживать (примеры на английском ищите в прикрепленных изображениях):
- Искусствоведы
- Композиторы
- Поэты
- Программисты
- Промпт-инженеры
- Психологи
- Рэперы
- Стилисты
- Юмористы
- HR-менеджеры
5 323
🎤 Pop2Piano 🎹
Ку. Продолжаем пилить колабы? Вроде как активнее начали появляться интересные проекты, а значит я снова в строю. На этот раз сетка, которая изменить музыкальное сопровождение какой-нибудь попсовой песенки на аккомпонимент пианино. Работает быстро и звучит миленько. Париться с вырезанием голоса не нужно (все, что необходимо я вшил в колаб). Просто грузите трек как есть и получайте забавный результат. Учтите, что если у песни долгое вступление, то и мелодия начнется не сразу.
P.S. буду стараться собирать все то, что тянет бесплатный колаб. В платном вы сами знаете что творится.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/Pop2Piano.ipynb
5 323
За последние годы я сильно пристрастился к Колабу. Не припомню и дня, когда я бы не запускал в нем какую-нибудь нейронку. Что уж там, я в ML начал погружаться в том числе благодаря доступности ВычМощей, которые он предлагал. Но в какой-то момент халява подходит к концу и мы замечаем, что остается всего 15 часов до момента, когда ресурсы закончатся. Этого времени как раз хватит, чтобы пару деньков позапускать какие-нибудь старенькие ноутбуки, выпить бутылочку вина за прекрасные мгновения, проведенные вместе, и попрощаться с Колабом, так и не став его амбассадором. Через месяц опять появится возможность пользоваться сервисом в полной мере, но опять всего на несколько часов.
5 323
В прикрепленном примере слева DeOldify, а справа я разбил ч/б видео на сцены, взял из них по одному кадру, прогнал их через image2text (да, такие сетки тоже кому-то нужны в 2к22), загуглил картинки по тексту (хотя можно было бы и сгенерить) и подал как референс, а в колабе ниже я попытался все это автоматизировать на примере одной старенькой сетки. Видно, результат сыроват, но это ведь только «Введение». Далее, если эта тема окажется интресной не только мне, я постараюсь простым языком шире ее раскрыть. Пока не решил серия ли это будет постов, или в статейку все уместить.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/VCR.ipynb
5 323
«Колоризация. Введение»
Колоризация кадров - одна из моих любимых задач в машинном обучении. Я протестировал, наверное, все существующие, на данный момент, репозитории с сетками по раскрашиванию, написанные на питоне, что-то писал сам (но лучше пусть это так и останется в старых, забытых колабах) и теперь могу подвести некоторые итоги. Отправной точкой возьму DeOldify (как самого популярного представителя жанра). У него есть проблемы, такие как синие ореолы вокруг объектов, отсутствие консистентности кадров, а так же он часто пятнит. Приходится балансировать между буйством красок и согласованностью кадров. Либо куча цветов и фликер, либо стабильная ржавчина, но при всем при этом DeOldify все еще многие используют ибо он полностью автоматизированный. Хотя добавь немного ручной работы и видео заиграет новыми красками, так как есть куча алгоритмов, которые красят по референсу, а значит можно и богатую палитру, и когерентность сохранить.
5 323
Upscaler VS Frame Interpolator
Наконец я созрел до написания статейки (как в старые добрые времена). В этот раз весьма занимательный эксперимент, а именно: пробую увеличить FPS с помощью Real-ESRGAN и сделать апскейл интерполятором кадров RIFE. По ощущению будто заглядываешь в 4 измерение, когда делаешь пространственно-временной своп, которому и посвящен этот текст, но не стоит пугаться незнакомых фраз. Я очень старался сделать материал максимально доступным, поэтому проблем быть не должно.
P.S. Даже колаб собрал (пусть и думал от него отказаться), но он внутри статьи. Как появится какая-нибудь интересная нейросетка, обязательно соберу и для нее.
5 323
🐶 PetBreeder 1.1 🐱
Если (ну вдруг) у вас когда-либо возникало желание взглянуть на себя в облике пёселя или кошары, то сейчас появилась прекрасная возможность. Почему я это собрал? Дело в том, что я наткнулся на стайлгановские веса ffhq, дотюниные собачим и кошачим датасетами, которые дают весьма хорошие результаты и при этом «черты» лица человека (с входного изображения) сохраняются. Разве это не повод сделать что-нибудь забавное? Плюс сейчас такое время, когда в опенсорсе мало интересных проектов. В общем, по ссылке ниже можно генерировать как простое изображение своего психологического питомца, так и анимацию морфинга.
P.S. время удобства колаба медленно, но верно уходит. Возможно следующую нейронку соберу каким-нибудь градио, но не факт. Плюс хотел бы все-таки постить время от времени что-то новостное, обзорное, образовательное или тому подобное. А то канал пустует, а мне иногда есть что рассказать.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/PetBreeder.ipynb
5 323
📝Text2Image 5.0 Latent-Diffusion🎨
Чуть меньше недели назад в сети появился новый генератор картинок по тексту (LD). Он был без приувеличения прекрасен (благодаря новому подходу к диффузии), но лишь до тех пор, пока мир не узрел Dall-E 2. В тот момент все предыдущие генераторы стали меркнуть на фоне детищя OpenAI. Но коль поиграться нам не дают, будем довольствоваться тем, что есть. Тем более, при очивидных различиях, я бы не сказал, что они прям колосальные. Энивей с LD можно получить море фана, а именно за этим многие здесь и собрались. Запросы в колабе принимаются на множестве языков. Чем дополнить я не придумал, но и пройти стороной такое событие не мог.
P.S. Ку, ребят, не теряемся. Да, немного пропал, но честное слово, за 2 месяца ничего особо стоящего просто небыло, поэтому я и не публиковал посты. Канал бросать не планирую, но и вести его по расписанию не хочу. Прошу отнестись с понианием.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/Text2Image_v5.ipynb
5 323
🎙 DeepVoiceClone 📻
Как-то давно я уже публиковал у себя пару нейросетей по клонированию голоса, но с тех пор качество значительно возросло. Сейчас я поковырял парочку свежих сеток и выбрал текущего фаворита. Им стала зеро-шот моделька под названием YourTTS. Да, там не только с голоса, но и с текста можно делать перенос. Если вы выбираете текст, то имейте в виду, что нейросеть может транслировать только английский, французский и португальский языки. Есть даже вэб-версия, но там дополнительно накладывается закадровая музыка (думаю сами понимаете почему). Если хотите на других языках клонировать, то милости прошу в перенос с голоса на голос, который так же имеется в Колабе. Но свой текст надо стараться проговаривать интонацией того человека, кто будет его озвучивать. Результат генерируется быстро, но получается чуточку шумным, что легко фиксится, например сторонними нейронками.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/DeepVoiceClone.ipynb
5 323
🧔Обновленная модель генератора HD портретов 👩🦳
Недавно мы в neural.love выкатили новый генератор лиц по исходному изображению, который был анонсирован в одном из предыдущих постов. Точность значительно возросла, в сравнении со старой моделью, однако немного просела скорость. Теперь на вычисление тратится чуть больше времени, но оно того стоит. По окончанию работы можно будет либо сравнить изменения, двигая шторкой, либо просто забрать результат, который придет на email. Протестировать можно по ссылке ниже:
https://neural.love/portraits
5 323
💃 HomeStylist v.1.0 🕺
Сегодня выкатили нейросеть, которая может не только менять позу, но и переодевать человека на фотографии. Код есть, а Колаба не было. Я исправил это недоразумение. Сделал его удобным на столько, на сколько это вообще возможно, ибо чтобы завести эту нейросеть пришлось клонировать еще парочку, но оно того стоило. Качество синтезированного изображения на высоте. Разрешение, конечно, 512 по большей стороне, но те, кому нужно, прогонят дополнительно через какой-нибудь апскейлер.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/HomeStylist.ipynb
5 323
✍️ Text2Voxel v.1.0 👽
Наступил 2022 год и мне хотелось бы пожелать всем вам счастья, любви и благополучия. Я благодарен каждому кто проявляет интерес к моему труду. В новом году будем знакомиться с еще большим количеством интересных нейронок и собирать на них Колабы.
Сегодня мне хотелось бы поделиться Колабом, который по текстовому описанию генерирует воксельный объект. Двухмерные генерации стали трендом предыдущего года. Кто знает, может 3D будет трендом текущего. Внутри основного блока есть куча всяких переменных. Не хотелось усложнять интерфейс, но кому нужна тонкая настройка, тот может открыть код и подправить.
P.S. На видео процесс генерации новогодней елки.
https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/Text2Voxel.ipynb
