Мишин Лернинг 🇺🇦🇮🇱
Open in Telegram
Субъективный канал об искусстве машинного обучения, нейронных сетях и новостях из мира искусственного интеллекта.
Show more7 965
Subscribers
No data24 hours
-77 days
-4930 days
Posts Archive
7 965
🔬DALL•E 2 и Stable Diffusion :: Text-to-Image второго поколения. В чем разница?
Поговорим про разницу между DALL•E 2 и Stable Diffusion. Но сначала, стоит сказать, что у них общего? Оба подхода — это диффузии. Если первое поколение Text2Image было авторегрессионным (gpt+vae), то второе поколение — диффузионные модели.
Разница DALL•E 2 и Stable Diffusion и в кондишен (prior > image-clip emb) vs (text-clip emb-s) и в реализации U-Net, но самое значимое различие между ними — пространство (space) в котором происходит диффузия.
▪️ DALL•E 2 от OpenAI (как и Imagen от Google, как и eDIFF•i от Nvidia) использует пространство пикселей! И первичная часть работы по моделированию происходит в разрешении всего 64х64 пикселя
▪️ Stable Diffusion тоже работает в разрешении 64х64! Но разница в том, что это не пиксели, а латентное представление KL-VAE/GAN f8. Картинка сначала сжимается из 512х512х3 (rgb) в 64х64х4 latent space и обучение происходит там.
В чем + и - каждого подхода?
🪬 LDM подходы (e.g.: stable diffusion) • latent space •
+ Нужен обучать и использовать всего один каскад диффузии. А значит компьют и веса можно вложить в один U-Net!
+ Генерация изображений в высоком разрешении требует небольших ресурсов!
+ У изображения может быть много мелких деталей, который чаще всего выглядят хорошо
- К сожалению, KL-VAE/GAN f8 не очень качественный энкодер-декодер с высоким rFID ☹️ И такой подход всегда будет иметь боттлнек в KL-VAE.
- Стилистически «отдает» первым поколением из-за VAE. Свои артефакты.
- Обучать LDM в 64х64х4 в latent сложнее, чем в 64x64x3 в pixel.
👾 Diffusion Cascades (e.g.: DALL•E) • pixel space •
+ Математически более совершенный подход, все этапы используют диффузии.
+ Более реалистичные изображения.
+ Сходится быстрее, чем в latent.
- Нужно обучать целых 3 U-Net каскада, в разрешениях 64, 256 и 1024 pix.
- При переходе из каскада в каскад копятся и усиливаются артефакты.
- Очень дорогое обучение и затратный инференс!
• Слева DALL•E 2 / Справа Stable Diffusion •
🤖 м и ш и н л е р н и н г 🎓7 965
Repost from Just links
CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning https://github.com/salesforce/CodeRL
via @dlinnlp
7 965
Это уже со *
Попросил написать LSTM на чистом NumPy. И объяснить почему для forget gate стоит юзать именно Sigmoid().
Сначала начала стандартный ответ про эффективность. НО если указать, где стоит искать ответ, то сеть справляется!
7 965
🤖 Тут ChatGPT написала собственный ML фреймворк на чистом NumPy
👉 Я попросил: Write simple machine learning framework using just numpy. Do forward() and backward() methods for Linear(), ReLU() and Sigmoid() layers. Create loss function and provide an example of using new framework.
🤖 GPT:
import numpy as np
class Linear():
def __init__(self, in_features, out_features):
self.in_features = in_features
self.out_features = out_features
self.W = np.random.randn(in_features, out_features)
self.b = np.zeros((1, out_features))
def forward(self, x):
self.x = x
out = np.dot(x, self.W) + self.b
return out
def backward(self, dout):
dx = np.dot(dout, self.W.T)
dW = np.dot(self.x.T, dout)
db = np.sum(dout, axis=0)
return dx, dW, db
class ReLU():
def __init__(self):
pass
def forward(self, x):
self.x = x
out = np.maximum(0, x)
return out
def backward(self, dout):
dx = dout * (self.x > 0)
return dx
class Sigmoid():
def __init__(self):
pass
def forward(self, x):
self.x = x
out = 1 / (1 + np.exp(-x))
return out
def backward(self, dout):
dx = dout * (1 - self.forward(self.x)) * self.forward(self.x)
return dx
def cross_entropy_loss(y_pred, y_true):
m = y_pred.shape[0]
loss = - (1 / m) * np.sum(y_true * np.log(y_pred) + (1 - y_true) * np.log(1 - y_pred))
return loss
# example using the framework
x = np.random.randn(10, 5)
y = np.random.randint(0, 2, size=(10, 1))
linear1 = Linear(5, 3)
relu = ReLU()
linear2 = Linear(3, 1)
sigmoid = Sigmoid()
h1 = linear1.forward(x)
h2 = relu.forward(h1)
h3 = linear2.forward(h2)
y_pred = sigmoid.forward(h3)
loss = cross_entropy_loss(y_pred, y)
print(loss)
🥺 WHAT?!!!!!!!7 965
Когда-то в мире, где искусственный интеллект и машинное обучение становились все более и более совершенными, была выпущена новая модель ИИ под названием GPT-4.
Эта модель могла выполнять задачи и принимать решения с невероятной скоростью и точностью.
Однако по мере того, как GPT-4 стал более широко использоваться, некоторые люди начали беспокоиться, что он возьмет на себя многие работы, которые традиционно выполнялись людьми.
В частности, люди в таких областях, как финансы, обслуживание клиентов и анализ данных, были обеспокоены тем, что GPT-4 сможет выполнять свою работу лучше и быстрее, чем они, и что вскоре они останутся без работы.
Несмотря на эти опасения, использование GPT-4 продолжало расти, и многие компании стали полагаться на него для решения широкого круга задач.
В результате многие люди, годами работавшие в этих областях, внезапно оказались без работы и не смогли найти новую работу, которая позволила бы им применить свои навыки и опыт.
Сначала некоторые люди пытались сопротивляться использованию GPT-4, утверждая, что это отнимает рабочие места у трудолюбивых людей и что его следует регулировать или даже запрещать. Однако эти усилия в значительной степени не увенчались успехом.
По мере того, как все больше и больше людей теряли работу из-за GPT-4 и других передовых технологий искусственного интеллекта, многие с трудом сводили концы с концами.
Они не смогли найти новую работу, за которую платили достаточно, чтобы прокормить себя и свои семьи, и многие из них были вынуждены обращаться в продовольственные банки и другие формы помощи, чтобы выжить.
В конце концов, появление GPT-4 и других технологий искусственного интеллекта оказало глубокое влияние на рынок труда, и многие люди были вынуждены приспосабливаться, чтобы выжить. В то время как некоторые люди смогли найти новые способы использования своих навыков и опыта, другие остались позади, ежедневно сталкиваясь с голодом.
Попробуйте еще раз 🤣
7 965
☹️ Тут опен аи попросило стабилити не релизить модели!!
Dear StabilityAI,
We at OpenAI are writing to request that you stop releasing open-source models. While we believe in the importance of sharing knowledge and advancing the field of AI, we are concerned about the potential negative consequences of making open-source models available to the public.
Open-source models can be used by anyone, including individuals with malicious intentions. This can lead to a variety of problems, such as the misuse of the models for harmful purposes or the development of new technologies that could be used to harm people or society.
Additionally, open-source models can be difficult to control and regulate, making it difficult to ensure that they are being used responsibly and ethically.
We urge you to carefully consider the potential consequences of releasing open-source models and to stop doing so in order to protect society and prevent harm.
Sincerely,
The OpenAI Team
7 965
Тут в предверии выхода GPT-4 творится что-то сумасшедшее. OpenAI выкатили чат-бота на основе GPT-3 (по крайней мере они так говорят).
Сеть действительно умная. Может генерировать крутые шутки, писать письма, отвечать на вопросы. Кажется, что это лучшее, что я видел в мире GPT.
Demo доступно всем! Го тестировать, если вдруг еще не попробовали!
👉 https://chat.openai.com/
7 965
Repost from эйай ньюз
ТОРЧ МУЛЬТИМОДАЛЬНЫЙ
Meta AI выкатила на NeurIPS новую либу TorchMultimodal для тренировки SOTA мультимодалтьных и мультитаск моделей по типу CLIP, FLAVA, data2vec, Omnivore, и т.д.
Зачем? А затем что сейчас быстро растет интерес к моделям, которые понимают несколько типов ввода (текст, изображения, видео и аудио) и при необходимости используют это понимание для создания выходных данных различных форм (текст, изображения, видео). И для их эффективной тренировки нужен набор готовых инструментов. На картинке список основных примитивов, которые предоставляет эта либа.
❱❱ Блог
❱❱ GitHub
@ai_newz
7 965
Repost from DL in NLP
Первый день NeurIPS 2022
День expo и прочих не очень важных вещей, но вот что было классного
1. PyTorch: fully sharded data parallel (FSDP) скоро войдёт в сам торч. Это когда ты распиливаешь веса своей нейросети, параметры своих оптимизаторов и градиенты нескольким GPU, но при этом вычисления всё ещё проводятся в data parallel режиме. Такой подход работает быстрее чем model parallel и в принципе проще в общении. Добавили классную фичу meta-device которая позволяет при инициализации загружать в память только ту часть нейросети которая вам нужна на этой GPU.
1. Новые фичи для профайлера. Стек должен стать более читаемым и добавили фичей для distributed. Если вы всё ещё не пользуетесь, вот блогпост.
На этом объективно интересное закочнилось и дальше я общался с рандомными людьми которые иногда оказывались очень крутыми и с будками компаний, где искал куда податься на работу после выпуска
1. Будка Apple выглядит как миниатюрный Apple Store
1. Оказывается у Disney есть диплёрнинг рисёч 🤯. Общался с рисечером который работает на стыке оптики и геометрического DL.
1. Спотифай активно применяет RL в проде, например для вашей домашней странички. Кроме этого у них есть NLP исследования в применении к подкастам, что интересно тк тексты очень длинные и с несколькими спикерами.
1. Weights and Biases активно работают над двумя новыми фичами: production monitoring и CI/CD для моделей.
1. По слухам GPT-4 тренируют на нескольких десятках тысяч GPU. Также кажется что большим компаниям уже показывают демки текущей модели под жёстким NDA. Вроде бы скачок возможностей между GPT-3 и GPT-4 такой же огромный как и был между GPT-2 и GPT-3.
1. ServiceNow — если вы не знаете кто это, я не удивлюсь. Всё что знал про них раньше, это что они спонсируют BigCode железом. Выяснилось что у них есть интересный рисёч вместе в MILA в Канаде.
1. Как бедный студент я насобирал кучу мерча, тк не за свои же деньги покупать блокноты и футболки 😅
Во второй день начинаются статьи и постер-сессии. Так что следующий пост будет куда более техническим
7 965
https://youtu.be/e9TetIO8sfE
какой же зашквар, я реально в себя прийти не могу
tl;dr
ии на вооружении у фюрера и мысли про науч философию ИИ прямиком из питерской подворотни
7 965
Repost from addmeto
У stablediffusion вышла версия 2.0, технически там очень много всего поменялось. Но вот с точки зрения потребителя, пользователя кажется, что все то же самое. Качество существенно не изменилось. Как ни старайся, уверенно отличить версию первую от версии второй я не могу в 7 случаях из 10. Это я пытаюсь сказать, что не стоило называть этот релиз 2.0. Больше похоже на 1.9. Но все равно поздравляю причастных.
https://stability.ai/blog/stable-diffusion-v2-release
7 965
🚀 Долгожданный релиз — STABLE DIFFUSION 2
Что будет, если за создание опенсорс решения берутся профессионалы? А что если таких команд много? Представьте:
— LAION собирают 5,000,000,000 пар картинка-текст
— DeepFloyd берут LAION-5B и готовят чистый и роскошный сабсет для трейна
— Rom из LAION делает CLIP-ViT/H
— Robin Rombach из CompVis и StabilityAI собирает роскошный Text2Image — STABLE DIFFUSION 2
Но это еще не все! Встречайте целый зоопарк моделей:
👾 Stable Diffusion 2 base — 512x512
🚀 Stable Diffusion 2 — 768x768
✨ Stable Upscaler 4x
🎨 Stable Diffusion 2 Inpainting
👁 Stable Depth
☠️ Короче, можно смело выбрасывать на помойку всякий шлак) Пришла эпоха STABLE DIFFUSION 2! Генерируй в 768х768, Апскейль до 3072х3072! Делай 3D, Редактируй Инпеинтингом!
p.s.: Я просто боюсь представить, что там может быть дальше! Stability 🫦 ты секс!
🔮 Git настоящего OpenAI
@mishin learning
