Мишин Лернинг 🇺🇦🇮🇱
Open in Telegram
Субъективный канал об искусстве машинного обучения, нейронных сетях и новостях из мира искусственного интеллекта.
Show more7 965
Subscribers
No data24 hours
-77 days
-4930 days
Posts Archive
7 965
🤷♀️ 20% подписчиков считают, что бункерный применит ядерное оружие
окей, пошёл работать дальше
7 965
☠️ Colab — Все!
Все мы любили колаб. Но увы, ничто не вечно под луной. И теперь можно купить или 100 или 500 compute units, что в переводе на бытовой означает, что колаб сдулся.
🪦 Царство небесное, вечн Йисгадал вэйискадаш шмэй рабо..
🤖 м и ш и н л е р н и н г
7 965
🥑 DreamFusion: Text-to-3D using 2D Diffusion от ?Google
Не успели мы насладиться Text2Video от MetaAI как выходит Text-To-3D диффузия.. Что за день..
Как работает? Это градиентный метод, основанный на Loss-функции, такой как DeepDream. По факту происходит оптимизация рандомно инициализированной 3D модельки (a Neural Radiance Field, or NeRF) через градиенты 2D диффузионных генераций.
То есть по факту, проворачивая такой трюк не нужно иметь 3D данных вообще!
Подробнее:
1) Рандомная фигура рендерится через NERF (плотность, освещение, цвет)
2) Этот изначальный бред (так как это начало) рендерится в 2D проекцию
3) Затем к картинке подмешивают шум, и все это подается на!!! внимание!! ИМАГЕН
4) После чего Имаген предсказывает необходимый денойз
5) Затем из пересказанного денойза вычитается подмешанный шум. и ВУАЛЯ! Дальше все дифференцируемо! Можно пускать градиенты обратно на 3D-модель
А то что у ребят был доступ к IMAGEN подталкивает меня на мысль, что это Google. Ну а так чем Тьюринг не шутит...
👉 https://dreamfusionpaper.github.io/
🤖 м и ш и н л е р н и н г
7 965
🦊 OpenAI открыло DALL•E 2 для всех желающих.
Смотрите, что стебель живогенерящий с людьми творит. Не без регистрации и смс конечно. Но зато бесплатно можно чуть генернуть.
🥁 регаться тут https://openai.com/dall-e-2/
7 965
🪗 Играй, Гармонь, да хуярь, чтоб погромче, руби, топор, да ебашь, чтоб пошире
Не успел мир получить Стебель Диффузии от CompVis, как вдруг откуда ни возьмись, появился Dance Diffusion от Гармоней (Harmonai). Гармони решили сделать диффузионный jukebox и опенсорснуть его миру.
Получится ли что-то кроме семплов, которые можно продавать или использовать для чего-то серьезного — вопрос. Умельцы из любого семпла сделают что угодно, и музыка будет топ. Но вот вопрос даст ли нейросеть новую палитру, как это было с Text2Image в визуальном искусстве?
Кроме заявлений, что «это не просто очередной семпл, а семпл прям из инференса нейросети, слушай этот трек, качай этот трек, там семпл то нейронный», хотелось бы иметь именно контроль над генерацией. Я бы хотел видеть глубокое понимание, низкое количество шума (если того не требуется) и возможности модульного синтезатора с огромным количеством крутилок. И пускай это будут не очередные: vcf, lfo и adsr кривые поверх семпла, а именно параметры генерации. Например: «звук извлечённый смычком по нескольким струнам открытого рояля, который ломается в конце семпла и слышит треск дерева» -cfg 9, -seed 42, -time 10s… Ну что, сечтать не вредно..
Ждёте ли вы аудио диффузию?
🎥 видоисик с Глав Гармонем
🪗 wandb blog гармоней
7 965
🪖 Стебель Диффузии добрался и до Юли
Листаю ютуб, а там такая обложка к могилизации. Рад, что Юле зашло.
Прогресс и ИИ уже не остановить. Генерации действительно повсеместно иллюстрации.
7 965
🫦 OpenAI обучили и опенсорснули трансформер Whisper для распознавания речи
TL;DR >>> OpenAI обучили и выложили нейронную сеть 🫦 Whisper, которая приближается к человеческому уровню распознавания английской речи. 🫦 Whisper обучен на 680,000 часах мультиязычном детасете, собранным из интеренета.
Такой огромный датасет позволил получить модель, устойчивую к разным акцентам, фоновому шуму, и понимающую технический язык. Кроме того, модель может не просто траскрибировать иностранную речь, а сразу переводить на английский язык!
🦾 Архитектура Whisper
1) Аудио семплы разбиваются на чанки по 30 секунд, которые преобразуются log-Mel спектрограмму
2) Затем спектрограмма обрабатывается двумя блоками 1D сверток c GELU активациями к которым добавляются тригонометрические тайм-эмбеддинги
3) Затем все это добро подается в энкодер-декодер трансформер. Декодер же в свою очередь начинает транскрипцию после пары служебных токенов, отвечающих за язык семпла, время, и выбор задачи (перевод на английский или оригинальная траскрипция).
📇 Blog пост от OpenAI
📄 paper Whisper
💻 Код
🤗 Model Card
p.s.: В свете опенсорса stable diffusion, OpenAI решили прикунуться чуть-чуть open. Но не стоит питать иллюзий по поводу GPT-4
🤖 м и ш и н л е р н и н г
