ch
Feedback
shonenkov AI

shonenkov AI

前往频道在 Telegram

🎨 + 🤖 + 👨‍🎨 = 🖼 Kaggle GM, author of models IF, ruDALLE (Malevich, Emojich, Kandinsky-1.0), ruDOLPH, ruCLIP. Graduated from MIPT. Working with StabilityAI. https://linktr.ee/shonenkovAI

显示更多
未指定国家技术与应用21 015
4 558
订阅者
无数据24 小时
无数据7 天
无数据30 天

数据加载中...

相似频道
无数据
有任何问题?请刷新页面或联系我们的客服
标签云
无数据
有任何问题?请刷新页面或联系我们的客服
进出提及
---
---
---
---
---
---
吸引订阅者
八月 '24
八月 '24
+4
在0个频道中
七月 '24
+6
在0个频道中
Get PRO
六月 '24
+3
在0个频道中
Get PRO
五月 '24
+7
在0个频道中
Get PRO
四月 '24
+13
在0个频道中
Get PRO
三月 '24
+10
在0个频道中
Get PRO
二月 '24
+7
在0个频道中
Get PRO
一月 '24
+6
在0个频道中
Get PRO
十二月 '23
+42
在0个频道中
Get PRO
十一月 '23
+65
在0个频道中
Get PRO
十月 '23
+69
在0个频道中
Get PRO
九月 '23
+77
在0个频道中
Get PRO
八月 '23
+127
在0个频道中
Get PRO
七月 '23
+38
在0个频道中
Get PRO
六月 '23
+70
在0个频道中
Get PRO
五月 '23
+298
在0个频道中
Get PRO
四月 '23
+164
在0个频道中
Get PRO
三月 '23
+124
在0个频道中
Get PRO
二月 '23
+332
在0个频道中
Get PRO
一月 '23
+259
在0个频道中
Get PRO
十二月 '22
+170
在0个频道中
Get PRO
十一月 '22
+187
在0个频道中
Get PRO
十月 '22
+293
在0个频道中
Get PRO
九月 '22
+399
在0个频道中
Get PRO
八月 '22
+951
在0个频道中
Get PRO
七月 '22
+1 043
在0个频道中
Get PRO
六月 '22
+1 905
在0个频道中
Get PRO
五月 '22
+390
在0个频道中
日期
订阅者增长
提及
频道
06 八月+3
05 八月0
04 八月0
03 八月+1
02 八月0
01 八月0
频道帖子

2
🦔 OpenAI обучили DALL-E 3 Сложно назвать это релизом, скорее просто неплохая модель, работающая в связке с GPT-4. Мне лично
🦔 OpenAI обучили DALL-E 3 Сложно назвать это релизом, скорее просто неплохая модель, работающая в связке с GPT-4. Мне лично кажется, что следующий Stable Diffusion будет куда умнее и интереснее эстетической точки зрения. 2021 DALL-E 1 — 12B модель, пейпер / API нет 2021 GLIDE — 2B модель, пейпер + опенсорс 300M модели 2022 DALL-E 2 — 2B модель, пейпер unCLIP + API 2023 DALL-E 3 — Хрен пойми что это, но будет интеграция с GPT-4 для подписчиков ChatGPT+ Про DALL-E 3 на сайте OpenAI
4 993
3
Релизнулась SOTA библиотека для генерации аудио AudioCraft v1.0.0 Я писал раньше о выходе начальной версии AudioCraft, когда
Релизнулась SOTA библиотека для генерации аудио AudioCraft v1.0.0 Я писал раньше о выходе начальной версии AudioCraft, когда Meta AI опубликовали статью MusicGen для генерации музыки по тексту. Почему новый релиз интересен? Это стабильный релиз и в него добавили код для трениновки моделей, в том числе несколько новых: - EnCodec - по сути квантизованый автоэнкодер (VQGAN), который сжимает аудио в серию дискретных токенов. - AudioGen - генерит по тексту повседневные звуки, типа лая собаки и прочих звуковых эффектов (кроме музыки). - MusicGen - text2music и midi2musiс синтез. Есть модели от 300M до 3.3B параметров. На 16Gb влезут. - MultiBandDiffusion - новый декодер, основанный на диффузии, который декодирует токены MusicGen в аудио дорожку. Лучше чем EnCodec. (Ждите серию постов про каждую из этих моделей) Еще добавлены веса AudioGen и MultiBandDiffusion. 🔥А теперь представьте, использование этих моделей при монтировании роликов для ютуба. Блог Код и веса Демо в колабе MusicGen ноутбук @ai_newz
6 008
4
В честь 3000 подписчиков расскажу про наш новый препринт, в котором тексты, сгенерированные ChatGPT, детектируются с помощью анализа их внутренней размерности: https://arxiv.org/abs/2306.04723 Итак, здесь мои коллеги и я продолжили заниматься полюбившейся с 2021 года темой - детекцией сгенерированного контента. Особое внимание, конечно, уделили детекции текста, сгенерированного моделями семейства GPT-3.5 (davinci, chatgpt). А делали мы это с помощью такой интересной штуки, как дробная размерность. Первое знакомство с ней можно осуществить, посмотрев видео 3blue1brown: https://www.youtube.com/watch?v=gB9n2gHsHN4 (рассказ про размерность начинается со второй половины видео). Хоть введенная в видео размерность и называется "фрактальной", на деле можно получать приближенные оценки такой размерности не только для фракталов, но и просто для облаков точек, если формы облаков достаточно сложные. И вот возник вопрос: а почему бы не построить облако точек по тексту на естественном языке и не посмотреть, какой будет его размерность? Далее последовательность действий была такая: 1) Брался достаточно длинный текст (написанный человеком либо сгенерированный ChatGPT/другой моделью) с большим количеством токенов; 2) Текст подавался на вход модели RoBERTa; 3) С последнего слоя RoBERTы извлекались эмбеддинги каждого токена текста; 4) Эти эмбеддинги рассматривались как точки в многомерном пространстве - получалось облако точек; 5) С помощью нескольких довольно технически сложных процедур ( вдохновленных https://arxiv.org/abs/1808.01079 ) оценивалась дробная размерность этого облака точек. Таким образом, каждому тексту сопоставлялось число - эта самая размерность. И - о чудо! - оказывалось, что средняя размерность текстов, сгенерированных с помощью GPT-3.5 (ChatGPT или davinci), была в среднем существенно меньше, чем размерность текстов, написанных человеком. Эта средняя размерность практически не менялась при смене домена и при замене GPT-3.5 на large GPT-2 или OPT (со стандартными параметрами генерации); даже при применении парафразера DIPPER, специально созданного для избегания детекции, размерность менялась не сильно - в среднем примерно на 3%. Благодаря этому нам удалось сделать пороговый детектор по этой размерности, неожиданно устойчивый к атакам. Теперь любители генерировать тексты могут менять промпты, тематику или даже модель, но наш детектор не проведешь! 😈 При смене домена и модели точность детекции (true positive) по один раз зафиксированному порогу не опускалась ниже 75% при условии, что false positive rate (FPR) оставался не более 1%. При применении DIPPER к генерации GPT-3.5 точность падала до 40%, снова при FPR 1%. Но даже этот результат оказался лучше всех остальных существующих детекторов - в том числе, и от самих OpenAI. 🫡 (Пояснение: мы зафиксировали низкий FPR потому что хотели как можно меньше дискриминировать настоящих людей при детекции). Кроме прочего, при использовании мультиязычной RoBERTы можно было получать аналогичный детектор не только для английского, но и для других языков. Средняя внутренняя размерность эмбеддингов, соответствующих текстам на других языках, менялась от языка к языку, но размерность искусственных текстов все равно оставалась в среднем ниже, чем человеческих, для каждого конкретного языка по отдельности. Главной же слабостью нашего детектора является неустойчивость к большим температурам генерации и к примитивным генераторным моделям. У генераторов с высокой температурой (так сказать, бредящих) внутренняя размерность текстов может быть и выше человеческой, поэтому на них этот детектор сломается. С другой стороны, такие генераторы и так детектятся другими методами. Также остается открытым вопрос, является ли RoBERTa оптимальным средством для извлечения эмбеддингов текстов, ведь их можно получать и с помощью других моделей тоже. #объяснения_статей
5 881
5
3D с DeepFloyd-IF выглядит неплохо, модель справилась с рендерингом и генерацией текста на кепке 👀 если вдруг кому-то интере
3D с DeepFloyd-IF выглядит неплохо, модель справилась с рендерингом и генерацией текста на кепке 👀 если вдруг кому-то интересно потыкать, то вот [GitHub с реализацией IF и 3D] + в комменты закинул еще несколько 3D анимаций @shonenkovAI
14 630
6
пока что не понял за счет чего, но выглядит так, будто pyTorch-2.1 на А100 ускорил SD модели x2.5, а IF-I-M x5.0 в имплемента
пока что не понял за счет чего, но выглядит так, будто pyTorch-2.1 на А100 ускорил SD модели x2.5, а IF-I-M x5.0 в имплементации Diffusers 🚀 уже встроили в gradio-demo, вот pull-request; "This PR should speed-up IF stage1 by roughly 30% and stage2 and 3 by roughly 20%" [Demo] | [GitHub] | [DeepFloyd IF]
6 946
7
没有文字...
6 540
8
опа, уже обзорчик на ютубе 🍿 https://www.youtube.com/watch?v=4Zkipll5Rjc
6 238
9
没有文字...
5 075
10
+1
没有文字...
4 315
11
没有文字...
1
12
👾 Мы DeepFloyd (Research AI Lab at StabilityAI) зарелизили лучшую Text-to-Image модель DeepFloyd IF DeepFloyd IF это новая к
👾 Мы DeepFloyd (Research AI Lab at StabilityAI) зарелизили лучшую Text-to-Image модель DeepFloyd IF DeepFloyd IF это новая каскадная диффузионная модель основанная на идеи Imagen от Google: — Текст кодируется T5 XXL v1.1 — Далее интерпретируется в пиксели через IF-I-XL (4.3B UNet), генерирующий изображения в 64х64 — IF-II-L (1.2B кастомный Optimal UNet) апскелит изображения 64х64 в 256х256, используя T5 — Для финальной картинки в 1024х1024, благодаря модульному подходу, можно использовать IF-III-L (пока не опенсорснут) или Stable x4 Благодаря тому, что: — Модель параметризирована сильнее чем GLIDE, DALL-E 2, Imagen, eDiff-I: 2B против 4.3B у DeepFloyd IF — Апскейлеры больше и имеют более оптимальную архитектуру в сравнение с Image и DALL-E 2 🏆 DeepFloyd IF выбивает Zero-Shot COCO@30K SOTA, тем самым являсь лучшей Text-to-Image моделью не только в опен-сорсе, но и вообще! 💻 Сайт лабы DeepFloyd 🤖 Страница нейроки DeepFloyd IF 👽 DeepFloyd Дискорд 🖥 GitHub 🤗 HuggingFace 👾 Генерить тут: Demo 👈
3 708
13
ГО тыкать IF? 👀 https://github.com/deep-floyd/IF
3 759
14
good morning my deer owls!
good morning my deer owls!
3 943
15
⚡️ Our Astronomy Domine (Daria) and Interstellar Overdrive (Misha) shed light on the DeepFloyd IF's architecture and performance at the Weights & Biases MLOps virtual conference, Fully Connected 2023. IF LARGE TEXT-TO-IMAGE MODELS WERE OPEN-SOURCE, Fully Connected 2023 (YouTube)
4 932
16
что из мультимодального полезнее развивать [April 2023]?
6 573
17
没有文字...
1 998
18
没有文字...
2 059
19
没有文字...
2 435
20
Экспериментируя с моделью #DeepFloyd (которая, напоминаю, умеет в текст) я подумал: “Блин, это же отличный инструмент для Lyr
Экспериментируя с моделью #DeepFloyd (которая, напоминаю, умеет в текст) я подумал: “Блин, это же отличный инструмент для Lyric video!”. И сделал тест — первый куплет The Smiths - There Is a Light That Never Goes Out. Хотел передать ощущение от трека, когда едешь немного пьяненький (как пассажир) в машине и засматриваешься на вывески и огни ночного города. Ссылка на ютуб, если вдруг хотите пошерить со знакомым клипмейкером вне Телеграма.
1 228