я обучала одну модель
Open in Telegram
Shitposting on various subjects PS рекламы в канале нет
Show more4 529
Subscribers
No data24 hours
-57 days
-2930 days
Posts Archive
Состояние генерации музыки на 2023 (пока влезает на один скриншот)
https://github.com/archinetai/audio-ai-timeline
you know it’s a big deal when lucidrains creates a repo
https://github.com/lucidrains/musiclm-pytorch
Гугл выпустил какую-то по счету Text-to-Music модель MusicLM
Принципиальных отличий там несколько:
1. Взяли CLIP-подобную модель MuLan, где общее эмбеддинговое пространство между текстом и аудо-треками
2. Стали генерировать иерархически – на инференсе переводят текст в аудио-токены через эту модель MuLan, с помощью них получают семантические токены (можно о них думать как о маппинге между аудио-токенами и их семантикой), и потом они вместе обуславливают генерацию финальных акустических токенов
3. Выпустили видимо первый бенчмарк в этой области, где 5.5k треков были вручную размечены живыми (!) музыкантами
Понравилось их демо – во-первых, можно очень сильно изощряться в описании треков (как на скрине). Во-вторых, можно генерировать музыку по описанию картин из Википедии (для совсем эстетов). В-третьих, там можно полушать как звучит accordion rap и accordion death metal
https://google-research.github.io/seanet/musiclm/examples/
Когда-то у меня в коментах спрашивали, можно ли попросить LLM наскрейпить что-то с сайта и использовать эту инфу. И вот сегодня нашла демку, где ChatGPT можно попросить написать и прогнать код для selenium (работает все снова на LangChainAI)
Хочется, чтобы это еще могло сложную серию запросов выполнять и сохранять промежуточные результаты как объекты 🤔
Еще одно направление, набирающее актуальность на фоне взлета языковых моделей, – как заставить их пользоваться внешними инструментами и/или внешними данными при генерации. Вот тут я уже писала про LangChainAI (я кстати уверена, что это очень недооцененный пока фреймворк, который должен взлететь), которые позволяют оффлоудить некоторые задачи, которые необходимы для нахождения ответа. Например, языковая модель может сама посмотреть что-то в Википедии, что-то посчитать в питоньем скрипте, можно и стекать эти операции, чтобы получить достаточно сложное поведение агента
Теперь сделали еще и либу GPT Index, которая позволяет модель легко использовать какие-то внешние мультимодальные (!) данные. Можно считать массив текстов и использовать его как долгосрочную память для чатбота. Или сделать из этого базу знаний для QA-системы. Можно распарсить текст с фотографий – вот тут например модель получает инфу с фотографии чека, и может ответить на вопросы по его содержанию (раньше для такого нужна была бы мультимодальная модель типа Flamingo). Можно парсить презентации, pdf, можно парсить Твиттер, Notion и Слэк, можно парсить аудио и видео даже!
По сути можно создать базу данных из чего угодно и оправлять к ней запросы в natural language, плюс, снимаются ограничения, наложенные размером контекстного окна модели. А еще это может помочь модели меньше галлюцинировать факты, раз их нужно не сгенерить, а просто найти
И интеграция с LangChainAI у них тоже есть, чтобы можно было эмулировать сложную последовательность работы с данными
А на хакатоне Scale AI (очень много AI на один пост) недавнем уже набросали поверх GPT Index тулзу, чтобы можно было передавать GPT большие папиры и потом вместе с ней их обсуждать и задавать по ним вопросы (видео собственно с ней)
Все уже много раз написали, что сейчас развернется настоящая гонка между развитием генеративных сетей и алгоритмов, которые детектят сгенерированный контент. Буквально вчера вышла первая (из тех, что я видела) статья на этот счет конкретно в домене генерации языка – A Watermark for Large Language Models
Для решения задачи авторы предлагают добавлять в генерацию модели сигнал, который не может быть считан людьми, но при этом позволяет алгоритмически определить текст как синтетический. Пока это достаточно простой алгоритм:
1. Генерируем авторегрессивно токены как обычно t-1
2. Берем токен t и для него с заранее заданной хеш-функцией генерим хеш. Используем его как сид для генерации случайного числа
3. По случайному числу разбиваем словарь модели для whilelist и blacklist. Для слов из whitelist докидываем заданную константу в векторе с вероятностями, чтобы повысить шанс их сгенерировать
Потом это поведение модели можно воспроизвести, если знать хеш-функцию. И посчитать вероятность, что в последовательности встретится n слов из whiltelist’а, чтобы понять, насколько возможно, что так случайно действительно написал человек, а не сгенерировала модель
Понятно что это только первые шаги в таком направлении, и думаю дальше будет круче, легковеснее, робастнее и так далее, но прикольно, что такие работы начали появляться настолько быстро после ChatGPT
В целом статья кажется мне очень качественной и продуманной, adversarial attacks они тоже разбирают, и особенно любителям матстата зайдет
Наконец-то кто-то сделал сайт, который давно напрашивался, а именно обновляемый сборник всяких AI инструментов, разбитый по тегам (чтобы не приходилось вам самим шерстить продактхант)
https://favird.com/l/ai-tools-and-applications
Repost from DL in NLP
Deep Learning был одним из немногих источников хороших новостей в 2022 году, поэтому хотелось составить список статей которые запомнились и сильно на меня повлияли (лучше поздно чем никогда):
1. Latent Diffusion — он же Stable Diffusion, который сделал text2image доступным для обычных людей
1. OPT: Open Pre-trained Transformer — неожиданный и очень приятный релиз целой линейки 0.1B-175B языковых моделей от фейсбука (пост)
1. 🌸 BLOOM — результат работы BigScience, показавший, что DL сообщество может коллабораровать at scale (пост)
1. 8-bit Matrix Multiplication for Transformers at Scale — квантизованные трансформеры которые позволяют впихать невпихуемое и комфортно рабоать с 15B моделями на одной 3090. Абсолютный game changer для меня и для всей индустрии.
1. 🦩 Flamingo — статья которая показала что склеивать замороженые предтренированные модели это хорошо, а также дала рецепт к огромным мультимодальным датасетам через использование структуры HTML.
1. LAION-5B — image-text датасет примерно бесконечного размера. Думаю мы увидим много интересных статей на его основе в 2023.
Демократизация больших моделей была сильным трендом, мы получили не одну а две 175B+ оперсонсных модели. И с помощью int8 обычные рисёчеры даже могут инферить их на одной машине с ~8GPU. Или даже не своей картошке с помощью petals.
Добавим в список ещё пару менее попсовых статей:
1. Training a Helpful and Harmless Assistant with RLHF — предвесник ChatGPT от Anthropic который остался незаслуженно незамеченым
1. Simple Local Attentions Remain Competitive for Long-Context Tasks — мы либо всё ещё не придумали хороший long attention, либо ничего лучше local window + a few global tokens и не надо (пост)
Кроме этого я был приятно удивлён Neural Networks: Zero to Hero от Andrej Karpathy, очень рекомендую.
И воспользуясь случаем сделаю shameless plug моих статей, вдруг кому будет интересно:
1. Large scale probing of pre-trained langauge models
1. Learning to Ask Like a Physician
1. Pseudolabeling for video captioning pre-training works better than existing video-text datasets
Repost from настенька и графики
PivotTableJS – библиотека для быстрого исследования данных в Jupyter Notebook. Все с drag-n-drop, дата саентисты советуют.
А вот и логичное продолжение идеи про реконструкцию изображений по мозговой активности, про которую тут давно был пост. Раньше брали сканы ЭЭГ, получали эмбеддинг с помощью LSTM и разворачивали его в картинку с помощью convolutional сетки, а теперь для декодинга картинки используют диффьюжн модель
https://t.me/abstractDL/176
А вот и логичное продолжение идеи про реконструкцию изображений по мозговой активности – раньше брали сканы ЭЭГ, получали эмбеддинг с помощью LSTM и разворачивали его в картинку с помощью convolutional сетки, а теперь для декодинга картинки используют диффьюжн модель
https://t.me/abstractDL/176
Еще одно из внезапных умений новой Midjourney V4 – очень крутой пиксель-арт
Новый крутой пейпер про дистилляцию RL-алгоритмов от DeepMind. Их Algorithm Distillation позволяет модели во время инференса улучшать свою стратегию решения, самостоятельно исследовать окружающий мир, и это без промтинга и без файнтюна под конкретную задачу. И в целом генерализация гораздо выше, чем у предыдущих методов
Попыток скрестить RL и трансформеры уже было достаточно (например, Gato и Decision Transformer), но это не RL в полном смысле слова. Такие модели могут предсказывать следующее действие актора, но для этого им нужен промт с предыдущими состояниями, действиями и reward’ами, сами они не могут в explore and explit, а также они не могут самостоятельно обучиться под новые задачи. Также они учатся сразу на лучшей стратегии, поэтому не могут ее сами итеративно улучшать на инференсе
Для обучения Algorithm Distillation брали learning histories RL-алгоритмов (например, DQN) на отдельных задачах. При чем, историю делали достаточно длинной, чтобы в нее попадало несколько эпизодов, и можно было пронаблюдать, как улучшается стратагия –> благодаря этому, AD учится не только предсказывать текущую стратегию, но и сразу улучшенную. Что прикольно, в некоторых задачах был еще и partial observation, то есть когда передается не все состояние игры, а только какая-то его часть, известная игроку
На инференсе AD находит лучшую стратегию даже быстрее, чем исходные алгоритмы, которые были дистилированны (!), сам исследует пространство и сам генерирует себе контекст. Способность исследовать, кстати, оценивали на задаче Dark Room, где большая часть действий и состояний дают reward = 0, то есть без исследования решить ее не получится
📝 Тред от одного из авторов про модель
