ch
Feedback
Приближаем сингулярность

Приближаем сингулярность

前往频道在 Telegram

Про AI, стартапы, и не только По всем вопросам писать @leshanbog

显示更多
933
订阅者
无数据24 小时
无数据7 天
无数据30 天
帖子存档
Пока Сэм Альтман собирает пару триллоинов долларов на революцию в области полупроводников, самое время разобраться в работе CPU, GPU и прочих железок. Очень крутые и понятные блогпосты для широкой аудитории: CPU, GPU, ASICs. Помимо базы, которая очень кайфого изложена - с аналогиями и примерами, есть и про - Power - Performance - Area трейдофф при дизайне чипов - Мера энергоэффективности чипа (performance per watt) - главная метрика - Power и Efficiency ядра в процессорах - Фундаментальное отличие CPU и GPU - ... Если не до конца ясно, как основной ботлнек на практике в Deep Learning'е может быть не в вычислениях, а в доступе к памяти (для меня это было удивительно, когда узнал :D, про это я ещё упоминал здесь), то прочтение этих блогпостов поможет осознать) 🟢

Простой хак, чтобы выжать больше качества из Instruct-based LLM Все ещё в ожидании, когда промпт инжиниринг перестанет быть а
+2
Простой хак, чтобы выжать больше качества из Instruct-based LLM Все ещё в ожидании, когда промпт инжиниринг перестанет быть актуальным 😵‍💫 Ну а пока вот вам лайфхак, как заставить LLM’ки отвечать лучше: апеллируйте к эмоциям. В статье показали, что добавление в конец промпта эмоциональную добавку типа This is very important to my career улучшает качество. Замерили как на генеративных задачах с помощью асессоров, так и на дискриминативных с помощью обычных метрик типа accuracy. Везде есть прирост. Выиграли даже у мощнешйего бейзлайна Let’s think step by step 👏 Объясняют это тем, что эмоциональная добавка делает так, что модель уделяет больше внимания и на сам промпт перед ней (рис. 2). Но вообще если приглядеться, то в статье не совсем корректные сравнения: 1 гипотеза с оригинальным промптом сравнивается с максимальным качеством по 11 разным эмоциональным добавкам. И на их усредненном значении видно, что работает это не всегда лучше (рис. 3). Впрочем, чаще всего даже среднее выигрывает, так что подход точно имеет смысл попробовать! ✔

Почему успешные AI-first стартапы появились только сейчас❓ Отличное выступление на канале a16z (топовый венчурный фонд) с кучей интересных мыслей. Некоторые ниже опишу, но очень советую сам видос (15 минут). Итак, ИИ сделал кучу профита внутри биг теха (мета, нетфликс, гугл, …) - рекомендации, поиск и прочее, но новых больших AI-first компаний не возникло. Причины: - ИИ решали очень нишевую проблему (обыграли в Го, например, но ранка под это нет) - дорогое железо (особенно в робототехнике/селф драйвинге) - человек отлично справляется - (самое важное) толстый хвост распределения: много редких кейсов, на которых нужно не ошибаться, а ИИ недостаточно точен Все эти факторы делали экономически невыгодными такие стартапы: люди дешевле и лучше водят машины, рисуют картинки, делают саммари документов, … Плюс разметка разнообразных редких кейсов дорогая. Но вот с успехами в Generative-AI все изменилось. Выделились даже 3 больших направления - Creativity (генерация картинок, сценариев) - Companionship: цифровой человек друг - Copilot - помощник с различными задачами В этих задачах: 1. точность часто не так критична, неточные ответы могут быть даже забавной фичей 2. для разметки многие стартапы уже используют своих пользователей, что тоже экономит кучу денег И вот за генерацию мультяшного портрета ты платишь не $50 дизайнеру, а 5 центов 🤖 И ещё интересный взгляд: компьютер сделал дешевыми вычисления, интернет - дистрибуцию информации, а ИИ - создание чего либо. 👍 Такие дела :)

Помощь LLM 🦾 в разработке Прошел мини курс про парное программирование с использованием LLM’ок (~30 min занимает на x2) от d
Помощь LLM 🦾 в разработке Прошел мини курс про парное программирование с использованием LLM’ок (~30 min занимает на x2) от deeplearning.ai Первое, что очень понравилось: интерфейс для ученика. Прям в браузере, рядом с самим видео, загружается Jupyter notebook с кодом, который можно редактировать и запускать. Всё уже настроено и работает, можно сразу приступать к практике. Это прям очень классный learning experience. По сравнению с написанием преподавателем кода на доске в универе, это прям вау. Конкретно в этом курсе я этим почти не пользовался, но все равно остался под приятным впечатлением) Теперь про более прикладные штуки. Для лучшего качества промпт настоятельно рекомендуют делать из 3ех частей: 1. Priming - типа "You are an expert at writing clear, concise, Python code." / “I don't think this code is the best way to do it in Python, can you help me?” 2. Запрос 3. Декоратор - типа “work step by step” / “add comment to every line” / “explain in detail what you did” / “explore different solutions”- дополнительные требования, чтобы сделать результат ещё более полезным для себя Показали самые популярные сценарии: - улучшение качества текущего кода - упрощение кода - написание тестов - нахождение более эффективных решений - помощь с дебагом - объяснение того, что делает куча старого кода на любом языке - написание документации Все делается похоже: пишешь нужный прайминг, задаешь вопрос (иногда надо вставить текущий код), добавляешь комменты про то, чего хочешь получить от LLM. От себя ещё добавлю, что LLM’ки хорошо умеют regexp’ы писать и отлично знают команды unix’а) Кто использует Copilot/ChatGPT/etc? Как вам? Какие лайфхаки знаете?)

Самые успешные Generative AI компании В статье Generative AI’s Act Two от Sequoia Capital (один из самых известных венчурных
+2
Самые успешные Generative AI компании В статье Generative AI’s Act Two от Sequoia Capital (один из самых известных венчурных фондов) собрали воедино много классных GenAI компаний. И сгруппировали их по юскейсам, что очень удобно (рисунок 1). Также структурировали инструменты, которые для разработки AI используются (рисунок 2). Можно подсмотреть что нибудь полезное :) В самой статье есть несколько интересных вещей: - фокус смещается с технологий на закрытие запросов пользователей; решения будут усложняться и специализироваться под конкретные юскейсы - нет недостатка в пользовательском спросе, есть недостаток GPU, чтобы его закрыть - ретеншн у GenAI заметно ниже, чем в топовых не AI-First компаниях (рисунок 3); видимо из за отсутствия социального аспекта - пользователи в Character AI ведут текстовые диалоги с ботами по 2 часа в день (таймспент в тиктоке 96 мин); вот тут я удивлен - данные - хорошее конкурентное преимущество, но пользовательский нетворк эффект и идеальная интеграция в жизнь/работу - ещё лучше

Какой фидбек бывает❓ Немного дополню предыдущий пост про то, какой фидбек пользователей обычно бывает и какие могут возникнуть проблемы (в контексте дальнейшего его использования для улучшения моделей). Явный фидбек: лайк на видео, например. Очень хороший сигнал. Но обычно оставляется небольшим числом пользователей и данных мало. И если попытаться награждать пользователей за их лайки/дизлайки/реакции/etc, то это скорее всего ухудшит ситуацию: фидбека действительно станет больше, но его качество сильно упадет. Стимул получать бонусы сильнее желания оставлять осмысленный фидбек. С явным фидбеком может быть ещё одна проблема: его может оставлять только специфическая группа пользователей. Таким образом, обучившись на этот фидбек, модель станет лучше для них, но для медианного пользователя всё ухудшится (прям диктатура меньшинства получатся). Проблема нерепрезентативности и малого количества данных может решиться с неявным фидбеком. Это про поведение пользователя: досмотрел ли видео/дослушал ли песню/продолжил ли взаимодействие. Но хоть такого фидбека и много, он сильно более шумный, чем явный. На пользователя и его поведение влияют сотни других факторов, не связанных с вашим преложением. Чтобы извлечь полезный сигнал для дообучения, нужно хорошо фильтровать такой неявный фидбек: - User-based фильтрация: удалять фидбек странных/неопытных/неплатящих/etc пользователей - Content-based фильтрация: удалять странный/нерелевантный/чрезмерный/etc фидбек Впрочем и фильтрация может внести свои искажения :D Поэтому надо быть аккуратным 🦔

👨‍💻+🤖=👨‍🎨 В реддите AI энтузиасты делают прикольные вещи. Вот эта картина прям очень классная 👏 Промпт: Medieval villag
👨‍💻+🤖=👨‍🎨 В реддите AI энтузиасты делают прикольные вещи. Вот эта картина прям очень классная 👏 Промпт: Medieval village scene with busy streets and castle in the distance; на вход Control Net'у (QR Monster) была подана спираль В комментах треда можно почитать поподробней.

Фидбек пользователей - конкурентное преимущество 💪 💡 Извлекать полезный сигнал для дообучения модели из взаимодействий поль
Фидбек пользователей - конкурентное преимущество 💪 💡 Извлекать полезный сигнал для дообучения модели из взаимодействий пользователей с вашим приложением - важнейшая вещь. С выходом ChatGPT стал популярен такой способ улучшения качества: 1. на своих production запросах получить датасет пар (запрос, качественный ответ от ChatGPT) 2. дообучить на этом свою собственную LLM поменьше, чтобы было дешевле и быстрее инферить Это работает, потому что GPT-4 (полгода назад ChatGPT) от OpenAI - лучшая general purpose модель. Но вот недавно OpenAI добавили возможность дообучать ChatGPT. И если хочется максимального качества, то в алгоритм выше логично добавить в самое начало шаг с дообучением ChatGPT. Но на чем его дообучать? - Если на ответах GPT-4, то профит будет не такой большой - Если на своих же ответах (ответах ChatGPT), то его скорее всего вообще не будет И тут (это конечно полезно и без ChatGPT, на своих собственных моделях) на помощь приходит Human Feedback, который вы собираете в своем приложении: 1️⃣ Выкатить ChatGPT на пользователей и собрать пары (запрос, ответ ChatGPT) 2️⃣ Отобрать из этих данных те ответы, которые максимально понравились пользователям 3️⃣ Дообучиться на этом Таким образом, приватные данные создают вам конкурентное преимущество и помогают улучшать модели. Про эту же идею есть слайд (на рисунке) в 153-страничном отчете от ARK Invest, вдруг кому будет полезно :)

Какой размер датасета 📚 нужен для дообучения❓ Точного ответа конечно нет, но есть статьи где показали - профит с гигантским
+2
Какой размер датасета 📚 нужен для дообучения❓ Точного ответа конечно нет, но есть статьи где показали - профит с гигантским датасетом: Orca на 5М инструкций и ответов, полученных от GPT-4 - профит с небольшими, но очень качественными датасетами Например в статье Less is More for Alignment (LIMA) чуваки из Meta вручную собрали датасет из 1000 примеров. Дообучение на нем дает результаты лучше, чем на 52к примеров из Alpaca датасета. Но вручную собирать дорого и долго, и в статье AlpaGasus предложили автоматизировать это (рис. 1) Ученые придумали промпт 🧠 Причем они даже не пробовали разные, просто сказали что воспользовались этим (рис. 2) и всё 👍 Использовали GPT-4 с этим промптом, чтобы для пар (инструкция, ответ) получить оценку от 0 до 5 - насколько они подходят друг другу. Проскорили все пары в Alpaca и выбрали 9k примеров с оценкой больше 4.5. Дообучили модель на этих 9к и сравнились с обучением на 52к аж на 4 тест сетах: - WizardLM 250к сложных примеров evol-instruct методом - Vicuna 70к диалогов с ChatGPT - Koala 260к разных датасетов (QA, диалоги с LLM, ...) - Self-Instruct 82к инструкций и ответов, сгенерированных GPT-3 Выглядит как хороший замер, да вот только примеров в тест сетах было 180, 80, 218 и 252 соотвественно 😵 Замеряли качество используя GPT-4, так что я вообще не понял, почему так мало. Тем не менее, по всем тест сетам стало лучше (рис. 3) На других обучающих данных свой подход автоматической фильтрации они не пробовали. Возможно, потому что на GPT-4-distilled датасетах (типа vicuna) это и работать не будет. Статья в общем то не очень (на мой взгляд; плюс это препринт), но есть пара вещей, которые мне кажутся действительно полезными и применимыми на практике: 1️⃣ Маленький и качественный дотасет как отличная начальная точка; больше данных не всегда лучше 2️⃣ Фильтровать ответы моделей (не ChatGPT/GPT-4) по небинарным скорам от GPT-4 (хотя в первую очередь имеет смысл просто сгенерировать ответов от GPT-4 на своем домене) subscribe like, share, repost :D

Большой обзор 👁 методов по исправлению ответов LLM’ок 👨‍🏫 В генерациях LLM могут быть ложные факты, неверные рассуждения,
+1
Большой обзор 👁 методов по исправлению ответов LLM’ок 👨‍🏫 В генерациях LLM могут быть ложные факты, неверные рассуждения, код с багами, токсичные высказывания и прочие приколы. Авторы разложили по полочкам имеющиеся способы борьбы с этим. Самый популярный сейчас подход для такого - собрать датасет предпочтений пользователей и делать RLHF. Но есть и намного более быстрые способы, где LLM генерирует критику сама для себя, и на её основе сама же исправляется 😱 Такой пример post-hoc исправления может быть дешевле и эффективней в некоторых задачах, чем исправление в процессе обучения как в RLHF. Авторы выделили во всех этих методах 3 сущности (рисунок 1): 1. Языковую модель, которая генерирует изначальный ответ 2. Критика, который дает фидбек; это может быть человеческая оценка, ответ GPT4 с нужным промптом, награда ревард модели, … 3. Способ исправления Способы исправления могут быть: ⁃ С дообучением модели: RLHF (или SLiC / DPO) или просто составление исправленного датасета и обычный файнтюн ⁃ Во время генерации: изменять вероятности новых токенов на основе награды ревард модели, например; или генерировать N кандидатов, а затем выбирать лучший по мнению критика ⁃ Post-hoc исправление (рисунок 2): генерация той же LLM с 1ого шага, но с расширенным промптом, ... Прикольно смотреть на такую таксономию, всё уложилось четко 😗 Можно брать листья из каждой ветки, получать новый способ по исправлению ответов, и писать статью :D (хотя там столько ссылок на другие работы, что может всё уже и перебрали) Статья: "Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies"