316
Subscribers
No data24 hours
-57 days
-530 days
Posts Archive
316
Пятничный эксперимент 🧠
Решили немного разнообразить опыт клиента прекрасного Ассистента БТС @BTSLLMbot.
Добавили в режим генерации текста нейросети GigaChat Pro🙂
Тестируем🔥📣
316
Неделю назад к нам пришли с запросом, пусть ИИ сделает уникального персонажа, который будет сопровождать студентов на разных этапах обучения в корпоративном университете. Один персонаж, но в разных позах, одежде, с разными эмоциями и предметами. Персонаж, которого можно просто и быстро адаптировать под разный контекст и этапы обучения. Ну и конечно, подходящий под корпоративные требования.
Классный проект, подумали мы 🙂 и собрали прототип сервиса для создания персонализированного персонажа.
Немного про решение:
- Создали одно изображение с персонажем в Stable Diffusion XL
- Сделали датасет для персонажа, перерисовывая участки изображения промптами.
- Использовали технику DreamBooth для файн-тюна Stable Diffusion XL на датасете на нашего персонажа
- Упаковали модель в сервис
Про DreamBooth
DreamBooth - это способ файн-тюна модели на конкретный объект. Для этого необходимо взять несколько фото этого объекта (человека, животного, предмета и т.д.) и написать промпт, который будет ассоциироваться с этим объектом. Обычно промпт содержит специальный токен, например, “a photo of TOK character”, этот токен редко встречался при обучении, поэтому модели будет легче выучить этот токен. Уже после файн-тюна модель начнет генерировать нужный объект по токену “TOK”.
316
Первый чип Neuralink Илона Маска успешно вживлен в мозг человека🧠
Чип получил название Telepathy. Маск делает ставку на то, что расширение возможностей человеческого мозга позволит не только справляться с тяжелыми заболеваниями, но и конкурировать с искусственным интеллектом🙂
С помощью чипа можно будет управлять смартфоном, компьютером и практически любой техникой силой мысли.
Чип вживляется под кожу и подключается к мозгу. Всю операцию совершает робот-хирург, который просверливает отверстие в черепе и подсоединяет электроды 😳По словам Маска, операция безболезненная и не требует анестезии. Пациент может покинуть клинику в тот же день. После имплантации не остается никаких следов, а владелец не ощущает чип
Ссылка
316
Интересный отчёт от Menlo Ventures об использовании генеративного ИИ в предприятиях 🔝
Генеративный ИИ набирает обороты на предприятиях, но этот сектор все еще находится в зачаточном состоянии со значительным потенциалом роста. В настоящее время традиционные компании лидируют на рынке, но стартапы имеют уникальные возможности разработки ИИ приложений. В отчете ожидается, что достижения в области рассуждений ИИ, обработки данных и интеграции рабочих процессов будут способствовать будущему внедрению технологий на предприятиях, создавая новые возможности для инноваций и лидерства на рынке.
Ключевые факты📣
- Инвестиции в GenAI составляют 2,5 млрд $, что не так много по сравнению с классическим ИИ - 70 млрд $ и облачным программным обеспечением - 400 млрд $.
- Количество предприятий, использующих ИИ, выросло на 7% (с 48% в 2022 году до 55% в 2023 году).
- Расходы на ИИ выросли на 8%, что превышает общий рост расходов на технологии на 5%.
- 80% предприятий приобретают стороннее программное обеспечение для GenAI.
- Продуктовый и инженерный отделы тратят на GenAI больше всего.
Прогнозы📈
-Внедрение GenAI на предприятиях будет медленным, подобно раннему внедрению облачных технологий.
-Рынок отдает предпочтение игрокам, которые интегрируют ИИ в существующие продукты.
-Рабочие процессы с большим количеством данных будут быстрее перенимать GenAI
Возможности для стартапов❓
-Отраслевые приложения - медицина, юриспруденция, маркетинг и другие.
-Межотраслевые решения - автоматизация рабочих процессов, агенты и другие.
Технологии для ИИ✔️
-создание инструментов для приложений LLM (например, баз данных, конвейеров данных).
Проблемы❗️
- Недоказанная рентабельность инвестиций и опасения по поводу производительности и точности. Именно им отдают предпочтение при выборе поставщика.
Будущееℹ️
- Рост способности к более глубоким рассуждениям
- Набор нишевых ИИ с собственными данными
- Фокус на безопасность и управляемость
🔗https://menlovc.com/2023-the-state-of-generative-ai-in-the-enterprise-report/
316
Copilot в жизни «белых воротничков» 😜
CB Insights пишет, что Copilot активно проникает в жизнь «белых воротничков» и значительно повышает их продуктивность.
В разработке ПО, более 25 стартапов, разрабатывающих Copilot для программистов. С GitHub Copilot разработчик тратит на 56% меньше времени на выполнение задач.
В здравоохранении, Copilot автоматизирует рутинные задачи, связанные с документацией. Например, стартап Suki предлагает доктору полностью электронного помощника, который разбирает разговор и записывает в медицинскую карту все необходимое. Стартап несколько месяцев тестировал продукт в 12 американских клиниках. Врачи с Suki тратят на бумажную работу на 75% меньше времени.
В юридической сфере, Copilot составляет контракты, обобщает документы и оптимизирует поиск по документам. Например, CoCounsel может обработать множество документов за пару минут и сказать, какие из них подойдут для работы над конкретным кейсом. Или просмотреть тысячи страниц дел и законов, чтобы дать ответ на поставленный вопрос.
Также, CB Insights прогнозирует, что в 2024 году внимание будет сосредоточено на компаниях, создающих более эффективные решения в специализированных областях, таких как закупка, производство, дизайн, строительство, исследования новых материалов.
В комментах "2024 generative AI predictions" от CB Insights для самостоятельного изучения🤔
#Copilot
316
Магия от Runway 🌈 Кисть Multi-Motion Brush, которая оживляет несколько объектов на изображении или видео.
Как работает🔝
-Переходим по ссылке и регистрируемся.
-Выбираем Start with Image или Start with Text.
-Загружаем изображение или генерируем видео.
-Выбираем инструмент Motion Brush и выделяем кистью область, которую нужно оживить. Одна кисть - одна область.
-Указываем направление движения и интенсивность.
316
Когда ИИ научится рассуждать❤️☺️
В недавном подкасте Билла Гейтса «Unconfuse Me» Сэм Альтман (CEO OpenAI) назвал ключевым достижением, которое может произойти в ближайшие два года с ИИ - это то, что у ИИ расширится способность к рассуждению. Даже GPT-4 сейчас может рассуждать крайне ограниченно.
Андрей Карпатый (один из ключевых ученных в OpenAI) сравнивал эту способность с Системой 2 из книги Канемана "Думай медленно... решай быстро". Основная идея книги в том, что в мозгу есть две системы. Система 1 - быстрые автоматические реакции. Система 2 - более медленная, рациональная и сознательная, которая принимает сложные решения. Сейчас большие языковые модели - это больше про систему 1.
Но кажется, что DeepMind от Google решили ускорить прогресс и выпустили модель AlphaGeometry 🔥 Она позволяет решать геометрические задачи олимпиадного уровня.
При тестировании AlphaGeometry решила 25 из 30 задач с международной олимпиады.
AlphaGeometry сочетает языковую модель и символический движок дедукции. Одна модель генерирует интуитивные идеи, а другая принимает рациональные решения. Для обучения и проверки системы было сгенерировано более 100 млн синтетических задач, без участия человека.
DeepMind выложили описание и исходники AlphaGeometry.
https://deepmind.google/discover/blog/alphageometry-an-olympiad-level-ai-system-for-geometry/
316
В интернет-маркетплейсе Amazon нашлось множество товаров с необычными названиями: чаще всего встречается «Извините, я не могу выполнить этот запрос, так как это противоречит политике OpenAI» (перевод с английского).
Вероятно, продавцы пользуются языковой моделью GPT от OpenAI, чтобы автоматизировать создание названий и описаний для товаров. В некоторых случаях нейросеть отказывается отвечать напрямую, если сочтёт, что ответ может оказаться нежелательным. Но так как заполнение названий происходит автоматически, в итоге «отбивка» все равно попадает в каталог Amazon.
316
Сегодня на одной из рабочих встреч коллеги из другой компании (почти из нашей😎) настойчиво утверждали, что важно пропускать все гипотезы через так называемых "экспертов в ИИ".
Вот интересно, кто такой этот самый эксперт в ИИ?
316
Из текста в 3D с помощью Luma Genie - это новый уровень крутости😎
Можно создать любой 3D-объект за 10 секунд
По ссылкам можно попробовать🔝
- Web: lumalabs.ai/genie/
- iOS: lumalabs.ai/ios
А если хотите получить анимированную 3D-модель, то подключайте Mixamo
3 шага:
➡️Создайте желаемый объект 3D - бъект в Luma Genie
➡️Экспортируйте его в OBJ или FBX.
➡️Загрузите в mixamo, запустите auto-rig и примените анимацию.
316
Карманный ИИ-помощник Rabbit R1 🔥
R1 может перемещаться по вашим приложениям без необходимости брать телефон в руки.
Внутри работает нейросеть LAM (Large Action Model), которая обучена не на генерации текста, как ChatGPT, а на выполнения действий. Модель обучали на пользовательских интерфейсах - скриншотах и видео веб-сайтов и приложений.
Пользователь голосом просит сделать какую-то операцию - например, включить песню, заказать такси или даже спланировать поездку для семьи (купить билеты, забронировать автомобиль и отель).
Rabbit R1 сам отправится в подходящее приложение, укажет необходимые параметры и предложит пользователю подтвердить действие 💬
Скоро поступит в продажу, стоимость 200$.
316
RAG системы (Retrieval Augmented Generation) активно проникают в процессы компаний и становятся базой для разработки ИИ - помощников.
В RAG системах для генерации ответа на запрос используется дополнительная релевантная информация. В основном из внутренних или внешних проверенных источников, например из положений, стандартов, ГОСТов и других.
Это делается для того, чтобы снизить галлюцинацию моделей, добавляя профильные знания.
Как работает классический RAG❓
✔️Берется набор профильных документов. У языковых моделей размер контекста ограничен. Например у GPT-4 он 8 тыс токенов, у LLaMA-2 он 4 тыс токенов (токен - это символ или слово). Это где-то 10 страниц текста. Размер контекста - это сколько текста можно передать в модель для использования в генерации ответа. И в такой небольшой контекст сложно сразу отправить большие документы. Поэтому текст документов разбивается на куски или чанки.
✔️Каждый кусок текста пропускается через предобученную модель (embedding model), которая преобразует текст в вектор. Эти вектора и исходный документ собираются в векторную базу данных.
✔️Когда от пользователя приходит запрос, он также превращается в вектор с помощью такой же эмбединг модели. Дальше проводится поиск похожих кусочков текстов из базы данных. И уже найденные релевантные куски текста используются для генерации ответов базовой языковой модели.
За последний год было проведено много исследований и разработано продвинутых подходов к RAG. Мы сейчас экспериментируем с некоторыми из них в рамках своего продукта. Есть трудности в обработке мультимодальных данных.
Если у вас есть похожие задачи, то по ссылкам ниже несколько полезных статей.
🔗Шпаргалка для создания продвинутой RAG
Ссылка
🔗Создание синтетического набора данных для RAG
Ссылка
🔗Обзор RAG подходов
Ссылка
#RAG
316
Дорогие друзья!
Весь год нас не отпускало чувство любопытства и азарта, связанное с развитием Gen AI, тема тригерила нас в разных направлениях, но основном в контексте разработки инновационных продуктов в B2B.
Мы изучили много материалов по теме и весь год делали собственные продукты, экспериментируя с технологиями и юзкейсами. Мы делились с вами самыми важными новостями и опытом разработки на базе ИИ.
Поздравляем вас с наступающим Новым годом🎄 ❄️🍭
Спасибо вам, что читаете, лайкаете и комментируете наши посты👋
А на праздники хотим посоветовать вам несколько видео по теме Gen AI, которые полезно посмотреть самим 🍪 🔥
Что посмотреть:
-Конференция от МТС про применения Gen AI в корпоративном сегменте
Ссылка
-Подкаст "LLM в каждый дом" от Conversations про то, как российские компании стали трансформировать бизнес и продукты под новую GPT-реальность.
Ссылка
- Выступление с конференции OpenTalks 2023 - "10 лет революции ИИ - работы, которые потрясли мир!"
Ссылка
-Выступление футуролога Юваля Ной Харари "Риски тесного взаимодействия человека и ИИ", где он предостерегает от чрезмерного взаимодействия с чат-ботами.
Ссылка
-Интервью Сэма Альтмана, где он делится прогнозом на 2024 год и рассказывает, как меняется экономическая модель интернета.
Ссылка
316
Немного закулисья Ассистента БТС👋
2023 год был очень насыщенным для Ассистента БТС.
🔼За 7 месяцев Ассистент БТС обработал более 10 тысяч текстовых запросов.
🔼За последние 2 месяца сгенерил более 3 тысяч изображений.
Это где-то 35 млн токенов или, говоря проще, этой суммы хватило бы на покупку электросамоката Xiaomi, электрогриля Tefal или покрышки на камаз.
💬 Очень хотим понять, для каких задач вы привлекаете Ассистента БТС и какие полезные и забавные ответы он дает вам.
⤵️ Напишите в комментариях к посту. За самый интересный кейс 🧦
На картинке к посту, типичный день команды поддержки Ассистента БТС🥶
316
Создавайте и редактируйте свои новогодние видео с помощью ИИ 🚩
Pika Labs 🤭классный сервис генерации видео: text2video, image2video, video2video.
Pika умеет дорисовывать видео, растягивать под нужный формат и менять объекты.
Доступна на сайте и в дискорде 🦌
https://pika.art/
316
Открыт сбор заявок для полчения доступа к ассистенту Gigacode.
1. «Сбер» предлагает ранний доступ к своему AI-ассистенту для кодинга GigaCode, аналогу GitHub Copilot.
2. GigaCode знает 15 языков программирования и умеет генерировать продолжение кода в различных редакторах исходного кода.
3. GigaCode предлагает расширенную кодогенерацию, семантический поиск по коду и поиск уязвимостей.
4. «Сбер» зарегистрировал инструмент разработки и автодополнения кода GigaCode в Роспатенте.
5. GigaCode будет интегрироваться с популярными средами разработки.
6. В ближайшие месяцы GigaCode станет доступен для внешних разработчиков.
316
Обучение открытых моделей 🎩
В 2023 году появилось достаточно много генеративных моделей с открытым исходным кодом ❤️
Популярность таких моделей растет за счет значительного улучшения их качества. Открытые модели можно дообучать на внутренних данных для решение профильных задач. Обучать и запускать их можно как на локальных, так и облачных серверах.
В большинстве российских компаний запрещено использование облачных сервисов из-за риска утечки внутренних данных. Поэтому необходимо создавать внутреннюю инфраструктуру с 0 и обучать на локальных серверах. При длительном использовании и большом объёме трафика внутренняя инфраструктура может быть даже дешевле облачных серверов.
Для полного обучения (LoRA и QLoRA) модели Llama-7b (7 млрд параметров, самая маленькая модель) нужна Tesla A100 80 GB. Примерная стоимость A100 80 GB - 2 млн руб🥶
Для оценки железа для других открытых моделей можно воспользоваться ссылкой
Но есть метод уменьшения размера модели - это использование квантизации. Уменьшение размера модели происходит за счет сжатия весов модели, а точнее конвертации из исходного типа данных float32 в тип float16, int8, int4 или другие (хорошая статья про то, чем отличаются эти типы и как они используются в LLM тут). При квантизации снижается точность модели, но за счет меньшего размера модели можно обучать (только в режиме LoRA или QLoRA) и запускать модель на более доступном железе. Примеры готовых технологий квантизации GPTQ, AWQ и OmniQuant.
➡️Для QLoRA обучения модели размером 30b, но уже сжатой до 4 бит требуется 24GB памяти.
➡️Для QLoRA обучения модели размером 70b сжатой до 4 бит требуется 48GB памяти.
➡️Для запуска модели размером 30b сжатой до 4 бит (AWQ) - 20GB памяти.
➡️Для запуска модели размером 70b сжатая до 4 бит (AWQ) - 40GB памяти.
Мы думаем, что в 2024 году открытых моделей, в том числе языковых, обученных на русском языке станет больше и их более активно начнут использовать 👍
