316
Subscribers
No data24 hours
-57 days
-530 days
Posts Archive
316
Самые важные ИИ релизы в 2023 году🔥
Лучшие нейронки для создания текстов, изображений, видео, аудио.
316
Многие из вас, наверно, заметили, что мы любители хакатонов🕺
Участвовали в 5 хакатонах в этом году, как в роли бизнес - заказчика, так и в роли хакеров.
В роли бизнес-заказчика мы привлекли студентов разных профилей, которые успешно интегрировались в нашу команду и продолжают работу как полноценные специалисты 🏖
В роли хакеров мы участвуем для исследования рыночных запросов и тестирования продуктовых гипотез 👨💻
Начали год с хакатона по GenAI, который проходил в МГУ, где мы были в жюри. Там познакомились с несколькими командами, с которыми протестировали 6 бизнес - гипотез на базе LLM и GenAI.
В течении года участвовали в хакатонах от Роснефти, СИБУРа, Сбера, МФТИ и Департамента транспорта Москвы. Темы для участия выбирали схожие с нашим профилем и компетенциями, чтобы можно было потом использовать полученный опыт❤️
Так, для нас хакатон - это один из быстрых способов хакнуть сложную технологическую задачу, протестировать гипотезу и привлечь креативных ребят в команду.
316
Доступ к большинству LLM можно получить через облачный API. Это хороший способ для быстрого и дешевого тестирования бизнес гипотез, а также для разработки чат-ботов и интеграции LLM в собственные сайты и приложения🔝🔥
Сделали для вас подборку с ссылкой на документацию:
📌Anthropic Claude
Две версии модели - Claude Instant и Claude 2, их можно рассмотреть в качестве аналогов GPT-3.5 и GPT-4.
Поддерживают русский язык. Метрики сравнимо высокие. Цены дешевле чем в OpenAI.
🔗Ссылка
📌Gemini Pro
Модель поддерживает работу с текстом, а также доступна мультимодальная функция Vision, которая принимает на вход текст и изображения.Поддерживает 38 языков, в том числе русский. Для небольших проектов предусмотрен бесплатный тариф с ограничением 60 запросов в минуту.
🔗Ссылка
📌Cohere
Два ассистента Coral и Command на основе RAG (retrieval-augmented generation), которые решают задачи, связанные с извлечением информации, поиском и чтением документов.
🔗Ссылка
📌Perplexity AI
Сервис предоставляет доступ к API для запуска открытых LLM: Mistral 7B, Llama - 2 13B, Code Llama 34B, Llama -2 70B, replit-code-v1.5-3b
🔗Ссылка
📌Amazon Bedrock (AWS)
Предлагает доступ к базовым моделям - Titan от Amazon, Claude от Anthropic, Jurassic-2 от AI21, Llama-2 от Meta.
🔗Ссылка
📌Together
Сервис предоставляет доступ для тонкой настройки и запуска большого списка открытых LLM. Дают 25 кредитов при регистрации.
🔗Ссылка
📌Yandex GPT
Доступ к API через Yandex Cloud. В рамках сервиса доступна YandexGPT 2 для всех пользователей в режиме превью.
Кстати, исследования Яндекса показало, что в 63% случаев Yandex GPT 2 отвечает на запросы на русском языке лучше, чем GPT 3.5 .
🔗Ссылка
📌GigaChat
GigaChat Lite заявлена для решения более тривиальных задач, требующих при этом высокой скорости работы модели.
GigaChat Pro лучше следует сложным инструкциям и может выполнять более комплексные задачи.
Физическим лицам доступен freemium-режим.
🔗Ссылка
316
Вышла новая версия модели Midjourney V6 🙂
⚡️Более высокое разрешение изображения: максимальное разрешение 2048 × 2048 пикселей.
⚡️Улучшенная обработка языка: лучше понимает текстовые подсказки, что позволяет создавать более реалистичные изображения.
⚡️Больше контроля над вариациями: больше вариантов настройки изображений (цвет, стиль, ракурс).
⚡️Умеет генерировать текст на картинке.
🔝Выше подборка из 10 фото в разных версиях, например первая MJ V5.2, а вторая MJ V6 или наоборот
Угадайте версию модели по фото🤔
316
Цифровые аватары уверенно набирают популярность 👍🤔
😁Полностью сгенерированные ИИ - ведущие на канале Channel1. Очень реалистично и круто.
😁Digi AI – виртуальный аватар для романтических отношений, с синхронизацией речи, эмоций, мимики и жестов.
😁Забавные виртуальные аватары в Zoom, которые делают скучные и долгие звонки более увлекательными.
😁Наш цифровой аватар Игоря, который говорит голосом Игоря и периодически появляется на разных меропрятиях и делится интересными технологическими новостями.
😁Реалистичные аватары знаменитостей от Meta AI в Instagram и Facebook.
😁Виртуальные участники группы Kiss. Музыканты будут выступать теперь только виртуально.
Для создания цифровых аватаров и виртуальных помощников используются технологии 2D и 3D моделирования и анимации, генеративный ИИ, методы распознавания и обработки голоса, а также модели синтеза и клонирования речи.
Попробуйте собрать своего аватара на основе ИИ, используя один из этих сервисов:
D-ID ссылка
Emotech ссылка
NVIDIA Avatar Cloud Engine ссылка
Elai ссылка
Heygen ссылка
Spirit me ссылка
316
Сервис генерации музыки Suno AI 🐱
Suno AI создает 2 версии любой композиции по вашему текстовому запросу. Suno AI использует свою новую модель Chirp, которая создает реалистичную музыку и вокал. Поддерживает более 100 языков, в том числе русский⭐️
Microsoft интегрировали модели Suno AI в свой Copilot.
Написать свой трек можно на сайте и в дискорде.
Слушаем песню про магИИю и ставим 💗
316
Супер успешный LLM стартап Mistral AI 🤩
Компания была основана в мае 2023. Через месяц после запуска получила $112 млн инвестиций и оценку в $240 млн. Вчера компания закрыла раунд на $415 млн с оценкой $2 млрд 😎
В октябре представила модель с открытым исходным кодом Mistral 7B. Обучена на небольшом (по меркам LLM) наборе данных, около 7 миллиарда параметров. Это позволяет дообучать и запускать ее на локальных устройствах и серверах с меньшими вычислительными ресурсами.
Есть дообученные сообществом модели на русских инструкциях. Модель неплохо генерируют текст на русском языке, но не имеет специфических знаний и может галлюцинировать😵💫
Вчера компания объявила о запуске бета-версии своей платформы для корпоративных клиентов и новой модели Mixtral 8x7B, которая выдает наиболее точные ответы на запросы по сравнению с предыдущей моделью, для этого подбирает подходящую группу параметров. Mixtral имеет 45 миллиардов параметров и может стать конкурентом ChatGPT и Bard👏
Скачать и изучить можно тут и тут и тут 🔗
316
Мы с гордостью объявляем, что мы победили на онлайн-хакатоне Phystech GigaChat Challenge! 🎉
Наш проект CO-PILOT в закупках, основанный на языковой моделях Gigachat(мы тестируем и сторонние LLM), был признан одним из лучших на хакатоне. Мы разработали инструмент, который на основе ИИ определяет тему запросов, подбирает соответствующие документы из базы знаний и формирует ответы на вопросы, основываясь на информации из загруженных документов. Наша цель - сократить трудозатраты и увеличить скорость ответов в области закупок.
Мы показали прототип нашего проекта, сейчас дорабатываем web-интерфейс и добавляем LLM модель с открытым кодом. Мы верим, что наша разработка принесет значительные преимущества в сфере закупок, улучшая эффективность и оперативность процессов.
316
Ну что друзья 😉наша очередь писать про Gemini ☄️
Google весь год разрабатывал свой ответ на самую передовую модель GPT-4, которая появилась в марте. А уже в апреле 2023 года Google объявила об объединении двух своих ИИ-лабораторий Google Brain и DeepMind.
"Gemini - модель общего назначения, которую можно использовать по-разному", так Google рекламирует свою мультимодальную модель.
Мультимодальность означает, что она обучена обрабатывать несколько видов информации: текст, изображения, аудио. Она может комбинировать эти форматы, чтобы ответить на вопросы.
Gemini представлена в трех размерах: Ultra, Pro и Nano. Ultra - это самая большая и мощная, Pro и Nano адаптированы для приложений, которые работают с более ограниченными вычислительными ресурсами. Nano предназначен для работы на устройствах, таких как новый телефоны Google Pixel 🔥
Доступ к модели Gemini Pro обещают предоставить с 13 декабря для многих стран. Сейчас Pro можно тестировать в Bard для пользователей из US. Gemini Ultra будет доступна в начале следующего года. Но уже появились впечатляющие ролики, как работает мультимодальность Gemini. Правда Google признал, что некоторые элементы в видео были просто смонтированы😲
По отзывам тестировщиков, Google научили Gemini быть более точным с точки зрения фактов и не отвечать на вопрос, на который она не знает ответ. Это смягчает проблему галлюцинаций.
Мы используем Bard (на базе PaLM) для поиска и генерации информации в одном из наших проектов, справляется неплохо. Bard позволяет использовать поиск Google и перепроверять ответы чат-бота, но результаты онлайн-поиска не всегда могут быть точными.
Ну а если говорить про решение повседневных задач, то разница между моделями GPT, PaLM, Gemini и другими скорее не ощутима для пользователя 👀
Чтобы попробовать Bard с Gemini Pro нужно:
-Сменить язык в своём Google-аккаунте на английский. Сделать можно по ссылке
-Включить VPN, Страна USA
-Перейти по ссылке
316
Новый вид монтажа 🥰
Все что вы видите в этом ролике сгенерировано за один раз, без склеек, без использования программ для монтажа.
316
Применение генеративного ИИ в решениях по прогнозированию спроса и управлению запасами.
У нас есть B2B продукт Forecaster - помощник для формирования заказа в промышленных товарах❓
Вчера рассказывали про него на AI митапе в Газпромнефти 👀
✔️Forecaster прогнозирует потребность в промышленном товаре.
✔️Формирует рекомендацию по размеру заказа для конкретного клиента.
✔️Для расчета использует разные подходы и модели машинного обучения.
Мы активно рисечим эту тему и видим, что некоторые компании начали интегрировать генеративный ИИ в решения по предиктивной аналитике.
➡️Компания SymphonyAI представила два новых GenAI инструмента с интерфейсами на естественном языке – Category Manager Copilot (для категорийных менеджеров) и Demand Planner Copilot (для планировщиков спроса). Пользователь может делать текстовые запросы и получать необходимые ответы, данные и аналитику.
🔼Copilot категорийного менеджера помогает делать саммаризацию по отчетам для еженедельных обзоров категорий. Автоматически генерирует аналитику и визуализирует данные. Обобщает и генерирует рекомендации.
🔼Copilot планировщика предоставляет по запросу информацию по уровню запасов и спросу. Детализирует и визуализирует данные для полной интерпретируемости и прозрачности.
➡️Другая компания Prevedere, разрабатывающая решения для прогнозного планирования представила Prevedere Generate. Prevedere Generate позволяет осуществлять поиск, быстро и легко интегрировать экономические и потребительские данные по отрасли и компании в их модели прогнозирования.
316
В последние дни слухи о разработке OpenAI новой модели искусственного интеллекта Q* не сходят с первых полос новостных источников про ИИ. Это событие вызвало шок в научном и технологическом сообществе, вызвав бурные ожидания и предположения о его потенциальных последствиях.
Согласно слухам, новая модель сочетает в себе метод обучения с подкреплением Q-learning и графовый поисковый алгоритм A* (познавательная статья про Q-learning: https://www.datacamp.com/tutorial/introduction-q-learning-beginner-tutorial). Шумиха же вокруг Q* связана с его предполагаемой способностью решать математические задачи начальной школы с поразительным мастерством — область, в которой с трудом справляются даже самые сложные системы искусственного интеллекта. Если этот прорыв подтвердится, он станет значительным шагом вперед к созданию AGI, так как математика является бенчмарком к рассуждению.
Однако на фоне ажиотажа некоторые эксперты предостерегают от чрезмерной шумихи и призывают к более взвешенному подходу. Так Ян Лекун написал в X по этому поводу:
«Пожалуйста, не обращайте внимания на поток полной чепухи о Q*. Одной из основных задач по повышению надежности LLM является замена авторегрессионного прогнозирования токенов планированием. Практически все ведущие лаборатории (FAIR, DeepMind, OpenAI и т. д.) работают над этим, а некоторые уже опубликовали идеи и результаты. Вполне вероятно, что Q* — это попытки OpenAI в планировании. Для работы над этим они практически наняли Ноама Брауна (известного по Libratus и Cicero).»Более того, некоторые выразили обеспокоенность тем, что шумиха вокруг Q* может отвлечь внимание от более насущных проблем в разработке ИИ, таких как устранение предубеждений, обеспечение этичного использования и содействие ответственным инновациям. Однако несмотря на эти опасения, потенциал Q* остается неоспоримым. Автор поста @edzakharyan
316
Эксперименты с GPT Vision пока не дают окончательных выводов о качестве работы модели, так как она совершает значительные ошибки при подсчете количества товаров на фотографии и не может правильно отметить информацию в таблице. Однако, всегда можно попытаться исправить это путем промптинга и создания ансамбля моделей.
316
После появления GPT 3.5-turbo, казалось, что удивить больше нечем, но появился термин "мультимодальность". Это способность модели понимать и воспроизводить разные типы данных - текст, аудио, графическое представление. Если с текстом и аудио было понятно изначально (прикрутить синтез или распознание голоса - не сложно, уже много готовых решений), то научить нейросеть видеть так же хорошо, как и понимать текст, казалось сложной задачей. И вот появляются утечки о мультимодальных моделях, которые умеют понимать содержимое изображений (а также видео, так как видео это последовательность кадров). Одной из первых была модель LLava, а через несколько недель OpenAI анонсировали новую модель Vision, которая умеет понимать содержимое изображений. Это открывает совершенно новые возможности для создания продуктов: компьютер теперь понимает слова, читает и видит!
Ниже на фотографиях собраны наши эксперименты с GPT Vision, нам стало интересно какие задачи может решать модель, поэтому помимо задачи считывания печатного текста, проверили на сколько хорошо модель понимает рукописный, знакома ли она с изображениями разных вещей и понимает ли таблицы.
316
SDXL-Turbo 🔥 новая модель Stable Diffusion
Умеет генерировать изображения очень быстро, в режиме реального времени☄️
Пишем промпт и получаем изображение, которое меняется в процессе ввода подсказки.
• Протестировать
• Huggingface
Правда бесплатные попытки заканчиваются быстро на clipdrop
316
Наша команда любит решать интересные задачи на основе технологий ИИ🔍
На выходных приняли участие в хакатоне от Департамента строительства города Москвы. Есть проблема, что строительные компании незаконно сбрасывают отходы строительства. По документам перевозят одно, а в реальности другое. Сбрасывают не там, где должны. Ну и конечно, в итоге платят государству не за тот тип отхода.
Нужно было на основе анализа видеозаписей определить типы отходов строительства.
Провели аналитику, обучили модели, разработали прототип и предложили новые гипотезы🛡
#ЭкспериментыLab
316
Тут говорят Илон Маск все-таки приехал на конференцию AI Journey🤝
Конференция была посвящена ИИ. Много говорили про генеративный ИИ. Были интересные спикеры из науки и бизнеса. Запись конференции тут.
Ну и конечно, новинки от Сбера:
🤖 Новая модель GigaChat 29B (29 миллиардов параметров).
Улучшилось качество и скорость. А также появился новый функционал:
-Работа с PDF файлами в диалоговом формате. Выделение ключевых мыслей. Изучение документа в режиме диалога.
-Составление документов: генерация текста и иллюстраций.
-Распознавание и синтез. Можно наговорить промпт внутри диалога.
Протестить можно тут (пока работает нестабильно).
🤖 Новые версии Kandinsky 3.0
- Теперь создает более реалистичные изображения.
- Появились функции редактирования и дорисовки изображений.
- Модель лучше понимает текстовые запросы.
- Модель хорошо генерит русских фольклорных персонажей и мультипликационных героев.
Ссылка на бота для тестирования тут @kandinsky21_bot
🤖 Kandinsky Video
Новый сервис генерации видео и анимации по описанию. Протестить можно на платформе fusionbrain.ai и в Telegram-боте
(протестировали, качество пока не очень, промт понимает не всегда точно).
🤖Gigachat Suite
Генеративная платформа от СберДевайсы, где представлены все сервисы выше, но только уже для бизнеса.
🤖OmniFusion
Мультимодальная мультизадачная модель:
- Определяет объекты на картинке.
-Детектирует расположение и цвета.
-Считает объекты.
- Умеет рассуждать и решать задачи даже в специфических доменах, в том числе IQ тесты.
🤖GigaChat учится писать музыку, пример трека
Мы планируем протестировать несколько моделей. Поделимся с вами результатами позже💬
#AI
