en
Feedback

Don't get caught by a cheater! Telemetrio finds and tags such channels 👉 If you want to see the tag, subscribe 👈

immers.cloud | Облако с GPU

immers.cloud | Облако с GPU

Open in Telegram

immers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга. Самый большой ассортимент GPU Tesla и RTX 💻 👉 Наш сайт https://immers.cloud/ 🎧 @immerscloudsupport Чат по ИИ - https://t.me/immersAI

Show more
944
Subscribers
No data24 hours
-17 days
No data30 days
Attracting Subscribers
Oct '26
October '26
+2
in 0 channels
September '26
+19
in 0 channels
Get PRO
August '26
+21
in 0 channels
Get PRO
July '26
+11
in 0 channels
Get PRO
June '26
+14
in 0 channels
Get PRO
May '26
+11
in 0 channels
Get PRO
April '26
+13
in 0 channels
Get PRO
March '26
+12
in 0 channels
Get PRO
February '26
+17
in 0 channels
Get PRO
January '26
+30
in 0 channels
Get PRO
December '25
+32
in 0 channels
Get PRO
November '25
+16
in 0 channels
Get PRO
October '25
+18
in 0 channels
Get PRO
September '25
+25
in 0 channels
Get PRO
August '25
+27
in 0 channels
Get PRO
July '25
+38
in 0 channels
Get PRO
June '25
+26
in 1 channels
Get PRO
May '25
+24
in 1 channels
Get PRO
April '25
+40
in 0 channels
Get PRO
March '25
+15
in 1 channels
Get PRO
February '25
+27
in 1 channels
Get PRO
January '25
+40
in 1 channels
Get PRO
December '24
+54
in 1 channels
Get PRO
November '24
+29
in 0 channels
Get PRO
October '24
+97
in 1 channels
Get PRO
September '24
+91
in 3 channels
Get PRO
August '24
+191
in 0 channels
Get PRO
July '24
+518
in 0 channels
Get PRO
June '24
+707
in 1 channels
Date
Subscriber Growth
Mentions
Channels
09 October0
08 October0
07 October0
06 October+1
05 October+1
04 October0
03 October0
02 October0
01 October0
Channel Posts
Трамп советуется с Grok, а кто управляет вашим ИИ? 📰 По сообщению TIME, Трамп спрашивал Grok, как венесуэльцы отреагируют на
+6
Трамп советуется с Grok, а кто управляет вашим ИИ? 📰 По сообщению TIME, Трамп спрашивал Grok, как венесуэльцы отреагируют на захват Николаса Мадуро. По словам источника журнала, чат-бот предположил, что многие поддержат его свержение. ИИ становится собеседником при обсуждении важных решений. Для бизнеса это повод задуматься: где обрабатываются рабочие данные, кто определяет доступ к ним и на каких условиях работает модель? 📲 Как собственное развертывание дает больше контроля над ИИ читайте в слайдах. 📌 Один из вариантов — Qwen3.8-27B с открытыми весами под Apache 2.0. Модель можно развернуть в выбранной инфраструктуре, настроить под свои процессы и проверить на задачах с документами, кодом и внутренними данными. 🚀 Начните с выбора модели под свою задачу. В каталоге Immers Foundation Models можно познакомиться с Qwen3.8-27B и другими открытыми моделями, изучить их возможности и попробовать публичные эндпоинты. ➡️ Перейти в каталог Immers Foundation Models

2
5 ИИ-моделей для одной RTX 4090 Подобрали модели для создания ИИ-помощников, программирования и обработки документов: 1. Gemm+5
5 ИИ-моделей для одной RTX 4090 Подобрали модели для создания ИИ-помощников, программирования и обработки документов: 1. Gemma-4-12B-it Для создания мультимодальных помощников: работы с текстом, изображениями, видео и речью, а также программирования и анализа документов. ▶️ Запустить модель 2. Qwen3.5-9B Для анализа длинных документов, распознавания текста и изображений, а также автоматизации задач с помощью ИИ-агентов. ▶️ Запустить модель 3. gpt-oss-20b Для сложных рассуждений, программирования и создания ИИ-агентов, которые используют внешние инструменты. ▶️ Запустить модель 4. PaddleOCR-VL-1.6 Для извлечения текста, таблиц и формул из PDF и сканов с сохранением структуры документа и порядка чтения. ▶️ Запустить модель 5. Unlimited-OCR Для распознавания многостраничных документов за один проход: оцифровки архивов, книг, научных статей и юридических материалов. ▶️ Запустить модель 📲 Листайте слайды, выбирайте модель для своих задач и создайте собственный ИИ-эндпоинт на immers.cloud.
377
3
Qwen3.8-Flash-Next: гибридное внимание для ИИ-агентов 👋 Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель: 1+8
Qwen3.8-Flash-Next: гибридное внимание для ИИ-агентов 👋 Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель: 125 млрд параметров в основной языковой модели, из которых 6 млрд активируются на токен. Она работает с текстом, изображениями и видео, поддерживает нативный контекст 262 144 токена и расширение до 1 млн с YaRN. Что важно: ▪️ Разреженное глобальное внимание Архитектура сочетает три рекуррентных слоя Gated DeltaNet с одним слоем Qwen Sparse Attention. QSA отбирает релевантные блоки токенов и вычисляет внимание по выбранному подмножеству, сокращая объем вычислений на длинном контексте. ▪️ N-граммные встраивания Дополнительная таблица на 51 млрд параметров обогащает представления токенов векторами для коротких последовательностей. Она размещается в оперативной памяти хоста, поэтому всю таблицу не нужно хранить в VRAM. ▪️ Gated Residual Четыре параллельные ветви остаточного потока обеспечивают управляемую передачу информации между слоями, расширяя возможности преобразования представлений. 📲 Подробнее об архитектуре, бенчмарках, сценариях использования и требованиях к инференсу — в слайдах. ➡️ Модель стоит протестировать на изменении кодовых баз, многошаговых задачах с инструментами и анализе больших документов. ☁️ Для проверки в собственной инфраструктуре модель доступна в Immers Foundation Models на конфигурации 2 × H100 от 703,08 ₽/ч. #ИИ_Модели #LLM
406
4
🎉 С Днем работника ЦОД! 👨‍🔧 Работать в дата-центре — это как быть за кулисами спектакля, который никогда не заканчивается.+4
🎉 С Днем работника ЦОД! 👨‍🔧 Работать в дата-центре — это как быть за кулисами спектакля, который никогда не заканчивается. На сцене запускают приложения, обучают нейросети и выпускают новые сервисы. За кулисами проверяют, выдержит ли инфраструктура следующий выход. Здесь важно услышать необычный шум, заметить изменение на графике и вовремя разобраться в причине. А день, за который не произошло ничего примечательного, вполне может быть результатом большой работы. 📲 В карточках заглядываем за кулисы immers.cloud и рассказываем, как устроен наш дата-центр. 🍹 Спасибо всем, кто заботится об этой инфраструктуре. Пусть после смены хватает сил на собственные планы, а телефон молчит до утра. ➡️ Узнайте подробнее, как устроен наш дата-центр
435
5
❓ FAQ по публичным эндпоинтам Immers Foundation Models — отвечаем на вопросы о тарифах и ограничениях. 📌 При подключении мод+4
❓ FAQ по публичным эндпоинтам Immers Foundation Models — отвечаем на вопросы о тарифах и ограничениях. 📌 При подключении моделей к приложению возникают вопросы: от чего зависит стоимость, как узнать об изменении тарифов и какие лимиты нужно учитывать при работе с API? 📲 В карусели разбираем: — От чего зависят цены на модели и как меняются тарифы; — Как пользователи узнают об изменении стоимости; — Есть ли ограничения на количество токенов в минуту и одновременных запросов; — Как учитываются лимиты для аккаунтов, API-ключей и моделей; — Можно ли увеличить RPM для коммерческого сервиса; — Допускается ли использовать несколько токенов для увеличения суммарного RPM. ⚙️ Эти ответы помогут разобраться в условиях использования публичного API immers.cloud и учитывать их при планировании расходов и нагрузки на ваш сервис. ➡️ Больше информации — в FAQ на сайте immers.cloud.
472
6
🎉 С Днем системного аналитика! 👨‍💻 Работать системным аналитиком — это как вести детективное расследование. У каждого учас
🎉 С Днем системного аналитика! 👨‍💻 Работать системным аналитиком — это как вести детективное расследование. У каждого участника своя версия того, как должна работать система. В документах встречаются противоречия, важный свидетель в отпуске, а за фразой «тут все просто» скрывается неожиданный поворот сюжета. И стоит задать один точный вопрос, как у дела появляются новые обстоятельства. ❤️ Спасибо, что распутываете сложные истории и помогаете людям с разными взглядами договориться о том, что мы строим и как это должно работать. 🎁 Праздничный подарок от immers.cloud: Пополните свой счет и получите +20% бонусов по этому промокоду!
479
7
📢 Глава Anthropic призвал замедлить развитие ИИ 📰 Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором пред+3
📢 Глава Anthropic призвал замедлить развитие ИИ 📰 Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором предложил снизить темп наращивания возможностей передовых моделей, чтобы исследования безопасности успевали за их развитием. По его словам, ИИ все активнее участвует в создании следующего поколения систем. Такое ускорение может опередить способность людей понимать и контролировать их поведение. 📲 В карточках — инцидент, который усилил его опасения. Что это значит для команд, внедряющих ИИ? 📌 Практический вывод из этой дискуссии — уделять больше внимания проверке моделей перед внедрением: оценивать качество ответов на собственных задачах, устойчивость к ошибкам и допустимые полномочия агентов. Производительность и стоимость запуска также стоит измерять на реальной нагрузке. 🚀 Для такой оценки в immers.cloud можно познакомиться с открытыми моделями через доступные публичные эндпоинты, а для собственного развертывания подобрать GPU-сервер. Это позволяет начать с тестирования и выбрать конфигурацию под требования проекта. ➡️ Выбрать модель и GPU-конфигурацию
456
8
Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL Что важно: 🟠 RTX 4090 достигает предела масшт+9
Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL Что важно: 🟠 RTX 4090 достигает предела масштабирования пропускной способности на уровне ~15 RPS. Объема VRAM хватает для одновременного размещения не более двух контекстов максимальной длины (131k токенов) и при одновременной обработке более 200 запросов начинается вытеснение (preemption) данных из KV-кэша (фактически удаление). Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency. 🟠 KV_OFFLOAD снижает негативный эффект вытеснения путем сохранения уже рассчитанных значений для вытесняемых запросов на хосте, но вносит дополнительные задержки из-за передачи данных между GPU и CPU. 🟠 H100 NVL не допускает вытеснения и обеспечивает линейное масштабирование пропускной способности (запросов / сек) с увеличением RPS благодаря четырехкратному преимуществу в объеме доступной памяти под KV-кэш и при этом обладает гораздо более мощными вычислительными возможностями. ▶️ Арендовать сервер с Н100 NVL 📬 Подписывайтесь на нас в МАХ
497
9
Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не только код. Это постоянное обучение,+4
Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой. Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков. Листайте карусель, чтобы узнать: — сколько разработчиков продолжают учиться — с какими трудностями они сталкиваются ежедневно — как отвлечения влияют на работу С Днём программиста! И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке!
489
10
Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не только код. Это постоянное обучение,+5
Поздравляем разработчиков с профессиональным праздником ❤️ Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой. Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков. Листайте карусель, чтобы узнать: — сколько разработчиков продолжают учиться — с какими трудностями они сталкиваются ежедневно — что делают программисты в свободное время — как отвлечения влияют на работу С Днём программиста! И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке!
1
11
GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млрд активных на токен), контекстом 1+9
GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млрд активных на токен), контекстом 1 048 576 токенов и упором на программирование, рассуждение и долгосрочную работу с инструментами. Что важно: 🟠 Масштабное постобучение. Главное изменение — не архитектура (сохранены MoE, DSA, IndexShare и MTP из GLM-5.2), а расширенное постобучение. Разработчики увеличили вычислительный бюджет, разнообразили тренировочные сценарии и расширили набор сред для длительных задач. 🟠 IndexShare для эффективной работы с длинным контекстом. Технология переиспользования индексов внимания между соседними слоями трансформера: только один слой в группе из четырёх вычисляет индексы, остальные используют их повторно. Это снижает вычислительную сложность при работе с контекстом в 1 млн токенов. 🟠 MoE-архитектура. 256 маршрутизируемых экспертов + 1 общий, top-k = 8 экспертов на токен. Модель поддерживает Multi-Token Prediction, работу с инструментами и управление усилиями рассуждения. Подробнее — в слайдах. ▶️ GLM-5.3 доступна в нашем каталоге Внимание! Для этой модели доступны только частные эндпоинты. Тарификация производится за время фактической аренды сервера, а не за количество обработанных токенов.
622
12
📌 Главные новости ИИ за август 2026 Какие события меняют условия для разработки и внедрения ИИ? ▪️ OpenAI: чему учит инциден+4
📌 Главные новости ИИ за август 2026 Какие события меняют условия для разработки и внедрения ИИ? ▪️ OpenAI: чему учит инцидент с автономными агентами. ▪️ NVIDIA: что финансовые результаты говорят о рынке вычислений. ▪️ AI Act: как новые требования влияют на создание ИИ-сервисов. 📲 Листайте карточки: в каждой — ключевые факты, источники и практический вывод для бизнеса. 🚀 Если вы уже внедряете ИИ, обсудите инфраструктуру проекта с immers.cloud — поможем определить необходимые ресурсы с учётом нагрузки и бюджета.
509
13
Главное за август: новые AI-модели и подключение к Windows-серверам прямо из браузера 🖥 immersView — подключайтесь к рабочем
Главное за август: новые AI-модели и подключение к Windows-серверам прямо из браузера 🖥 immersView — подключайтесь к рабочему столу Windows-сервера без установки и настройки RDP-клиентов. Виртуальная машина открывается как обычная веб-страница. Возможности: — совместный доступ к сессии в режиме просмотра или управления; — общий буфер обмена и передача файлов; — видеопоток до 2K и 60 FPS с GPU-ускорением; — до 30 одновременных подключений. ➡️ Попробовать immersView 🤖 Новые модели в каталоге: Qwen3.8-27B — мультимодальная модель для программирования, агентных сценариев и профессиональных задач. Поддерживает работу с изображениями и контекст до 1 млн токенов. ➡️ Запустить Qwen3.8-27B DeepSeek-V4-Flash-0731 — MoE-модель с усиленными агентными возможностями и контекстом до 1 млн токенов. ➡️ Запустить DeepSeek-V4-Flash-0731 Unlimited-OCR — модель Baidu для распознавания и парсинга многостраничных документов. Обрабатывает десятки страниц за один проход. ➡️ Запустить Unlimited-OCR PaddleOCR-VL-1.6 — компактная мультимодальная модель для распознавания текста, таблиц, формул, диаграмм и печатей. ➡️ Запустить PaddleOCR-VL-1.6 🔑 Токен для работы с моделями через API можно получить на странице управления токенами.
509
14
Что можно запустить на одной RTX 3090 или RTX 4090? 👋 Для многих продуктовых задач не нужны огромные модели и серверы с неск+6
Что можно запустить на одной RTX 3090 или RTX 4090? 👋 Для многих продуктовых задач не нужны огромные модели и серверы с несколькими GPU. Суммаризация, классификация, анализ тональности, обработка изображений и распознавание документов могут работать на одной видеокарте — если правильно подобрать модель. 📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев. Полезные материалы по OCR-моделям из подборки: ▪️ Примеры запросов к baidu/Unlimited-OCR ▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3 ▪️ Лидерборд PaddleOCR ▪️ Демо PaddleOCR для проверки собственного документа 📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах. ➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу. ➡️ Запустить сервер на RTX 3090 ➡️ Запустить сервер на RTX 4090
550
15
📢 Объявляем конкурс с призовым фондом 60 000 бонусов Что такое осень? В этот раз предлагаем ответить не словами, а целым про+2
📢 Объявляем конкурс с призовым фондом 60 000 бонусов Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом. 🌳 Покажите, какой вы видите осень, с помощью возможностей immers.cloud и нейросетей. 📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах. 🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud. Ждем ваши проекты 🍂 👉 Перейти в каталог моделей 👉 Выбрать сервер
590
16
Qwen3.8-27B: плотная модель для агентных задач 👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативны+6
Qwen3.8-27B: плотная модель для агентных задач 👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативным контекстом 262 144 токена и возможностью расширения до 1 млн. Она работает с текстом, изображениями и видео, а лицензия Apache 2.0 позволяет использовать её в приватной инфраструктуре и собственных продуктах. Что важно: ▪️ Гибридная архитектура Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей. ▪️ Масштабное постобучение Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах. ▪️ Multi-Token Prediction MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации. 📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах. ➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен. ☁️ Если потребуется частный сервер, модель доступна на конфигурации 4 × RTX 4090 от 321,77 ₽/ч. #ИИ_Модели #LLM
586
17
DeepSeek-V4-Flash-0731: что обновили в новой версии 👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд+5
DeepSeek-V4-Flash-0731: что обновили в новой версии 👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд параметров. При обработке каждого токена активируются 13 млрд параметров, а контекстное окно достигает 1 048 576 токенов. 📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста. Что важно: ▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания. ▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия. ▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг. 📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах. 📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно. ➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен. ☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100.
622
18
Unlimited-OCR: как распознавать многостраничные документы за один проход 👋 Unlimited-OCR — открытая мультимодальная OCR-моде+6
Unlimited-OCR: как распознавать многостраничные документы за один проход 👋 Unlimited-OCR — открытая мультимодальная OCR-модель от компании Baidu. MoE-архитектура на 3 млрд параметров из которых при генерации активируются только 500 млн. 📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход. Что важно: ▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту. ▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы. ▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса. 📲 Подробнее в слайдах. 📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц. ➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен. ☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч. 📎 Об особенностях направления запросов по API в модель можно узнать по ссылке.
618
19
🚀 Бесплатные публичные AI-эндпоинты В каталоге Immers Foundation Models можно бесплатно протестировать open-source модели че
🚀 Бесплатные публичные AI-эндпоинты В каталоге Immers Foundation Models можно бесплатно протестировать open-source модели через чат или API — без оплаты за токены. Это удобный способ оценить качество генерации, проверить tool calling и собрать прототип. 1. GPT-OSS-20B Компактная модель OpenAI для рассуждений, программирования и агентных задач. ▶️ Протестировать GPT-OSS-20B 2. Llama-3-8B-GPT-4o-RU Версия Llama 3, дообученная для качественной работы с русским языком. ▶️ Протестировать Llama-3-8B-GPT-4o-RU 3. NVIDIA Nemotron-3-Nano-30B-A3B Модель для агентных систем, RAG, обработки длинного контекста и генерации кода. ▶️ Протестировать NVIDIA Nemotron-3-Nano 4. Qwen3-Coder-Next Модель для программирования и автономных coding agents: анализирует репозитории, находит ошибки и предлагает патчи. ▶️ Протестировать Qwen3-Coder-Next 5. Qwen3.5-35B-A3B Мультимодальная модель для текста и изображений с режимами Thinking и No-thinking. ▶️ Протестировать Qwen3.5-35B-A3B 6. Gemma-4-26B-A4B-it Мультимодальная MoE-модель Google для работы с текстом, изображениями и агентными сценариями. ▶️Протестировать Gemma-4-26B-A4B-it 🆕 Новые модели для обработки документов: 7. Unlimited-OCR Распознаёт сразу несколько страниц документа в одном запросе. Подходит для технической документации, архивов и многостраничных контрактов. ▶️ Протестировать Unlimited-OCR 8. PaddleOCR-VL-1.6 Компактная модель для распознавания текста, таблиц, формул и структуры документов. ▶️ Протестировать PaddleOCR-VL-1.6 Выберите модель и тестируйте ее бесплатно на immers.cloud.
669
20
PaddleOCR-VL-1.6: как компактная модель разбирает сложные документы 👋 PaddleOCR-VL-1.6 — открытая мультимодальная модель Pad+5
PaddleOCR-VL-1.6: как компактная модель разбирает сложные документы 👋 PaddleOCR-VL-1.6 — открытая мультимодальная модель PaddlePaddle (Baidu) на 0,9 млрд параметров, специализированная на преобразовании PDF, сканов и фотографий в структурированные Markdown и JSON. 📌 Главное изменение относительно версии 1.5 — не новая архитектура и не увеличение числа параметров, а точечная оптимизация областей данных, в которых предыдущая модель работала нестабильно. Что важно: ▪️ Обработка документов в исходном масштабе Визуальный энкодер NaViT работает с динамическим разрешением и обрабатывает фрагменты изображения без обязательного приведения всей страницы к фиксированному размеру. Это помогает сохранять мелкий текст, формулы и детали сложных таблиц. ▪️ Оптимизация слабых областей Система подготовки данных ищет нестабильные примеры, редкие типы документов и ошибки разметки. Проблемные области используются для расширения данных, а неподтверждённые метки проверяются независимыми экспертными парсерами. ▪️ Разбор структуры документа В полном конвейере PaddleOCR-VL-1.6 используется вместе с PP-DocLayoutV3: модель анализа макета локализует области страницы, а PaddleOCR-VL-1.6 распознаёт текст, таблицы, формулы, графики, печати и порядок чтения. 📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах. 📎 При тестировании обратите внимание на особенности направления запросов по API и рекомендации по синхронизации с моделью PP-DocLayoutV3, подробнее по ссылке. ➡️ PaddleOCR-VL-1.6 можно бесплатно проверить через публичный эндпоинт по API. Для доступа к API достаточно зарегистрироваться, пройти верификацию и получить токен. Если потребуется частный сервер, модель доступна на Tesla A2 от 33,74 ₽/ч. #ИИ_Модели #LLM
574