immers.cloud | Облако с GPU
前往频道在 Telegram
immers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга. Самый большой ассортимент GPU Tesla и RTX 💻 👉 Наш сайт https://immers.cloud/ 🎧 @immerscloudsupport Чат по ИИ - https://t.me/immersAI
显示更多943
订阅者
-124 小时
+17 天
-230 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
八月 '26
八月 '26
+18
在0个频道中
七月 '26
+11
在0个频道中
Get PRO
六月 '26
+14
在0个频道中
Get PRO
五月 '26
+11
在0个频道中
Get PRO
四月 '26
+13
在0个频道中
Get PRO
三月 '26
+12
在0个频道中
Get PRO
二月 '26
+17
在0个频道中
Get PRO
一月 '26
+30
在0个频道中
Get PRO
十二月 '25
+32
在0个频道中
Get PRO
十一月 '25
+16
在0个频道中
Get PRO
十月 '25
+18
在0个频道中
Get PRO
九月 '25
+25
在0个频道中
Get PRO
八月 '25
+27
在0个频道中
Get PRO
七月 '25
+38
在0个频道中
Get PRO
六月 '25
+26
在1个频道中
Get PRO
五月 '25
+24
在1个频道中
Get PRO
四月 '25
+40
在0个频道中
Get PRO
三月 '25
+15
在1个频道中
Get PRO
二月 '25
+27
在1个频道中
Get PRO
一月 '25
+40
在1个频道中
Get PRO
十二月 '24
+54
在1个频道中
Get PRO
十一月 '24
+29
在0个频道中
Get PRO
十月 '24
+97
在1个频道中
Get PRO
九月 '24
+91
在3个频道中
Get PRO
八月 '24
+191
在0个频道中
Get PRO
七月 '24
+518
在0个频道中
Get PRO
六月 '24
+707
在1个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 26 八月 | 0 | |||
| 25 八月 | +1 | |||
| 24 八月 | +2 | |||
| 23 八月 | +1 | |||
| 22 八月 | +1 | |||
| 21 八月 | +2 | |||
| 20 八月 | 0 | |||
| 19 八月 | 0 | |||
| 18 八月 | +1 | |||
| 17 八月 | +2 | |||
| 16 八月 | +1 | |||
| 15 八月 | 0 | |||
| 14 八月 | 0 | |||
| 13 八月 | 0 | |||
| 12 八月 | 0 | |||
| 11 八月 | 0 | |||
| 10 八月 | +1 | |||
| 09 八月 | 0 | |||
| 08 八月 | +2 | |||
| 07 八月 | 0 | |||
| 06 八月 | 0 | |||
| 05 八月 | +1 | |||
| 04 八月 | +1 | |||
| 03 八月 | +2 | |||
| 02 八月 | 0 | |||
| 01 八月 | 0 |
频道帖子
+2
📢 Объявляем конкурс с призовым фондом 60 000 бонусов
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
🌳 Покажите, какой вы видите осень, с помощью возможностей immers.cloud и нейросетей.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер
| 2 | Qwen3.8-27B: плотная модель для агентных задач
👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативным контекстом 262 144 токена и возможностью расширения до 1 млн. Она работает с текстом, изображениями и видео, а лицензия Apache 2.0 позволяет использовать её в приватной инфраструктуре и собственных продуктах.
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
☁️ Если потребуется частный сервер, модель доступна на конфигурации 4 × RTX 4090 от 321,77 ₽/ч.
#ИИ_Модели #LLM | 508 |
| 3 | DeepSeek-V4-Flash-0731: что обновили в новой версии
👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд параметров. При обработке каждого токена активируются 13 млрд параметров, а контекстное окно достигает 1 048 576 токенов.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100. | 582 |
| 4 | Unlimited-OCR: как распознавать многостраничные документы за один проход
👋 Unlimited-OCR — открытая мультимодальная OCR-модель от компании Baidu. MoE-архитектура на 3 млрд параметров из которых при генерации активируются только 500 млн.
📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход.
Что важно:
▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту.
▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы.
▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса.
📲 Подробнее в слайдах.
📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц.
➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен.
☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч.
📎 Об особенностях направления запросов по API в модель можно узнать по ссылке. | 614 |
| 5 | 🚀 Бесплатные публичные AI-эндпоинты
В каталоге Immers Foundation Models можно бесплатно протестировать open-source модели через чат или API — без оплаты за токены. Это удобный способ оценить качество генерации, проверить tool calling и собрать прототип.
1. GPT-OSS-20B
Компактная модель OpenAI для рассуждений, программирования и агентных задач.
▶️ Протестировать GPT-OSS-20B
2. Llama-3-8B-GPT-4o-RU
Версия Llama 3, дообученная для качественной работы с русским языком.
▶️ Протестировать Llama-3-8B-GPT-4o-RU
3. NVIDIA Nemotron-3-Nano-30B-A3B
Модель для агентных систем, RAG, обработки длинного контекста и генерации кода.
▶️ Протестировать NVIDIA Nemotron-3-Nano
4. Qwen3-Coder-Next
Модель для программирования и автономных coding agents: анализирует репозитории, находит ошибки и предлагает патчи.
▶️ Протестировать Qwen3-Coder-Next
5. Qwen3.5-35B-A3B
Мультимодальная модель для текста и изображений с режимами Thinking и No-thinking.
▶️ Протестировать Qwen3.5-35B-A3B
6. Gemma-4-26B-A4B-it
Мультимодальная MoE-модель Google для работы с текстом, изображениями и агентными сценариями.
▶️Протестировать Gemma-4-26B-A4B-it
🆕 Новые модели для обработки документов:
7. Unlimited-OCR
Распознаёт сразу несколько страниц документа в одном запросе. Подходит для технической документации, архивов и многостраничных контрактов.
▶️ Протестировать Unlimited-OCR
8. PaddleOCR-VL-1.6
Компактная модель для распознавания текста, таблиц, формул и структуры документов.
▶️ Протестировать PaddleOCR-VL-1.6
Выберите модель и тестируйте ее бесплатно на immers.cloud. | 669 |
| 6 | PaddleOCR-VL-1.6: как компактная модель разбирает сложные документы
👋 PaddleOCR-VL-1.6 — открытая мультимодальная модель PaddlePaddle (Baidu) на 0,9 млрд параметров, специализированная на преобразовании PDF, сканов и фотографий в структурированные Markdown и JSON.
📌 Главное изменение относительно версии 1.5 — не новая архитектура и не увеличение числа параметров, а точечная оптимизация областей данных, в которых предыдущая модель работала нестабильно.
Что важно:
▪️ Обработка документов в исходном масштабе
Визуальный энкодер NaViT работает с динамическим разрешением и обрабатывает фрагменты изображения без обязательного приведения всей страницы к фиксированному размеру. Это помогает сохранять мелкий текст, формулы и детали сложных таблиц.
▪️ Оптимизация слабых областей
Система подготовки данных ищет нестабильные примеры, редкие типы документов и ошибки разметки. Проблемные области используются для расширения данных, а неподтверждённые метки проверяются независимыми экспертными парсерами.
▪️ Разбор структуры документа
В полном конвейере PaddleOCR-VL-1.6 используется вместе с PP-DocLayoutV3: модель анализа макета локализует области страницы, а PaddleOCR-VL-1.6 распознаёт текст, таблицы, формулы, графики, печати и порядок чтения.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 При тестировании обратите внимание на особенности направления запросов по API и рекомендации по синхронизации с моделью PP-DocLayoutV3, подробнее по ссылке.
➡️ PaddleOCR-VL-1.6 можно бесплатно проверить через публичный эндпоинт по API. Для доступа к API достаточно зарегистрироваться, пройти верификацию и получить токен.
Если потребуется частный сервер, модель доступна на Tesla A2 от 33,74 ₽/ч.
#ИИ_Модели #LLM | 574 |
| 7 | 🖥 immersView — рабочий стол Windows в браузере
👋 Нужно подключиться к Windows-серверу, когда основного компьютера нет рядом? Или показать результат коллеге и вместе поработать с одной виртуальной машиной?
В карусели:
→ как открыть рабочий стол Windows без отдельного RDP-клиента
→ как пригласить других участников и настроить доступ
→ как передавать файлы и работать при разной скорости интернета
→ как подключиться за пять шагов
→ что делать, если кнопки immersView нет в панели управления
📲 Листайте слайды и сохраняйте инструкцию, чтобы она была под рукой. Браузерное подключение можно попробовать уже сейчас.
🎥 Смотрите подробный видеогайд:
📱 ВК
📱 YouTube
📺 Rutube | 555 |
| 8 | Kimi-K3: новый масштаб открытых моделей
👋 Kimi-K3 — мультимодальная MoE-модель Moonshot AI с 2,8 трлн параметров, контекстом до 1 млн токенов и открытыми весами. Это первая открытая модель класса 3T — масштаб, который до сих пор оставался преимущественно за закрытыми системами.
🚀 Релиз уже стал заметным событием для сообщества: за первые дни преодолела отметку 8 тыс. лайков, а сейчас приближается к 10 тыс.
Что важно:
▪️ KDA + Gated MLA
69 слоёв используют компактное рекуррентное внимание KDA, а 24 слоя Gated MLA сохраняют глобальную работу с контекстом. Гибридная схема рассчитана на последовательности длиной до 1 млн токенов.
▪️ Attention Residuals
Модель не просто передаёт residual-состояние от слоя к слою, а выборочно извлекает представления из предыдущих уровней. Это помогает управлять потоком информации в сети глубиной 93 слоя.
▪️ Stable LatentMoE
Перед передачей экспертам активации сжимаются в латентное пространство вдвое меньшей размерности. В результате из 2,8 трлн параметров на токен активируется 104 млрд, а вычисления и коммуникации между экспертами остаются управляемыми.
📲 Подробнее о KDA, Attention Residuals, Stable LatentMoE и результатах модели — в слайдах.
➡️ Перейти на страницу Kimi-K3
➡️ Посмотреть другие модели в каталоге Immers Foundation Models
#ИИ_Модели #LLM | 566 |
| 9 | Сегодня, в последнюю пятницу июля, мы отмечаем День системного администратора.
⚙️ Эпоха обжима витой пары, настройки локальных принтеров и физического обслуживания железа постепенно уходит в прошлое. Сегодня фокус профессии сместился на оркестрацию контейнеров, управление распределенными системами, автоматизацию (IaC) и обеспечение отказоустойчивости облачных архитектур. Инструменты изменились, но главная цель осталась прежней: гарантировать бесперебойную работу цифрового мира.
🎉 Мы поздравляем инженеров, администраторов и всех, кто причастен к поддержке и развитию инфраструктуры!
Желаем, чтобы:
• Uptime стремился к 99.99%, а SLA всегда оставался в «зеленой зоне»;
• Релизы и деплои проходили по расписанию, а необходимость в экстренных откатах (rollback) свелась к нулю;
• Мониторинг реагировал только на реальные инциденты, а алерты не нарушали личные границы в выходные;
• Резервные копии всегда успешно проходили тесты на восстановление, а RTO и RPO соответствовали самым строгим требованиям.
Ваша работа часто остается незаметной для конечного пользователя, пока система работает штатно. Именно вы создаете надежный фундамент, на котором строятся бизнес-процессы и развиваются современные технологии.
❤️ Спасибо специалистам, благодаря которым цифровая инфраструктура остаётся надёжной, управляемой и безопасной. Желаем стабильной работы систем, успешной автоматизации и как можно меньше внештатных ситуаций!
🎁 В этот день мы подготовили для вас подарок — бонус 10% на пополнение счета! (Количество ограничено) | 562 |
| 10 | 📢 SK Hynix прогнозирует усиление дефицита памяти в 2027 году
📰 SK Hynix — один из крупнейших производителей памяти и ключевой поставщик HBM для AI-ускорителей NVIDIA. От объёма и пропускной способности HBM напрямую зависит производительность GPU при обучении и инференсе нейросетей.
Глава SK Hynix предупредил, что в 2027 году отрасль может столкнуться с наиболее серьёзным дефицитом памяти за всю свою историю. По прогнозу компании, спрос продолжит превышать её производственные возможности и после 2030 года — несмотря на расширение производства.
Источник: Материал Reuters на Investing.com
💾 Что это значит для пользователей GPU?
Чем меньше доступной памяти, тем сложнее производителям наращивать выпуск серверных ускорителей. Это может привести к ограниченному выбору конфигураций, увеличению сроков поставки и росту стоимости оборудования.
В результате покупка собственного оборудования становится менее предсказуемой: дорогостоящий сервер нужно заказывать заранее, а его конфигурация может не соответствовать реальной нагрузке.
☁️ Как снизить инфраструктурный риск?
В каталоге Immers Foundation Models можно заранее оценить требования нейросети к памяти и выбрать подходящую GPU-конфигурацию.
Часть моделей доступна через публичные эндпоинты — их можно протестировать в чате или по API до запуска собственного сервера.
Для постоянной нагрузки модель можно развернуть как частный эндпоинт на GPU-сервере immers.cloud. Это позволяет не покупать оборудование заранее, подбирать ресурсы под конкретную задачу и масштабировать инфраструктуру по мере роста нагрузки.
✅ Вы платите за время работы выбранных серверных ресурсов, а не вкладываетесь в GPU, которые могут оказаться избыточными или недоступными в нужный момент.
➡️ Выбрать модель и GPU-конфигурацию | 523 |
| 11 | Что влияет на расход VRAM?
👋 Во время инференса память GPU расходуется сразу на несколько задач: хранение весов, KV-кэш, временные активации, batch, CUDA Graphs, служебные буферы и внутренние механизмы inference-фреймворка. Итоговое потребление зависит не только от самой модели, но и от того, как именно она используется.
📌 Один и тот же LLM может без проблем работать с короткими запросами, но столкнуться с нехваткой памяти при длинном контексте, большом числе одновременных пользователей или высокой параллельной нагрузке.
▪️ Именно поэтому сервер подбирают не только по размеру модели. Для корректного расчёта важно учитывать рабочий сценарий, длину контекста, ожидаемую генерацию, batch size, max concurrency, особенности GPU и используемый inference-фреймворк.
📲 Подробнее — в слайдах.
➡️ В Immers Foundation Models можно изучить характеристики open-source моделей, посмотреть рекомендуемые требования к ресурсам и протестировать модель через публичный эндпоинт, если он доступен. Для production-задач можно развернуть приватный сервер с GPU и подобрать конфигурацию под свою нагрузку. | 565 |
| 12 | Что можно узнать из названия AI-модели?
👋 В названии ML-модели часто уже есть технические подсказки: линейка, поколение, размер, архитектура, специализация и формат весов.
📌 Например, в Qwen3.6-35B-A3B — 35B показывает общий размер модели, а A3B — активную часть MoE-модели, которая участвует в обработке одного токена.
➕ Суффиксы тоже важны. Code может указывать на специализацию под кодинг, it / instruct — на дообучение под инструкции, а FP8, INT4, AWQ или BF16 — на формат весов или квантизацию.
Название помогает быстро отсеять неподходящие варианты, но финальное решение лучше принимать по карточке модели: смотреть веса, VRAM, контекст, доступные конфигурации и стоимость запуска.
📲 Подробнее — в слайдах.
➡️ В Immers Foundation Models можно открыть карточку модели, проверить требования к ресурсам и перейти к запуску. Если доступен публичный эндпоинт — сначала протестировать модель перед приватным развёртыванием. | 570 |
| 13 | MiniMax-M3: как модель работает с 1M контекста
👋 MiniMax-M3 — открытая мультимодальная MoE-модель семейства MiniMax, рассчитанная на кодинг, агентные сценарии и инференс с длинным контекстом.
Главная особенность модели — MiniMax Sparse Attention: разреженное внимание, которое помогает обрабатывать последовательности до 1 048 576 токенов без линейного роста вычислительной стоимости внимания.
Что важно:
▪️ Контекст до 1M токенов
MiniMax-M3 можно рассматривать для задач, где модели нужно удерживать большие объёмы информации: репозитории, длинные документы, технические спецификации, логи, видео и многошаговые цепочки действий.
▪️ MiniMax Sparse Attention
MSA состоит из двух веток. Index Branch сначала оценивает блоки ключей-значений и выбирает релевантные части длинного контекста. Main Branch затем считает точное внимание только по выбранным блокам, а локальный блок ближайшего окружения токена сохраняется всегда.
▪️ Ниже стоимость внимания
При контексте 1 миллион токенов MSA сокращает вычислительные затраты на внимание на один токен в 28,4 раза по сравнению с GQA. Это критично для длинного контекста, где обычное внимание быстро становится дорогим по вычислениям и памяти.
📲 Подробнее — в слайдах.
➡️ MiniMax-M3 доступна через каталог моделей Immers Foundation Models: вы платите не за токены, а за время аренды GPU-сервера. Для запуска доступна конфигурация 4 × NVIDIA H200 от 1 717,59 ₽/ч. | 535 |
| 14 | 🚫 Зарубежные API-провайдеры отключают Россию
OpenRouter и некоторые модели на Hugging Face Inference Endpoints все чаще блокируют запросы с российских IP. А если не блокируют — то выставляют счет за каждый токен, который при росте нагрузки превращается в непредсказуемый овердрафт.
Ваш ИИ-продакшен не должен зависеть от геополитики или ценовой политики Кремневой Долины.
👉 immers.cloud запустил Foundation Models — каталог проверенных open-source моделей, которые вы разворачиваете полностью на своем сервере с оплатой только за время работы GPU, а не за токены.
Все модели прошли ручную валидацию:
✔️ Рекомендуемый контекст
✔️ Требования к VRAM для каждой квантизации
✔️ Совместимость с поколениями GPU (от RTX 3090 до H200)
✔️ Максимальное число concurrent-запросов
Система сама подберет подходящую конфигурацию, развернет приватный эндпоинт и настроит OpenAI-совместимый API — за пару кликов.
🚀 Запустите свой инстанс — без VPN, без опасений блокировок, с предсказуемым бюджетом.
→ Immers Foundation Models
→ immers.cloud | 632 |
| 15 | Kimi-K2.7-Code: модель для длинных агентных задач в кодинге
👋 Kimi-K2.7-Code — open-source MoE-модель от Moonshot AI, ориентированная на сценарии, где модель должна не просто написать код, а пройти длинный инженерный цикл: понять задачу, исследовать кодовую базу, проверить гипотезы, вызвать инструменты и сохранить контекст между шагами.
Что важно:
▪️ Фокус на long-horizon coding tasks
Kimi-K2.7-Code рассчитана на задачи, где результат зависит не от одного удачного ответа, а от последовательной работы на длинной траектории. Это важно для рефакторинга, миграции кодовых баз, реализации многофайловых фич, code review и автономной работы по техническим спецификациям.
▪️ Сохранение рассуждений между ходами
Модель принудительно работает в thinking mode, а preserve_thinking позволяет сохранять reasoning-содержание между ходами диалога. Для агентных задач это критично: ассистент должен помнить, какие гипотезы уже проверены, какие ошибки найдены и какие промежуточные решения были приняты.
▪️ Многошаговая работа с инструментами
Kimi-K2.7-Code поддерживает Interleaved Thinking and Multi-Step Tool Call — механизм, который позволяет чередовать рассуждения и вызовы инструментов в одном процессе. За счёт этого модель лучше подходит для инженерных сценариев, где нужно не просто ответить, а выполнить цепочку действий.
📲 Подробнее — в слайдах.
➡️ Развернуть Kimi-K2.7-Code можно через каталог моделей Immers Foundation Models. Для запуска доступны конфигурации 6 × H200 от 2 535,78 ₽/ч или 8 × H200 от 3 338,30 ₽/ч — выбор зависит от требуемого профиля нагрузки и запаса памяти под длинный контекст. | 618 |
| 16 | GLM-5.2: выходит на территорию топовых моделей
👋 GLM-5.2 — open-source MoE-модель от Z.ai для задач, где важны длинный контекст, рассуждение, кодинг и многошаговая работа с инструментами.
Что важно:
▪️ Стабильность на длинных сценариях
GLM-5.2 рассчитана на задачи, где модель должна обрабатывать большой объём входных данных и сохранять связность рассуждения на протяжении нескольких этапов. Это важно для анализа репозиториев, технической документации, исследовательских материалов и агентных пайплайнов.
▪️ Эффективнее работа с большим контекстом
За счёт IndexShare модель снижает избыточные вычисления в индексаторе внимания и делает обработку сверхдлинных последовательностей более практичной. Это особенно важно в задачах, где контекст нельзя сильно сокращать без потери качества результата.
▪️ Фокус на кодинг и работу с инструментами
GLM-5.2 ориентирована на сценарии, где модель не ограничивается генерацией ответа: она анализирует контекст, выполняет промежуточные шаги, работает с инструментами и продолжает задачу с учётом уже полученных данных.
📲 Подробнее — в слайдах.
➡️ GLM-5.2 в 4-битной квантизации можно запустить в immers.cloud на конфигурации 4 × H200 от 1 719,14 ₽/ч. | 587 |
| 17 | Immers Foundation Models: каталог open-source моделей для запуска на GPU-инфраструктуре immers.cloud
📁 В каталоге уже собрано 210 моделей, для которых подобрано более 600 весов. Для части моделей доступны готовые публичные эндпоинты: сейчас можно протестировать 6 моделей через чат или API без подготовки собственного окружения.
🚀 Каталог упрощает путь от выбора модели до запуска: изучить характеристики, оценить требования к ресурсам, подобрать GPU-конфигурацию.
Если хотите разобрать процесс на практике, посмотрите видеогайд «Как запустить AI-модель на собственном сервере?»:
📱 ВК
📱 YouTube
📺 Rutube
➡️ Полное руководство по запуску модели доступно в FAQ immers.cloud.
➡️ Перейти в Immers Foundation Models | 596 |
| 18 | NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели
👋 NVIDIA Nemotron 3 Ultra — крупнейшая модель в линейке Nemotron 3, ориентированная на агентные системы, рассуждения, кодинг, диалог и работу с длинным контекстом.
📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом.
Что важно:
▪️ Гибридная архитектура Nemotron-H + LatentMoE
В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек.
▪️ LatentMoE вместо классической MoE-маршрутизации
Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями.
▪️ Multi-Token Prediction для ускорения генерации
В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов.
📲 Подробнее — в слайдах.
➡️ Запустить Nemotron 3 Ultra можно через каталог моделей immers.cloud. | 560 |
| 19 | Gemma 4 12B: мультимодальность на одной RTX 3090
👋 Gemma 4 12B — модель среднего класса в новой линейке Gemma 4: мощнее компактной E4B, но доступнее старшей 26B A4B MoE.
Что важно:
▪️ Полностью бесэнкодерная архитектура
Gemma 4 12B не использует отдельные визуальные и аудиоэнкодеры. Изображения и аудиоволны напрямую переводятся в токены через линейные проекции и обрабатываются единым decoder-only трансформером. Это упрощает работу с мультимодальностью и делает модель удобнее для инференса и дообучения.
▪️ Мультимодальность в одной модели
Модель работает с текстом, изображениями, видео и аудио, поддерживает длинный контекст до 256K токенов, function calling, режим мышления и Multi-Token Prediction для ускорения инференса.
▪️ Доступность для self-hosting
Gemma 4 12B можно запускать в 4-bit и 8-bit форматах на одной RTX 3090 или 4090. Это делает модель интересной для локальных ассистентов, анализа документов, голосового ввода, видеофрагментов и агентных сценариев.
📲 Подробнее — в слайдах.
➡️ В immers.cloud можно быстро проверить, подходит ли Gemma 4 12B под ваш сценарий: запустить модель, протестировать её на реальных данных и оценить требования к GPU без долгой подготовки окружения. | 567 |
| 20 | Какая тема сайта удобнее? | 556 |
