immers.cloud | Облако с GPU
رفتن به کانال در Telegram
immers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга. Самый большой ассортимент GPU Tesla и RTX 💻 👉 Наш сайт https://immers.cloud/ 🎧 @immerscloudsupport Чат по ИИ - https://t.me/immersAI
نمایش بیشتر945
مشترکین
+124 ساعت
+17 روز
+130 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اکتبر '26اکتبر '26
اکتبر '26
+2
در 0 کانالها
سپتامبر '26
+19
در 0 کانالها
Get PRO
اوت '26
+21
در 0 کانالها
Get PRO
ژوئیه '26
+11
در 0 کانالها
Get PRO
ژوئن '26
+14
در 0 کانالها
Get PRO
مه '26
+11
در 0 کانالها
Get PRO
آوریل '26
+13
در 0 کانالها
Get PRO
مارس '26
+12
در 0 کانالها
Get PRO
فوریه '26
+17
در 0 کانالها
Get PRO
ژانویه '26
+30
در 0 کانالها
Get PRO
دسامبر '25
+32
در 0 کانالها
Get PRO
نوامبر '25
+16
در 0 کانالها
Get PRO
اکتبر '25
+18
در 0 کانالها
Get PRO
سپتامبر '25
+25
در 0 کانالها
Get PRO
اوت '25
+27
در 0 کانالها
Get PRO
ژوئیه '25
+38
در 0 کانالها
Get PRO
ژوئن '25
+26
در 1 کانالها
Get PRO
مه '25
+24
در 1 کانالها
Get PRO
آوریل '25
+40
در 0 کانالها
Get PRO
مارس '25
+15
در 1 کانالها
Get PRO
فوریه '25
+27
در 1 کانالها
Get PRO
ژانویه '25
+40
در 1 کانالها
Get PRO
دسامبر '24
+54
در 1 کانالها
Get PRO
نوامبر '24
+29
در 0 کانالها
Get PRO
اکتبر '24
+97
در 1 کانالها
Get PRO
سپتامبر '24
+91
در 3 کانالها
Get PRO
اوت '24
+191
در 0 کانالها
Get PRO
ژوئیه '24
+518
در 0 کانالها
Get PRO
ژوئن '24
+707
در 1 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 07 اکتبر | 0 | |||
| 06 اکتبر | +1 | |||
| 05 اکتبر | +1 | |||
| 04 اکتبر | 0 | |||
| 03 اکتبر | 0 | |||
| 02 اکتبر | 0 | |||
| 01 اکتبر | 0 |
پستهای کانال
+8
Qwen3.8-Flash-Next: гибридное внимание для ИИ-агентов
👋 Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель: 125 млрд параметров в основной языковой модели, из которых 6 млрд активируются на токен. Она работает с текстом, изображениями и видео, поддерживает нативный контекст 262 144 токена и расширение до 1 млн с YaRN.
Что важно:
▪️ Разреженное глобальное внимание
Архитектура сочетает три рекуррентных слоя Gated DeltaNet с одним слоем Qwen Sparse Attention. QSA отбирает релевантные блоки токенов и вычисляет внимание по выбранному подмножеству, сокращая объем вычислений на длинном контексте.
▪️ N-граммные встраивания
Дополнительная таблица на 51 млрд параметров обогащает представления токенов векторами для коротких последовательностей. Она размещается в оперативной памяти хоста, поэтому всю таблицу не нужно хранить в VRAM.
▪️ Gated Residual
Четыре параллельные ветви остаточного потока обеспечивают управляемую передачу информации между слоями, расширяя возможности преобразования представлений.
📲 Подробнее об архитектуре, бенчмарках, сценариях использования и требованиях к инференсу — в слайдах.
➡️ Модель стоит протестировать на изменении кодовых баз, многошаговых задачах с инструментами и анализе больших документов.
☁️ Для проверки в собственной инфраструктуре модель доступна в Immers Foundation Models на конфигурации 2 × H100 от 703,08 ₽/ч.
#ИИ_Модели #LLM
| 2 | 🎉 С Днем работника ЦОД!
👨🔧 Работать в дата-центре — это как быть за кулисами спектакля, который никогда не заканчивается. На сцене запускают приложения, обучают нейросети и выпускают новые сервисы. За кулисами проверяют, выдержит ли инфраструктура следующий выход.
Здесь важно услышать необычный шум, заметить изменение на графике и вовремя разобраться в причине. А день, за который не произошло ничего примечательного, вполне может быть результатом большой работы.
📲 В карточках заглядываем за кулисы immers.cloud и рассказываем, как устроен наш дата-центр.
🍹 Спасибо всем, кто заботится об этой инфраструктуре. Пусть после смены хватает сил на собственные планы, а телефон молчит до утра.
➡️ Узнайте подробнее, как устроен наш дата-центр | 411 |
| 3 | ❓ FAQ по публичным эндпоинтам Immers Foundation Models — отвечаем на вопросы о тарифах и ограничениях.
📌 При подключении моделей к приложению возникают вопросы: от чего зависит стоимость, как узнать об изменении тарифов и какие лимиты нужно учитывать при работе с API?
📲 В карусели разбираем:
— От чего зависят цены на модели и как меняются тарифы;
— Как пользователи узнают об изменении стоимости;
— Есть ли ограничения на количество токенов в минуту и одновременных запросов;
— Как учитываются лимиты для аккаунтов, API-ключей и моделей;
— Можно ли увеличить RPM для коммерческого сервиса;
— Допускается ли использовать несколько токенов для увеличения суммарного RPM.
⚙️ Эти ответы помогут разобраться в условиях использования публичного API immers.cloud и учитывать их при планировании расходов и нагрузки на ваш сервис.
➡️ Больше информации — в FAQ на сайте immers.cloud. | 454 |
| 4 | 🎉 С Днем системного аналитика!
👨💻 Работать системным аналитиком — это как вести детективное расследование. У каждого участника своя версия того, как должна работать система.
В документах встречаются противоречия, важный свидетель в отпуске, а за фразой «тут все просто» скрывается неожиданный поворот сюжета. И стоит задать один точный вопрос, как у дела появляются новые обстоятельства.
❤️ Спасибо, что распутываете сложные истории и помогаете людям с разными взглядами договориться о том, что мы строим и как это должно работать.
🎁 Праздничный подарок от immers.cloud:
Пополните свой счет и получите +20% бонусов по этому промокоду! | 476 |
| 5 | 📢 Глава Anthropic призвал замедлить развитие ИИ
📰 Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором предложил снизить темп наращивания возможностей передовых моделей, чтобы исследования безопасности успевали за их развитием.
По его словам, ИИ все активнее участвует в создании следующего поколения систем. Такое ускорение может опередить способность людей понимать и контролировать их поведение.
📲 В карточках — инцидент, который усилил его опасения.
Что это значит для команд, внедряющих ИИ?
📌 Практический вывод из этой дискуссии — уделять больше внимания проверке моделей перед внедрением: оценивать качество ответов на собственных задачах, устойчивость к ошибкам и допустимые полномочия агентов. Производительность и стоимость запуска также стоит измерять на реальной нагрузке.
🚀 Для такой оценки в immers.cloud можно познакомиться с открытыми моделями через доступные публичные эндпоинты, а для собственного развертывания подобрать GPU-сервер. Это позволяет начать с тестирования и выбрать конфигурацию под требования проекта.
➡️ Выбрать модель и GPU-конфигурацию | 456 |
| 6 | Сравнительный анализ инференса модели openai/gpt-oss-20 на RTX 4090 и H100 NVL
Что важно:
🟠 RTX 4090 достигает предела масштабирования пропускной способности на уровне ~15 RPS. Объема VRAM хватает для одновременного размещения не более двух контекстов максимальной длины (131k токенов) и при одновременной обработке более 200 запросов начинается вытеснение (preemption) данных из KV-кэша (фактически удаление).
Это приводит к необходимости повторного вычисления значений KV для вытесненного запроса с первого токена, что увеличивает показатели TTFT, ITL и E2E latency.
🟠 KV_OFFLOAD снижает негативный эффект вытеснения путем сохранения уже рассчитанных значений для вытесняемых запросов на хосте, но вносит дополнительные задержки из-за передачи данных между GPU и CPU.
🟠 H100 NVL не допускает вытеснения и обеспечивает линейное масштабирование пропускной способности (запросов / сек) с увеличением RPS благодаря четырехкратному преимуществу в объеме доступной памяти под KV-кэш и при этом обладает гораздо более мощными вычислительными возможностями.
▶️ Арендовать сервер с Н100 NVL
📬 Подписывайтесь на нас в МАХ | 497 |
| 7 | Поздравляем разработчиков с профессиональным праздником ❤️
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
— сколько разработчиков продолжают учиться
— с какими трудностями они сталкиваются ежедневно
— как отвлечения влияют на работу
С Днём программиста!
И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке! | 489 |
| 8 | Поздравляем разработчиков с профессиональным праздником ❤️
Работа программиста — это не только код. Это постоянное обучение, поиск решений в чужом коде, баланс между фокусом и коммуникацией с командой.
Мы подготовили карточки с данными о том, как на самом деле устроена работа разработчиков.
Листайте карусель, чтобы узнать:
— сколько разработчиков продолжают учиться
— с какими трудностями они сталкиваются ежедневно
— что делают программисты в свободное время
— как отвлечения влияют на работу
С Днём программиста!
И куда же без подарка! По этому промокоду вы получите +20% к пополнению баланса в нашем облаке! | 1 |
| 9 | GLM-5.3 — текстовая MoE-модель семейства GLM-5 от Z.ai с 753 млрд параметров (около 40 млрд активных на токен), контекстом 1 048 576 токенов и упором на программирование, рассуждение и долгосрочную работу с инструментами.
Что важно:
🟠 Масштабное постобучение. Главное изменение — не архитектура (сохранены MoE, DSA, IndexShare и MTP из GLM-5.2), а расширенное постобучение. Разработчики увеличили вычислительный бюджет, разнообразили тренировочные сценарии и расширили набор сред для длительных задач.
🟠 IndexShare для эффективной работы с длинным контекстом. Технология переиспользования индексов внимания между соседними слоями трансформера: только один слой в группе из четырёх вычисляет индексы, остальные используют их повторно. Это снижает вычислительную сложность при работе с контекстом в 1 млн токенов.
🟠 MoE-архитектура. 256 маршрутизируемых экспертов + 1 общий, top-k = 8 экспертов на токен. Модель поддерживает Multi-Token Prediction, работу с инструментами и управление усилиями рассуждения.
Подробнее — в слайдах.
▶️ GLM-5.3 доступна в нашем каталоге
Внимание! Для этой модели доступны только частные эндпоинты. Тарификация производится за время фактической аренды сервера, а не за количество обработанных токенов. | 622 |
| 10 | 📌 Главные новости ИИ за август 2026
Какие события меняют условия для разработки и внедрения ИИ?
▪️ OpenAI: чему учит инцидент с автономными агентами.
▪️ NVIDIA: что финансовые результаты говорят о рынке вычислений.
▪️ AI Act: как новые требования влияют на создание ИИ-сервисов.
📲 Листайте карточки: в каждой — ключевые факты, источники и практический вывод для бизнеса.
🚀 Если вы уже внедряете ИИ, обсудите инфраструктуру проекта с immers.cloud — поможем определить необходимые ресурсы с учётом нагрузки и бюджета. | 509 |
| 11 | Главное за август: новые AI-модели и подключение к Windows-серверам прямо из браузера
🖥 immersView — подключайтесь к рабочему столу Windows-сервера без установки и настройки RDP-клиентов. Виртуальная машина открывается как обычная веб-страница.
Возможности:
— совместный доступ к сессии в режиме просмотра или управления;
— общий буфер обмена и передача файлов;
— видеопоток до 2K и 60 FPS с GPU-ускорением;
— до 30 одновременных подключений.
➡️ Попробовать immersView
🤖 Новые модели в каталоге:
Qwen3.8-27B — мультимодальная модель для программирования, агентных сценариев и профессиональных задач. Поддерживает работу с изображениями и контекст до 1 млн токенов.
➡️ Запустить Qwen3.8-27B
DeepSeek-V4-Flash-0731 — MoE-модель с усиленными агентными возможностями и контекстом до 1 млн токенов.
➡️ Запустить DeepSeek-V4-Flash-0731
Unlimited-OCR — модель Baidu для распознавания и парсинга многостраничных документов. Обрабатывает десятки страниц за один проход.
➡️ Запустить Unlimited-OCR
PaddleOCR-VL-1.6 — компактная мультимодальная модель для распознавания текста, таблиц, формул, диаграмм и печатей.
➡️ Запустить PaddleOCR-VL-1.6
🔑 Токен для работы с моделями через API можно получить на странице управления токенами. | 509 |
| 12 | Что можно запустить на одной RTX 3090 или RTX 4090?
👋 Для многих продуктовых задач не нужны огромные модели и серверы с несколькими GPU. Суммаризация, классификация, анализ тональности, обработка изображений и распознавание документов могут работать на одной видеокарте — если правильно подобрать модель.
📌 В карточках разобрали решения для RTX 3090 и RTX 4090: компактные языковые модели, мультимодальные возможности, специализированный OCR и модель для агентских сценариев.
Полезные материалы по OCR-моделям из подборки:
▪️ Примеры запросов к baidu/Unlimited-OCR
▪️ Инструкция по запуску PaddleOCR-VL вместе с PP-DocLayoutV3
▪️ Лидерборд PaddleOCR
▪️ Демо PaddleOCR для проверки собственного документа
📲 Какие модели подходят для каждой карты и чего от них ожидать — в слайдах.
➡️ В Immers Foundation Models можно изучить доступные open-source модели и развернуть подходящее решение на GPU под конкретную продуктовую задачу.
➡️ Запустить сервер на RTX 3090
➡️ Запустить сервер на RTX 4090 | 550 |
| 13 | 📢 Объявляем конкурс с призовым фондом 60 000 бонусов
Что такое осень? В этот раз предлагаем ответить не словами, а целым проектом.
🌳 Покажите, какой вы видите осень, с помощью возможностей immers.cloud и нейросетей.
📲 Что можно отправить, каким требованиям должна соответствовать работа, какие призы ждут победителей и когда всё это произойдет — собрали в слайдах.
🗓 До 3 сентября отправьте работу на почту маркетинга marketing@immers.cloud.
Ждем ваши проекты 🍂
👉 Перейти в каталог моделей
👉 Выбрать сервер | 590 |
| 14 | Qwen3.8-27B: плотная модель для агентных задач
👋 Qwen3.8-27B — открытая мультимодальная модель с 27 млрд параметров, нативным контекстом 262 144 токена и возможностью расширения до 1 млн. Она работает с текстом, изображениями и видео, а лицензия Apache 2.0 позволяет использовать её в приватной инфраструктуре и собственных продуктах.
Что важно:
▪️ Гибридная архитектура
Модель сохраняет основу Qwen3.5 и Qwen3.6: 64 слоя объединяют Gated DeltaNet для эффективной обработки длинных последовательностей и Gated Attention для сохранения глобальных зависимостей.
▪️ Масштабное постобучение
Главное изменение связано не с архитектурой, а с обучением с подкреплением в усложняющихся агентных средах.
▪️ Multi-Token Prediction
MTP прогнозирует несколько будущих токенов и может применяться для спекулятивного декодирования. Это особенно полезно при развёртывании модели в сценариях, где важна скорость генерации.
📲 Подробнее об архитектуре, управлении рассуждением, бенчмарках и требованиях к инференсу — в слайдах.
➡️ Qwen3.8-27B можно бесплатно проверить через публичный эндпоинт по API. Для доступа достаточно зарегистрироваться, пройти верификацию и получить токен.
☁️ Если потребуется частный сервер, модель доступна на конфигурации 4 × RTX 4090 от 321,77 ₽/ч.
#ИИ_Модели #LLM | 586 |
| 15 | DeepSeek-V4-Flash-0731: что обновили в новой версии
👋 DeepSeek-V4-Flash-0731 — обновлённая текстовая MoE-модель на 305 млрд параметров. При обработке каждого токена активируются 13 млрд параметров, а контекстное окно достигает 1 048 576 токенов.
📌 Главная инженерная инновация линейки V4 — гибридное внимание, снижающее затраты на обработку длинного контекста.
Что важно:
▪️ Compressed Sparse Attention сжимает контекст в пропорции 1:4, после чего Lightning Indexer отбирает наиболее релевантные блоки для вычисления внимания.
▪️ Heavily Compressed Attention применяет сжатие 1:128 и сохраняет глобальный обзор всей истории. Скользящее окно из 128 токенов параллельно обрабатывает ближайший контекст без сжатия.
▪️ Встроенный модуль DSpark поддерживает спекулятивное декодирование: предлагает несколько будущих токенов и позволяет основной модели проверить их за один шаг.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 Оригинальные веса в формате 8-bit занимают около 155,43 GiB. Память под KV-cache при работе с контекстом до миллиона токенов необходимо рассчитывать отдельно.
➡️ Бесплатно проверить DeepSeek-V4-Flash-0731 можно через публичный API-эндпоинт в каталоге Immers Foundation Models. Для доступа необходимо зарегистрироваться, пройти верификацию и выпустить токен.
☁️ Для изолированного развёртывания в immers.cloud модель доступна на конфигурациях 2 × H200 или 4 × H100. | 622 |
| 16 | Unlimited-OCR: как распознавать многостраничные документы за один проход
👋 Unlimited-OCR — открытая мультимодальная OCR-модель от компании Baidu. MoE-архитектура на 3 млрд параметров из которых при генерации активируются только 500 млн.
📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход.
Что важно:
▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту.
▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы.
▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса.
📲 Подробнее в слайдах.
📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц.
➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен.
☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч.
📎 Об особенностях направления запросов по API в модель можно узнать по ссылке. | 618 |
| 17 | 🚀 Бесплатные публичные AI-эндпоинты
В каталоге Immers Foundation Models можно бесплатно протестировать open-source модели через чат или API — без оплаты за токены. Это удобный способ оценить качество генерации, проверить tool calling и собрать прототип.
1. GPT-OSS-20B
Компактная модель OpenAI для рассуждений, программирования и агентных задач.
▶️ Протестировать GPT-OSS-20B
2. Llama-3-8B-GPT-4o-RU
Версия Llama 3, дообученная для качественной работы с русским языком.
▶️ Протестировать Llama-3-8B-GPT-4o-RU
3. NVIDIA Nemotron-3-Nano-30B-A3B
Модель для агентных систем, RAG, обработки длинного контекста и генерации кода.
▶️ Протестировать NVIDIA Nemotron-3-Nano
4. Qwen3-Coder-Next
Модель для программирования и автономных coding agents: анализирует репозитории, находит ошибки и предлагает патчи.
▶️ Протестировать Qwen3-Coder-Next
5. Qwen3.5-35B-A3B
Мультимодальная модель для текста и изображений с режимами Thinking и No-thinking.
▶️ Протестировать Qwen3.5-35B-A3B
6. Gemma-4-26B-A4B-it
Мультимодальная MoE-модель Google для работы с текстом, изображениями и агентными сценариями.
▶️Протестировать Gemma-4-26B-A4B-it
🆕 Новые модели для обработки документов:
7. Unlimited-OCR
Распознаёт сразу несколько страниц документа в одном запросе. Подходит для технической документации, архивов и многостраничных контрактов.
▶️ Протестировать Unlimited-OCR
8. PaddleOCR-VL-1.6
Компактная модель для распознавания текста, таблиц, формул и структуры документов.
▶️ Протестировать PaddleOCR-VL-1.6
Выберите модель и тестируйте ее бесплатно на immers.cloud. | 669 |
| 18 | PaddleOCR-VL-1.6: как компактная модель разбирает сложные документы
👋 PaddleOCR-VL-1.6 — открытая мультимодальная модель PaddlePaddle (Baidu) на 0,9 млрд параметров, специализированная на преобразовании PDF, сканов и фотографий в структурированные Markdown и JSON.
📌 Главное изменение относительно версии 1.5 — не новая архитектура и не увеличение числа параметров, а точечная оптимизация областей данных, в которых предыдущая модель работала нестабильно.
Что важно:
▪️ Обработка документов в исходном масштабе
Визуальный энкодер NaViT работает с динамическим разрешением и обрабатывает фрагменты изображения без обязательного приведения всей страницы к фиксированному размеру. Это помогает сохранять мелкий текст, формулы и детали сложных таблиц.
▪️ Оптимизация слабых областей
Система подготовки данных ищет нестабильные примеры, редкие типы документов и ошибки разметки. Проблемные области используются для расширения данных, а неподтверждённые метки проверяются независимыми экспертными парсерами.
▪️ Разбор структуры документа
В полном конвейере PaddleOCR-VL-1.6 используется вместе с PP-DocLayoutV3: модель анализа макета локализует области страницы, а PaddleOCR-VL-1.6 распознаёт текст, таблицы, формулы, графики, печати и порядок чтения.
📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах.
📎 При тестировании обратите внимание на особенности направления запросов по API и рекомендации по синхронизации с моделью PP-DocLayoutV3, подробнее по ссылке.
➡️ PaddleOCR-VL-1.6 можно бесплатно проверить через публичный эндпоинт по API. Для доступа к API достаточно зарегистрироваться, пройти верификацию и получить токен.
Если потребуется частный сервер, модель доступна на Tesla A2 от 33,74 ₽/ч.
#ИИ_Модели #LLM | 574 |
| 19 | 🖥 immersView — рабочий стол Windows в браузере
👋 Нужно подключиться к Windows-серверу, когда основного компьютера нет рядом? Или показать результат коллеге и вместе поработать с одной виртуальной машиной?
В карусели:
→ как открыть рабочий стол Windows без отдельного RDP-клиента
→ как пригласить других участников и настроить доступ
→ как передавать файлы и работать при разной скорости интернета
→ как подключиться за пять шагов
→ что делать, если кнопки immersView нет в панели управления
📲 Листайте слайды и сохраняйте инструкцию, чтобы она была под рукой. Браузерное подключение можно попробовать уже сейчас.
🎥 Смотрите подробный видеогайд:
📱 ВК
📱 YouTube
📺 Rutube | 555 |
| 20 | Kimi-K3: новый масштаб открытых моделей
👋 Kimi-K3 — мультимодальная MoE-модель Moonshot AI с 2,8 трлн параметров, контекстом до 1 млн токенов и открытыми весами. Это первая открытая модель класса 3T — масштаб, который до сих пор оставался преимущественно за закрытыми системами.
🚀 Релиз уже стал заметным событием для сообщества: за первые дни преодолела отметку 8 тыс. лайков, а сейчас приближается к 10 тыс.
Что важно:
▪️ KDA + Gated MLA
69 слоёв используют компактное рекуррентное внимание KDA, а 24 слоя Gated MLA сохраняют глобальную работу с контекстом. Гибридная схема рассчитана на последовательности длиной до 1 млн токенов.
▪️ Attention Residuals
Модель не просто передаёт residual-состояние от слоя к слою, а выборочно извлекает представления из предыдущих уровней. Это помогает управлять потоком информации в сети глубиной 93 слоя.
▪️ Stable LatentMoE
Перед передачей экспертам активации сжимаются в латентное пространство вдвое меньшей размерности. В результате из 2,8 трлн параметров на токен активируется 104 млрд, а вычисления и коммуникации между экспертами остаются управляемыми.
📲 Подробнее о KDA, Attention Residuals, Stable LatentMoE и результатах модели — в слайдах.
➡️ Перейти на страницу Kimi-K3
➡️ Посмотреть другие модели в каталоге Immers Foundation Models
#ИИ_Модели #LLM | 566 |
