en
Feedback
GigaDev — разработка GigaChat

GigaDev — разработка GigaChat

Open in Telegram

Истории и статьи про разработку GigaChat от команды разработчиков. Мы рассказываем про все, что связано с языком, речью и искусственным интеллектом

Show more
5 150
Subscribers
No data24 hours
+347 days
+15130 days

Data loading in progress...

Attracting Subscribers
September '26
September '26
+78
in 9 channels
August '26
+222
in 31 channels
Get PRO
July '26
+552
in 45 channels
Get PRO
June '26
+57
in 1 channels
Get PRO
May '26
+37
in 0 channels
Get PRO
April '26
+20
in 22 channels
Get PRO
March '26
+240
in 21 channels
Get PRO
February '26
+200
in 0 channels
Get PRO
January '26
+181
in 0 channels
Get PRO
December '25
+4 321
in 16 channels
Get PRO
November '25
+638
in 48 channels
Get PRO
October '25
+195
in 3 channels
Get PRO
September '25
+235
in 13 channels
Get PRO
August '25
+98
in 4 channels
Get PRO
July '25
+106
in 9 channels
Get PRO
June '25
+134
in 2 channels
Get PRO
May '25
+254
in 14 channels
Get PRO
April '25
+250
in 8 channels
Get PRO
March '25
+342
in 6 channels
Get PRO
February '25
+91
in 0 channels
Get PRO
January '25
+1 269
in 3 channels
Get PRO
December '240
in 4 channels
Get PRO
November '24
+48
in 6 channels
Date
Subscriber Growth
Mentions
Channels
10 September+26
09 September+2
08 September+4
07 September+3
06 September+8
05 September+20
04 September+2
03 September+3
02 September+7
01 September+3
Channel Posts
🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в open source первую модель GigaChat
🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в open source первую модель GigaChat с полноценным рассуждением. В основе — 432B-A28B MoE. После SFT мы обучили с помощью online RL шесть экспертов по разным направлениям: от математики и кода до агентов, диалога и следования инструкциям. Затем собрали их в одну модель через on-policy distillation: ученик генерирует ответ сам, а эксперт нужного домена оценивает каждый его токен, так что ничего из выученного в RL не теряется. Что получилось по сравнению с GigaChat 3.5 Instant: 🔘SWE-Verified: 43 → 65 🔘AIME-2026: 67 → 92 🔘IFBench: 44 → 77 Рассуждения заметно усилили кодовые и базовые агентные навыки: модель вышла в паритет с сильнейшими открытыми и закрытыми моделями в следовании инструкциям, структурированной генерации и поиске информации в длинном контексте. При этом на сложной математике она тратит на 37% меньше токенов, чем конкуренты: высокие результаты не обязательно требуют более длинных рассуждений. На внутренних корзинах в юридическом домене — экзамен по российскому праву, ответы по документам — модель показала себя лучшей среди доступных open source моделей. Также модель хорошо разговаривает на русском, имеет высокие показатели на внутренних и внешних аренах, обгоняя другие русскоязычные нейросети, в первую очередь за счёт фактической точности ответов. Что интересного в обучении: — Среды для агентов построили сами: 55 сред с проверяемым результатом, 12 тысяч задач, часть полностью на русском. — Агент для кода учился внутри настоящих harness. — Curriculum, который перед каждой стадией убирает уже освоенные задачи и позволяет сократить затраты на инференс вдвое. — Нативный FP8 на всех этапах. Подробнее о конвейере обучения, наградах и граблях, на которые мы наступили, — в статье на Хабре. ➡ Хабр: статья ➡ Hugging Face: fp8 | bf16 ➡ GitVerse: репозиторий

2
💵 GigaEmbeddings: новая линейка моделей от 480M до MoE-флагмана 10B-A1.8B Мы обновили всю линейку GigaEmbeddings и выкладыва
💵 GigaEmbeddings: новая линейка моделей от 480M до MoE-флагмана 10B-A1.8B Мы обновили всю линейку GigaEmbeddings и выкладываем в open source сразу три модели — 480M, 3B и 10B-A1.8B. Они стали сильнее на английском языке и особенно в задачах с кодом, получили поддержку vLLM и SGLang и подходят для разных требований к качеству и производительности. Что внутри: 🔘GigaEmbeddings 10B-A1.8B — новый MoE-флагман с 10B общих и всего 1.8B активных параметров; 🔘GigaEmbeddings 3B — универсальная модель с большим приростом на английском языке и в задачах с кодом; 🔘 GigaEmbeddings 480M — компактная модель для высоконагруженного поиска и сценариев, где особенно важны скорость и стоимость инференса; 🔘 Поддержка vLLM и SGLang для быстрого запуска моделей в production. Результаты: 🔘 GigaEmbeddings 10B-A1.8B набирает 74,99 в ruMTEB и занимает первое место в рейтинге; 🔘 Особенно заметно выросло качество на задачах с кодом: новая 3B набирает 76,93 против 62,37 у предыдущего релиза, а на engMTEB занимает 2 место среди моделей своего размера или меньше; 🔘 На vLLM наш MoE-флагман в 1,5 раза быстрее Qwen3 Embedding 4B. Результаты тестирования доступны в открытом рейтинге. Что изменили в обучении: 🔘В несколько раз увеличили объём данных на этапах contrastive pretrain и fine-tuning. 🔘Чтобы сохранить баланс между языками и классами задач, мы использовали мержинг моделей с помощью SLERP на всех этапах обучения. 🔘480M дополнительно обучили через дистилляцию от более сильных моделей: передавали распределения cosine similarity внутри батча с помощью KL divergence. 💡 В результате получилась линейка для разных сценариев: от компактной модели для высоконагруженных систем до MoE-флагмана, который одновременно повышает качество и ускоряет инференс. В ближайшее время также выложим на GitHub подробный гайд по дообучению наших моделей — расскажем о подходах и инструментах, которые использовали в процессе обучения. ➡️ Hugging Face: 480M | 3B | 10B-A1.8B ➡️ GitVerse: 480M | 3B | 10B-A1.8B
5 300
3
💚Хотите познакомиться с командой GigaChat лично? Встречаемся 29 июля! Никаких докладов и презентаций — просто неформальный в
💚Хотите познакомиться с командой GigaChat лично? Встречаемся 29 июля! Никаких докладов и презентаций — просто неформальный вечер на летней веранде: живое общение с коллегами по индустрии, обмен опытом и болями, новые знакомства. Со стороны GigaChat будут лидеры команд Text, Data, Multimodal и Inference. Участие бесплатное, но нужна регистрация ⬅️ Ждём всех! 🎉
4 772
4
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥 Полноценные au
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥 Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026 GigaAM Multilingual Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский 🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder 🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+) 📖 arXiv 🤗 ai-sage/GigaAM-Multilingual 👩‍💻 salute-developers/GigaAM GigaChat Audio Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками 🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио 🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7 у Qwen3-Omni), распознавание эмоций Dusha 90%+ 🔘 Представляем датасет TimeGround-1M — для обучения LLM привязке событий ко времени 📖 arXiv 🤗 ai-sage/GigaChat3.1-Audio-10B-A1.8B 🤗 ai-sage/TimeGround-1M Попробовать в проде Еще более мощные модели того же семейства доступны в наших сервисах: 🔘Обновленный GigaChat-Max-Audio — пользуйтесь на giga.chat и @gigachat_bot 🔘Распознавание на 5 языках — добавляйте в свои группы @smartspeech_sber_bot для распознавания голосовых Что дальше Проекту GigaAM уже третий год, и мы не перестаем его развивать: за последний квартал добавили таймстемпы для слов, конвертацию и запуск в Triton Inference Server, код дообучения под ваш домен и язык. Теперь выпустили в open-source и модель GigaChat-Audio, и уже обучаем следующий релиз. Следите за нашими обновлениями!
15 005
5
💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель п+1
💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который мы собирали больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra. Что внутри: 🔘Собственная гибридная архитектура MLA + GatedDeltaNet с придуманной нами уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается; 🔘Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя; 🔘GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Модернизация этого слоя позволила нам стабильно обучать модели с большим количеством параметров. 🔘Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память позволяет поместить в 2,14 раза больше контекста, throughput под нагрузкой растет на +20%; 🔘Две MTP-головы и ускорение генерации до 2,2 раза; 🔘FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра; 🔘Новый этап online RL после SFT и DPO. Результаты: 🔘GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье); 🔘GigaChat-3.5-Ultra-Instant сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше; 🔘По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%. Весь стек — данные (своя LLM-фильтрация Common Crawl, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан нами end-to-end. 🤖 Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr. ➡️HuggingFace | GitVerse
70 644
6
💵 GFusion: как мы обучали диффузионную LLM в GigaChat «А что, если LLM будет генерировать не строго по одному токену слева направо, а сразу блок текста?» Именно эту идею мы проверяли в проекте GFusion — диффузионной языковой модели на базе GigaChat3-10B-A1.8B-base. Отдельно хочется отметить, что этот проект начал и довёл до релиза стажер команды GigaChat Pretrain. Он прошёл весь путь от идеи и первых экспериментов до обучения модели, оптимизаций, поддержки в inference runtime и публикации в open source. Почему это интересно? Классические LLM генерируют текст авторегрессионно: каждый следующий токен зависит от всех предыдущих. Это устоявшийся подход, но шаги генерации модели выполняются строго последовательно. В то же время диффузионная LLM берёт частично замаскированный блок и постепенно восстанавливает токены внутри него. За один forward pass модель может финализировать не один, а сразу несколько токенов. Так и появляется ускорение. Чем больше токенов модель уверенно восстанавливает за один проход, тем меньше шагов ей нужно для генерации ответа. Вместо дорогостоящего обучения с нуля мы взяли сильную авторегрессионную LLM и перевели её в диффузионный режим генерации. Цикл обучения включал: 🔘адаптацию AR-модели к диффузионной генерации; 🔘постепенное увеличение размера блока; 🔘сравнение полностью диффузионного обучения и гибридного подхода AR+dLLM; 🔘SFT с complementary masking и стадией confidence tuning для дополнительного ускорения генерации. Результаты: 🔘GFusion в режиме одного пользователя генерирует в среднем на 70% быстрее GigaChat3-10B-A1.8B. 🔘Даже по сравнению с GigaChat3-10B-A1.8B + MTP-головой ускорение составило около 39%. 🔘Просадка качества относительно авторегрессионной модели осталась в пределах 2–4 п.п., а сам трейд-офф между скоростью и качеством можно контролировать параметрами диффузионной генерации. 🔘Добавлена поддержка GFusion в SGLang и реализован entropy-bounded sampling — алгоритм семплирования, который ускоряет генерацию не только GFusion, но и других диффузионных LLM. 🔘Для обучения написана и выложена в open-source своя реализация attention на TileLang под структуру диффузионной маски и получено до +77% end-to-end ускорения относительно Flex-Attention на длинном контексте. 💡 Главный вывод GFusion состоит в том, что ускорение LLM может требовать переосмысления самого подхода к генерации. Однако, чтобы это заработало на практике, важно довести до рабочего состояния весь стек от обучения и SFT до декодинга, attention-ядер и поддержки в inference runtime. ➡️Подробности — в статье на Habr. ➡️HF: GFusion-10B-A1.8B-base GFusion-10B-A1.8B ➡️GitVerse
53 397
7
💵Deep Research как управляемый runtime вокруг instruct-модели «Просто дать LLM доступ к интернету и ждать глубокого исследования — плохая идея». Это ключевой вывод команды, которая разработала комплексный research-конвейер на основе instruct-модели. Почему обычный подход модель + поиск работает недостаточно эффективно? Потому что модель легко теряет исходные ограничения, смешивает факты с собственными выводами и делает преждевременные заключения. Какие инженерные решения применили? Мы зафиксировали последовательность шагов и роли в исследовательском конвейере, но при этом у LLM осталось достаточно свободы для принятия локальных решений: 🔘Brief: фиксирует исходный запрос и предотвращает его искажения. 🔘Scout: предварительная разведка темы перед детальным планированием. 🔘Needs + DoD: декомпозиция задачи на четкие блоки с проверяемыми критериями завершения. 🔘Локальный ReAct-loop: модель выполняет небольшие интеллектуальные задачи внутри ограниченных рамок. 🔘Промежуточные отчёты и иерархический контекст: поддерживают порядок и актуальность данных. 🔘Цитирование как часть внутреннего состояния: факты постоянно связаны с источниками. 🔘Отдельный пайплайн финального ответа: обеспечивает четкость и качество подачи результатов. Результат: Новый конвейер существенно повысил точность и глубину исследований на модели GigaChat Ultra 3.1 в сравнении с другими моделями, улучшив качество ответов и снижая ошибки. 💡 Успех глубокого исследования — это не только сила модели, но и продуманная оркестрация, контроль и управление контекстом. ➡️Подробности ищите на Habr
4 839
8
💵 Function calling для GigaChat 3.1 в open-source инструментах Вместе с релизом GigaChat 3.1 Ultra и Lightning мы добавили п
💵 Function calling для GigaChat 3.1 в open-source инструментах Вместе с релизом GigaChat 3.1 Ultra и Lightning мы добавили поддержку tool calling в основные опенсорсные инференс-движки: — vLLM — SGLang — llama.cpp Для vLLM и SGLang достаточно поднять сервер с --tool-call-parser gigachat3 — после этого работает стандартный /v1/chat/completions с описанием tools. В llama.cpp tool calling поддерживается нативно, без дополнительных аргументов. vLLM vllm serve ai-sage/GigaChat3.1-10B-A1.8B \ --port 8000 --dtype auto \ --enable-auto-tool-choice \ --tool-call-parser gigachat3 SGLang python -m sglang.launch_server \ --model-path ai-sage/GigaChat3.1-10B-A1.8B \ --host 0.0.0.0 --port 8000 --dtype auto \ --tool-call-parser gigachat3 llama.cpp Поднимаете сервер с моделью — и всё работает. Пример сборки и запуска — в карточке модели на HuggingFace. После запуска сценарий одинаковый для всех движков: передаёте tools в стандартный /v1/chat/completions. 💡 LM Studio — нативный tool calling не поддерживается. LM Studio ожидает два отдельных спецтокена — начала и конца вызова функции. У GigaChat 3.1 архитектура чат-шаблона устроена иначе: для разметки tool call используется один и тот же токен, поэтому нативно его подключить в LM Studio нельзя. Вместо этого используется вариант использования через system prompt, что влияет на качество. ➡️ Модель: HuggingFace | GGUF
5 145
9
💵 Function calling для GigaChat 3.1 в open-source инструментах Вместе с релизом GigaChat 3.1 Ultra и Lightning мы добавили поддержку function calling в основные опенсорсные инференс-движки: — vLLM — SGLang — llama.cpp Для vLLM и SGLang достаточно поднять сервер с --tool-call-parser gigachat3 — после этого работает стандартный /v1/chat/completions с описанием tools. В llama.cpp function calling поддерживается нативно, без дополнительных аргументов. vLLM vllm serve ai-sage/GigaChat3.1-10B-A1.8B \ --port 8000 --dtype auto \ --enable-auto-tool-choice \ --tool-call-parser gigachat3 SGLang python -m sglang.launch_server \ --model-path ai-sage/GigaChat3.1-10B-A1.8B \ --host 0.0.0.0 --port 8000 --dtype auto \ --tool-call-parser gigachat3 llama.cpp Поднимаете сервер с моделью — и всё работает. Пример сборки и запуска — в карточке модели на HuggingFace. После запуска сценарий одинаковый для всех движков: передаёте tools в стандартный /v1/chat/completions. 💡 LM Studio — нативный function calling пока не поддерживается из-за фиксированного формата спецтокенов. Как workaround можно задать формат через system prompt, но работает менее стабильно. ➡️ Модель: HuggingFace | GGUF
2
10
🏃‍♂️ GigaChat 3.1 Ultra & Lightning: большое обновление открытых моделей В ноябре мы открыли preview-версии GigaChat 3 Ultra
🏃‍♂️ GigaChat 3.1 Ultra & Lightning: большое обновление открытых моделей В ноябре мы открыли preview-версии GigaChat 3 Ultra и Lightning. С тех пор серьёзно доработали и модели, и весь пайплайн — высокие результаты на аренах, улучшенный function calling, решённая проблема циклов, DPO в нативном FP8, найденный и зарепорченный баг в SGLang при dp > 1. Сегодня выпускаем обновлённые GigaChat 3.1 Ultra и GigaChat 3.1 Lightning в опенсорс под MIT лицензией! GigaChat 3.1 Ultra 🔘 702B параметров (36B активных на токен) 🔘 По нашим замерам обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning 🔘 Существенный прирост качества по сравнению с ноябрьским preview — как в метриках, так и в реальных диалогах 🔘 Контекст 131K токенов ➡️ GitVerse | HuggingFace GigaChat 3.1 Lightning 🔘 10B параметров (1.8B активных) 🔘 На аренах отвечает на уровне GPT-4o 🔘 Остаётся одной из лучших моделей в своём размере, особенно сильна в function calling 🔘 Серьёзный выигрыш по скорости за счёт MoE + MTP + FP8 🔘 Контекст 256K токенов ➡️ GitVerse | HuggingFace Обе модели • Обучены с нуля — без инициализации зарубежными весами • MoE + MTP + MLA • Совместимы с HuggingFace, vLLM / SGLang Для нас это не просто апдейт весов — это история про то, как переход на новую архитектуру вскрывает неожиданные проблемы на всех уровнях стека, от данных до инфраструктуры. 🤖 Подробнее — в статье на Habr
13 385
11
Записи «Салют, Гига!» уже доступны Не успели на конференцию 10 декабря? Всё можно посмотреть в записи! Доклады про то, как мы делаем GenAI: обучение и улучшение LLM, данные и качество, поиск и RAG, агенты, продовая инфраструктура и Kandinsky. Приятного просмотра и с наступающим! 🎄 ➡️ ВК | YouTube
3 026
12
⚡️ GigaChat 3 Lightning в GGUF: максимум скорости для локального запуска Мы подготовили три официальные сборки модели. Теперь вы можете выбрать оптимальный баланс между скоростью и качеством под ваше железо: 🔘bf16 - Максимальное качество и стабильность. 🔘q8_0 - Золотая середина: отличное качество при меньшем потреблении памяти. 🔘q6_k - Оптимально для ноутбуков и домашних ПК: высокая скорость и экономия памяти без заметного снижения качества генерации. 💻 Function Calling Мы расширяем поддержку функционала в популярных инструментах: 🔘vLLM: Официально появится в следующем релизе >0.12.0. Уже сейчас работает в dev-сборке (от коммита 21bb323) с флагом --tool-call-parser gigachat3. 🔘SGLang: Подготовили временное решение, доступное в отдельной ветке. 🔘llama.cpp: Отправили PR с полноценной реализацией. В текущей версии вызов функций работает с ограничениями — инструкция доступна в описании модели на HuggingFace. Мы продолжаем работу над интеграцией GigaChat 3 Lightning в экосистему open-source инструментов. Следите за обновлениями — впереди ещё больше возможностей для локального запуска и кастомизации. 🧭 Делитесь опытом использования и задавайте вопросы — ваш фидбэк помогает делать модель лучше! ➡️ HuggingFace ⬅️
6 458
13
Уже в 14:00 начинаем Салют, Гига! Всех зарегистрировавшихся ждём на площадке, а онлайн можно подключиться через сайт.+1
Уже в 14:00 начинаем Салют, Гига! Всех зарегистрировавшихся ждём на площадке, а онлайн можно подключиться через сайт.
3 078
14
Что слышит умная колонка? ➡️ Хабр Giga — это не только ML инженеры, но еще и другие специалисты, в том числе эксперты по цифровой обработке сигналов: из плохого звука тяжело извлечь что-то полезное. Команда VQE (Voice Quality Enhancement) поделилась на Хабре решением нестандартной задачи: как оценить качество акустической системы для задачи распознавания речи, не обучая модели? В статье: 🔘 звуковой тракт с точки зрения модуля VQE; 🔘 взаимосвязь коэффициента нелинейных искажений звука (THD+N) и других показателей; 🔘 методика по измерению этих показателей; 🔘 их корреляция с метрикой качества распознавания голосовых команд; 🔘 а также много-много формул. Результат: на любой стадии разработки умной колонки Sber можно оценить, хорошо ли она слышит споттер, не переобучая модель — и при необходимости поправить конструктив устройства.
3 270
15
GigaAM-v3 на Хабре ➡️ Хабр Спешим поделиться постом о создании GigaAM-v3! В статье много технических деталей для специалистов: 🔘 Распределение данных по доменам 🔘 Эксперименты с масштабирование модели по параметрам 🔘 Сравнение токенизаторов 🔘 Анализ ошибок end-to-end моделей 🔘 LLM-as-a-judge для распознавания речи По пути к релизу GigaAM-v3 ворвалась в top trending ASR-моделей на HuggingFace, обогнав свежий релиз OmniLingual ASR 🚀 👉 Приходите на «Салют, Гига!» — там вы сможете вживую пообщаться с разработчиками GigaAM, задать вопросы по статье, узнать детали обучения мультиязычного GigaAM Max и обсудить, как мы модифицировали HuBERT-CTC для использования в GigaChat Audio.
10 221
16
Салют, Гига! Мы выкатили программу на 10 декабря — она уже лежит на сайте. У нас два зала. В большом — основные релизы, архит
Салют, Гига! Мы выкатили программу на 10 декабря — она уже лежит на сайте. У нас два зала. В большом — основные релизы, архитектуры, истории изнутри и постерная сессия с командами. В малом — почти непрерывный техно-контент на весь день. Получилось очень плотно и качественно. Участие бесплатное, но по регистрации. Можно прийти офлайн в Москве или подключиться онлайн. Увидимся в ГигаГороде!
9 696
17
🤖 Хотите больше информации про наши последние релизы? 10 декабря на «Салют, Гига!» мы подробно расскажем, что сделали за это
🤖 Хотите больше информации про наши последние релизы? 10 декабря на «Салют, Гига!» мы подробно расскажем, что сделали за этот год в командах GigaChat, Kandinsky и GigaData (платформы для управления данными, аналитики и поиска в контексте ИИ-моделей и сервисов). От архитектур и метрик до подходов, решений и планов на будущее. Будут доклады от инженеров, разборы под капотом, постерная сессия с командами и возможность задать любые технические вопросы тем, кто эти модели создаёт. Мы делаем формат максимально полезным для тех, кто работает с ML, данными, исследовательскими пайплайнами или инфраструктурой. Если интересно — присоединяйтесь, участие бесплатное. ➡️Вот ссылка на регистрацию. Будем рады видеть всех 10 декабря.
17 526
18
🏆 GigaChat 3 Ultra Preview & Lightning: открытые MoE-модели нового поколения В этом году мы уже радовали вас новой линейкой
🏆 GigaChat 3 Ultra Preview & Lightning: открытые MoE-модели нового поколения В этом году мы уже радовали вас новой линейкой GigaChat 2, добавлением Reasoning в наш Web (giga.chat), опенсорсом GigaChat Lite и Giga-Embeddings и первым местом на бенчмарке ruMTEB. Что нового в этот раз? Впервые в России обучены MoE-модели такого масштаба полностью с нуля — без зависимости от зарубежных весов. Обучение огромных MoE-модели требует не только колоссальных вычислительных ресурсов, но и решения множества инженерных вызовов: от нестабильности вычислений с плавающей точкой до оптимизации межузловой коммуникации и балансировки нагрузки между экспертами. Поэтому сегодня мы открываем веса двух флагманских MoE-моделей — GigaChat 3 Ultra Preview (702B-A36B) и GigaChat 3 Lightning (10B-A1.8B) — полностью доступных сообществу с лицензией для коммерческого использования. GigaChat 3 Ultra Preview 🔘702B параметров (36B активных на токен) 🔘Работает быстрее GigaChat 2 Max 🔘Топ-1 на MERA 🔘Поддерживает контекст в 131 тысячу токенов ⚡️ Модель продолжает обучение — финальная версия будет еще мощнее! ➡ GitVerse | HuggingFace | GitHub GigaChat 3 Lightning 🔘10B параметров (1.8B активных) 🔘Достигла уровня лидера open-source своего класса — Qwen3-4B со скоростью генерации в 1.5 раз выше, как у Qwen3-1.7B 🔘Идеальна в качестве легковесного помощника для локального использования (офлайн-ассистент, прототипирование) 🔘Поддерживает контекст в 256 тысяч токенов ➡ GitVerse | HuggingFace | GitHub Обе модели • Не являются reasoning моделями • Умеют предсказывать сразу несколько токенов • Другой вид механизма внимания снижает размер KV cache • Обучены с нуля — без инициализации чужими весами • Открытые веса и лицензия c возможностью коммерческого использования • Полностью совместимы с Hugging Face, vLLM / SGLang и стандартными пайплайнами ✈️Подробнее можно прочитать в статье на Habr.
11 139
19
📆Делимся секретами про наш новый синтез речи У нас случился релиз GigaTTS. Это наша новая модель синтеза, под капотом у нее
📆Делимся секретами про наш новый синтез речи У нас случился релиз GigaTTS. Это наша новая модель синтеза, под капотом у нее GigaChat 3b, свой токенизатор речи, адаптер к LLM и всего 30к часов данных. Метрики космические: новая модель нравится людям в 2-4 раза чаще старой, а по естественности она почти всегда живее. Написали подробный технический обзор на Хабр. Фичи нового синтеза 🔘Естественная freespeech подача, неотличимая от живого человека 🔘Специальные голоса телефонных операторов – таких голосов нет ни у кого 🔘Клонирование голосов, обогнали 11labs instant vc по похожести 🔘Озвучивание текстов бесконечной длины без потери контекста (multiturn режим синтеза) 🔘Инструктивный синтез, где можно задать словами все нюансы эмоций, в том числе сарказм ➡ Послушать новый синтез можно в голосовом режиме GigaChat Voice Mode
11 620
20
GigaAM-v3: новый уровень качества, пунктуация, нормализация ➡️ GitHub | HuggingFace | GitVerse В прошлом году мы открыли семе
GigaAM-v3: новый уровень качества, пунктуация, нормализация ➡️ GitHub | HuggingFace | GitVerse В прошлом году мы открыли семейство моделей GigaAM, после чего значительно улучшили качество благодаря подходу HuBERT-CTC во второй версии. Основными запросами сообщества оставались поддержка пунктуации в наших моделях, а также улучшение на сложных срезах данных. Сегодня мы рады представить следующий большой релиз — GigaAM-v3. Что публикуем 🔘GigaAM-v3 — foundation audio encoder (база для дообучения). 🔘GigaAM-v3-CTC — улучшенная CTC модель распознавания, быстрый инференс 🔘GigaAM-v3-RNNT — улучшенная RNNT модель распознавания, лучшее качество 🔘GigaAM-v3-e2e-CTC — распознавание с пунктуацией и нормализацией, быстрый инференс 🔘GigaAM-v3-e2e-RNNT — распознавание с пунктуацией и нормализацией, максимальное качество Пример e2e-вывода: В твоём каталоге есть первая серия сезона 14 «Где логика»? Что нового в v3 🔘Масштаб предобучения: 50k → 700k часов аудио на русском языке. 🔘Новые домены в обучении ASR: колл-центр, музыкальные запросы, речь с особенностями, разговорная речь (суммарно 2k часов). 🔘Для всего корпуса обучающих данных восстановлены пунктуация и нормализация при помощи GigaChat Max Audio. 🔘Линейка CTC/RNNT + e2e — выбирайте скорость или максимум качества под свой сценарий. Метрики 🔘 Открытые датасеты (Golos, OpenSTT, Common Voice, LibriSpeech): паритет с GigaAM-v2. 🔘 Новые домены (WER, v2-RNNT → v3-RNNT): • речь с особенностями 27% → 19% • колл-центр 13% → 10% • спонтанная речь 10.3% → 7% 🔘 Пунктуация: v3-e2e-RNNT vs reference + Whisper Forced Decoding — F1-score по запятой 84% vs 62%, остальные знаки ~паритет. 🔘 Side-by-Side (Gemini 2.5 Pro as a judge): v3-e2e-RNNT vs Whisper-large-v3 — 70:30 (колл-центр), 64:36 (Common Voice). Более качественные модели распознавания того же класса эксклюзивно доступны в наших умных устройствах, а также могут быть бесплатно использованы на повседневной основе с помощью бота @smartspeech_sber_bot. Совсем скоро выйдет пост на Хабр, где мы поделимся подробностями обучения и оценки качества. Не пропустите!
14 693