en
Feedback

Don't get caught by a cheater! Telemetrio finds and tags such channels 👉 If you want to see the tag, subscribe 👈

Vikhr models

Vikhr models

Open in Telegram

official newsfeed, owner, admin and founder - alex nikolich - @alexwortega chat: @vikhrmodels

Show more
2 599
Subscribers
No data24 hours
+97 days
+630 days
Posts Archive
Repost from ду́но

Repost from LakoMoor
Q-164M и Q-U-164M — новые модели от Q-Project, обучены с нуля на одной GPU. Q-164M — 164.6M параметров, претрейн на 13.1 млрд
Q-164M и Q-U-164M — новые модели от Q-Project, обучены с нуля на одной GPU. Q-164M — 164.6M параметров, претрейн на 13.1 млрд токенов (FineWeb-Edu). Тернарные веса {-1, 0, +1}, без обучаемой embedding-таблицы, и механизм точных вызовов инструментов: модель решает, когда посчитать, а сам расчёт делает детерминированный исполнитель — арифметика всегда точная. Q-U-164M — тот же чекпоинт, дообученный для диалога (chat-SFT + RL). Ушло 5 итераций, чтобы починить потери вызова инструментов в живом многоходовом диалоге. модель только английская, русский не понимает. Общие знания слабые, вне задач с инструментами часто ошибается. Сравнили с другими маленькими моделями через свой бенчмарк QBench (без подсказок инструментам): заметно уступает Qwen2.5-0.5B (втрое крупнее) почти везде — кроме TruthfulQA, там чуть впереди. Но модель обучалась на одной V100, а не на кластере. 🔗 Ссылка на веса: https://huggingface.co/collections/q-project/q-164m 💻 Код: https://github.com/Q-Project-LM/Q-164M 💬 Чат в браузере: https://q-project-lm.github.io/chat/ 📊 QBench: https://huggingface.co/spaces/q-project/QBench 📝 Разбор: https://q-project-lm.github.io/blog-q164m.html ⚖️ Лицензия: apache-2.0 Если хотите поддержать эксперименты и обучение более крупных моделей — буду благодарен за помощь со сбором на GPU 🙄 ❤️ Поддержать проект: https://t.tb.ru/pm_short/4v90jPi6NPZ 💘U💘

Repost from NLP Wanderer
Halo: почти год моей работы в White Circle теперь в опенсорсе Почти год я веду в White Circle разработку Halo - фреймворка дл
Halo: почти год моей работы в White Circle теперь в опенсорсе Почти год я веду в White Circle разработку Halo - фреймворка для тренировки LLM, на котором мы учим все свои модели. Внутри он работал давно как замена Мегатрона, но до публичного релиза пришлось догнать transformers, TRL и vLLM, добавить модели и упростить адопшен - образы, CLI, документация. Подробный блогпост - на сайте White Circle (https://whitecircle.com/research/halo). Если вы файнтюните открытые модели, то наверняка упирались в: модель уже не лезет в TRL и обычный FSDP, но связываться с Megatron и конвертацией чекпоинтов еще рано или просто не хочется. С MoE все еще хуже, без Expert Parallelism их по большому счету не потренировать. Halo добавляет EP, Context, Tensor и Expert-Tensor Parallelism прямо поверх обычных классов HuggingFace: на вход HF модель, на выходе HF модель. Новое MoE семейство подключается оберткой меньше 140 строк (у Megatron-Bridge на то же самое уходит 600-1900), сейчас их 15. Немного цифр, все на B300, воспроизводимы из репо: - 2.3-2.8x throughput относительно стокового TRL на gpt-oss-20b при тех же кернелах, loss совпадает в пределах ~1%. - Gemma 4 26B-A4B на 2 GPU: 7.2k tok/s против 3.2-5.0k у NeMo AutoModel, Axolotl, Megatron Bridge, MS-SWIFT и Unsloth. - Оптимизатор целиком в bf16 со стохастическим округлением: 120 GB состояния вместо 240 для 20B. Все это првоерялось на реальных кластерах B300/B200/H200/H100 а топология заложена вплоть до NVL72: невалидные раскладки отбрасываются еще на этапе конфига. Запускается через torchrun, accelerate или halo CLI, в репо есть рецепты под SLURM, SkyPilot, RunPod и Nomad. Большая часть года ушла на то, чтобы все это не разваливалось на всех комбинациях моделей и параллелизмов - тестов в репозитории больше, чем кода. При этом работать будет также и на современных консьюмерских GPU. Отдельная моя гордость - Async RL. vLLM или SGLang живут в отдельном контейнере, роллауты идут асинхронно через Ray, веса уезжают по NCCL (по EFA 53-80 GB/s, gpt-oss-120b обновляется за 3-4 секунды), а генерации во время синка не обрываются. Внутри routing replay, importance sampling с масками, обучение на токенах, которые насэмплил движок, и 11 встроенных сред - от code contests и SWE до тулов через MCP. По механикам это сопоставимо с verl и Miles, только на HF-моделях и без Megatron. Для студентов и тех, кто только начинает, Halo, мне кажется, хорошая точка входа. Все запускается из одного docker-образа: halo launch sft config.yaml, а QLoRA Qwen3-4B занимает 7.9 GB и должна работать на 3090/4090. Документации больше 170 страниц, отдельно советую прочитать лекцию GPU Training Theory: база того как работают такие фреймворки, почему эксперты в MoE упираются в память, а не в compute, и почему в EP-шаге 88% времени - это all-to-all. Там же честно написано, что не помогает и что тихо ломает, например TF32 по умолчанию в NGC-образе, портящий RoPE после 2048 токенов. Выложили и модель - GLM-4.7-Flash-Coder, 30B MoE под агентские скаффолды: SFT на 7.8k успешных траекторий GLM-5.1, на SWE-rebench-V2 pass@1 вырос с 33.2% до 41.7%, а модель сама научилась вызывать тулы параллельно. Она уже слегка устарела, но как гайд по агентскому SFT актуальна. Код мы пишем с агентными скаффолдами и сильными моделями вроде Claude Fable и Opus, репозиторий под это спроектирован. Контрибьт приветствуется, но через фильтр: сначала issue и approve мейнтейнера, потом PR. Главное правило - понимать свой код: с AI писать можно, но это нужно раскрыть, а тесты должны падать, когда ломается поведение. Дальше больше: Pipeline Parallelism (все уже в коде, но докатим после полных тестов) и серия блогов про тренировку, например про async RL для code contests. Лицензия Apache 2.0. P.S. Если помните такую вещь как SMPO из времен Vikhr, то он теперь тоже живет там, но уже с EP и CP и улучшениями.

Repost from AGDchan
Говорят, сто Сбер и вправду делает что-то свое в области ИИ. Раз так, то это замечательно.

🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в open source первую модель GigaChat
🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в open source первую модель GigaChat с полноценным рассуждением. В основе — 432B-A28B MoE. После SFT мы обучили с помощью online RL шесть экспертов по разным направлениям: от математики и кода до агентов, диалога и следования инструкциям. Затем собрали их в одну модель через on-policy distillation: ученик генерирует ответ сам, а эксперт нужного домена оценивает каждый его токен, так что ничего из выученного в RL не теряется. Что получилось по сравнению с GigaChat 3.5 Instant: 🔘SWE-Verified: 43 → 65 🔘AIME-2026: 67 → 92 🔘IFBench: 44 → 77 Рассуждения заметно усилили кодовые и базовые агентные навыки: модель вышла в паритет с сильнейшими открытыми и закрытыми моделями в следовании инструкциям, структурированной генерации и поиске информации в длинном контексте. При этом на сложной математике она тратит на 37% меньше токенов, чем конкуренты: высокие результаты не обязательно требуют более длинных рассуждений. На внутренних корзинах в юридическом домене — экзамен по российскому праву, ответы по документам — модель показала себя лучшей среди доступных open source моделей. Также модель хорошо разговаривает на русском, имеет высокие показатели на внутренних и внешних аренах, обгоняя другие русскоязычные нейросети, в первую очередь за счёт фактической точности ответов. Что интересного в обучении: — Обучали модель на большом числе сред, а также сами построили 55 уникальных сред с проверяемым результатом, 12 тысяч задач, часть полностью на русском. — Агент для кода учился внутри настоящих harness. — Curriculum, который перед каждой стадией убирает уже освоенные задачи и позволяет сократить затраты на инференс вдвое. — Нативный FP8 на всех этапах. Подробнее о конвейере обучения, наградах и граблях, на которые мы наступили, — в статье на Хабре. ➡ Хабр: статья ➡ Hugging Face: fp8 | bf16 ➡ GitVerse: репозиторий

вообще удивительно, sparsity 1:70, MoE t5, ul2 рецепт и метрики на уровне 4-8b qwen3.5(на русском) и это релизит яндекс hf
вообще удивительно, sparsity 1:70, MoE t5, ul2 рецепт и метрики на уровне 4-8b qwen3.5(на русском) и это релизит яндекс hf

МЕРА обновилась, gemini лучший на бенче habr hf
МЕРА обновилась, gemini лучший на бенче habr hf

SIQ-1-35B Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифициру
SIQ-1-35B Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифицируемый) Эта штука на karpathy autoresearch для parametr golf лучше чем glm5.2 и qwen350b и генерит идеи похожие на опус А еще она на bullshit бенч лучше чем NEX и gpt5.5 Модель + gguf: https://huggingface.co/AlexWortega/SIQ-1-35B Демо чтобы гонять на zero gpu и радоваться: https://huggingface.co/spaces/AlexWortega/hermes-agent-zerogpu

31-я международная конференция по компьютерной лингвистике и интеллектуальным технологиям «Диалог»  (https://dialogue-conf.org/) 24-26 июня 2026 года   Приглашаем прийти послушать доклады и принять участие в обсуждении достижений больших языковых моделей и современной лингвистики   Приглашенные доклады: Колмогорова  Анастасия Владимировна д-р филол.наук, профессор, профессор департамента филологии Школы гуманитарных наук и искусств НИУ ВШЭ СПб, академический руководитель магистерской программы «Языковые технологии в бизнесе и образовании», руководитель научной лаборатории языковой конвергенции  «Визуальные языковые модели в задаче описания картин»   Украинский Руслан Владимирович, руководитель проекта Исследования и инновации Производственного управления компании «Гарант»  «От модели к агенту: как генеративный ИИ меняет работу с правовой информацией и разработку справочных правовых систем»   Подобряев Александр Владимирович, phd, доцент школы лингвистики, ВШЭ «Семантические компетенции больших языковых моделей»   Регистрация до 23 июня 2026 года   МЕСТО ПРОВЕДЕНИЯ 2-й гуманитарный корпус, факультет ВМК, Ленинские горы, 1, стр. 52, северный вход, 2 этаж

Оно не адаптировано под русский и русский не стоял как основная цель при обучении, но в целом модель мне нравится

https://alexwortega.github.io/pi-agent/hermes/ я продолжаю угарать по локальному инфернсу через webgpu и сунул в форк hermesa
https://alexwortega.github.io/pi-agent/hermes/ я продолжаю угарать по локальному инфернсу через webgpu и сунул в форк hermesagent дистил 4b qwen3.5 который бегает у вас на маке и притворяется что 4b вообще для чего то полезны(нет)

Вихри как проект был осонован мной глядя на тотальную неспоснобность команд в россии сделать нормальную ллмку для людей, в момент когда я начинал эту движуху у меня была только довольно жирная зарплата, навык и несколько гпу. Это вообще не планировалось как что то большое, выложить пару удачных моделей и все. Потом я решил еще повливать своих денег, набрать побольше реклам в LDT и подистилить gpt4, потом я захотел еще поигратся с аудио и мы стали делать SALT и Borealis. В это время Серега удачно переделал бенчи на русский и сделал отличную Vikhr Nemo 12b, ru arena hard. [тут мы довольно удачно залетели на воркшоп EMNLP, спасибо нашему научному консультанту/руководителю] Мы планировали скейлится и поднимать денег, брать комерческие заказы, но реальность российского рынка примерно такая: если у вас нет горы денег от материнской компании - вам пизда. А еще нам прилетатает ACL претензия от Сбера за авторством (Сергей Марков, Алена Феногенова ...) что МЕРA мы меряем неверно и в целом занимаемся наебом. В целом крайне забавно смотреть как трестся столь большое начальство, статью мы отозвали по итогу тк не хотелось подставлять нашего научного консультанта, а я начал заниматся более важными для себя вещами чем русский опенсурс. По состоянию на март 2026 я могу сказать что пациент скорее мертв, бигтехи не тянут конкуренцию не с китайем не с америкой (простите я не хочу сравнивать мистралем), а проект не будет обновлятся по крайней мере централизовано. За все время было потрачено ~70к долларов моих личных денег, а несколько ребят получившие опыт на Вихрях довольно успешно устроились на работу. К слову мы не получили не копейки от рутуба, газпрома, ингостраха и нескольких других компаний использующих наши модели. НО СКОЛЬКО УДОВОЛЬСТВИЯ Я ПОЛУЧИЛ НАБЛЮДАЯ ЗА ТРЯСКОЙ СЕРГЕЯ... Я бы повторил.3

tldr: Rust backend engineer, $80k-$150k + equity, relocation to Paris Ищем rust-бекендера в White Circle – перекладывать JSONы в Postgres, перекладывать в ClickHouse, перекладывать в воркеры в RedPanda, которые потом снова перекладывают в базы + перекладывать в Redis, чтобы потом быстро перекладывать на фронт. Короч делать все, чтобы продукт двигался вперед. Мы занимаемся AI Security & Observability: представьте себе Datadog/Sentry, но для AI/LLM/Агентов. Мы нормальный-AI-стартап-не-ChatGPT-враппер: свои LLMки, куча бенчмарков, куча данных + есть клиенты: обрабатываем сотни миллионов запросов в месяц, получаем revenue. Зарейзили $11mln на cиде, среди наших инвесторов ко-фаундеры HuggingFace, Mistral и C-level из OpenAI, Datadog, Senty, Anthropic и других крутых компаний. Откликаться – сюда У нас вообще еще пачка вакансий есть. Ищем: • Продакт инженера на фронт (next.js) • Продакт инженера на бекенд (раст) • Аудио-инженера • MLE / MLOps / Inference Engineer • Data Scientist

Бета релиз Borealis 5b - 4b qwen + whisper + сделали плагин для vllm + теперь оно работает с инструкциям и может решать задачи qa, cls, summarize, json mode Модель на hf

Для чего вы используете audio llm типа qwen audio, voxtral? Используете ли?

Repost from LLM Arena
🔫 GenCode Mini Gallery Bench LLM Arena совместно с Сергеем Курбановым (руководитель направления RnD в компании MWS) рады пре
🔫 GenCode Mini Gallery Bench LLM Arena совместно с Сергеем Курбановым (руководитель направления RnD в компании MWS) рады представить новый бенчмарк. 📈 LLM стремительно эволюционируют и выходят на уровень AGENT-поведения, где модели решают задачи от анализа данных до полноценной разработки. На этом фоне особенно интересно посмотреть на то, как модели в режиме реального времени справляются даже с такими, на первый взгляд, простыми задачами вёрстки. GenCode Mini Bench не содержит выводов — только чистый эксперимент и результат работы моделей. Да, это не совсем привычный бенчмарк, но надеемся, что вам понравится его формат. Кроме того, там подключена форма обратной связи, где вы можете прислать собственные промпты, а мы каждые 2 недели будем обновлять его содержимое. Генерации обновляются каждые 6 часов, поэтому заглядываете периодически, чтобы посмотреть на результаты различных моделей. ❗️ Модели, используемые для генераций доступны по API на VSELLM ♾ Вкладка с бенчмарком доступна на https://llmarena.ru/ или напрямую по ссылке https://clocks.llmarena.ru/. 📸 Ждем вашего мнения и обратной связи.

🤖 Хотите больше информации про наши последние релизы? 10 декабря на «Салют, Гига!» мы подробно расскажем, что сделали за этот год в командах GigaChat, Kandinsky и GigaData (платформы для управления данными, аналитики и поиска в контексте ИИ-моделей и сервисов). От архитектур и метрик до подходов, решений и планов на будущее. Будут доклады от инженеров, разборы под капотом, постерная сессия с командами и возможность задать любые технические вопросы тем, кто эти модели создаёт. Мы делаем формат максимально полезным для тех, кто работает с ML, данными, исследовательскими пайплайнами или инфраструктурой. Присоединяйтесь офлайн или онлайн, участие бесплатное. ➡️Вот ссылка на регистрацию. Будем рады видеть всех 10 декабря.