Krist/Blog
Ir al canal en Telegram
Веду свой уютный канал про старые и новые железки и не железки, нейросети и не нейросети и вообще всё, что мне интересно. Вступайте в чатик @kristchat Писать сюда - @kristaller
Mostrar más247
Suscriptores
Sin datos24 horas
+17 días
+930 días
Archivo de publicaciones
247
DeepSeek-R1-0528
Новая версия R1:
- Качество выросло по всем бенчмаркам.
- Модель конечно не достигла уровня o3 и Gemini 2.5 Pro, но очень к ним приблизилась.
- Модель теперь использует значительно больше токенов на размышления (почти в 2 раза на сложных задачах).
- Теперь поддерживает системный промпт.
- Есть distill версия на основе Qwen3-8b (на момент написания заметки еще не выложили).
- Как и раньше, MIT лицензия.
Модель
247
Repost from Ruadaptная комната
Всем привет! Рад сообщить о нашем новом релизе RuadaptQwen3-32B-Instruct 🎉. Это адаптированная версия Qwen3-32B, которая также является гибридным ризонером с режимом размышлений по-умолчанию.
Отличия текущего релиза от прошлых:
1. Версионирование: теперь версионирование моделей будет идти внутри одного репозитория, но в Versions будут отмечены даты и соответствующие коммиты, которые могут быть использованы, если кому-то больше понравится “прошлая версия”. Таким образом мне проще выкладывать текущие наработки, которые я все еще не могу назвать итоговыми, но которые уже неплохи на мой взгляд.
2. Процедура адаптации была улучшена: токенайзер содержит потерянные смайлы и не содержит ненужных цифр, количество данных в continued pretraining было увеличено вдвое и еще несколько минорных изменений процедуры, которые приводят к бОльшему качеству на выходе.
Так как для Qwen3-32B не была выложена базовая версия, мы сделали ее сами, дообучив только эмбеддинги (входные и выходные) на +-миллиарде токенов.
3. Новый набор для SFT и пока что отсутствие Pref-tuning этапа: в этот раз данные для обучения были сгенерированы на основе большой модели Qwen3-235B-A22B. Для сохранения функции переключения между режимами, в 30% случаев think содержимое выбрасывалось и добавлялся /no_think токен к последнему сообщению пользователя. Для 10% случаев, когда размышления оставались добавлялся токен /think. Используемый датасет выложен и упомянут в карточке модели.
4. Метрик пока нет, но в целом имеется некоторая просадка на мат. задачах, однако для обычного использования все должно быть +- на уровне исходной версии.
Если заметите плохие или наоборот хорошие стороны модели - обязательно пишите, так как сейчас активно идут работы над инструктивной частью и фидбек по поводу проблем будет очень актуален.
Модель: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct
GGUF: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct-GGUF
Space: https://huggingface.co/spaces/RefalMachine/RuadaptQwen3
247
+4
Falcon H1
Новая серия гибридных многоязычных моделей от TII. Основные моменты:
- Attention + Mamba2. Меньше памяти, быстрее инференс, чем у традиционных трансформеров.
- Много моделей: 0.5B, 1.5B, 1.5B-Deep (больше "глубины"), 7B, 32B, все имеют базовую и чат вариацию.
- Хорошая многоязычность. Модель обучалась на 18 языках, в том числе на русском. По-русски говорит хуже Gemma 3, но лучше Qwen 3.
- Контекст 256 тысяч токенов.
- Производительность на уровне Qwen3 соответствующих размеров, при том, что видела модель в два раза меньше токенов.
- Пермисивная лицензия (но не Apache 2.0/MIT)
Блог, веса, демо
247
Qwen WorldPM
Товарищи из Qwen изучают законы масштабирования reward моделей. Короткий обзор:
- Взяли большой корпус реальных данных о человеческих предпочтених. Обучили на этих данных множество моделей с разным размером и количеством обучающих примеров.
- При увеличении обучающей выборки и размера модели стабильно растет качество обноружения фактических ошибок в ответах.
- В случае с математикой, кодом и прочими доменами, где есть объективных истинный ответ, более крупные модели значительно лучше маленьких.
- А вот в случае субъективных метрик (аля chatbot arena) особых улучшений от масштабирования нет.
Еще интересные находки:
- StackExchange - самый качественный источник данных о предпочтениях.
- У больших моделей есть "момент озарения", когда у модели резко падает loss.
- Авторы используют GRPO, а не PPO и им норм🙂
Статья, модель
247
Seed-Coder-8B
SOTA модель для кода в размере 8B. Короткий обзор:
- 3 версии: base, instruct и reasoning.
- Для фильтрации кода использовали в основном LLM - это позволило значительно улучшить качество данных.
- "Всего" 6 триллионов токенов в претрене. Значительно меньше, чем у конкурентов. (Скажем, Qwen3 учился на 36 триллионах, а у старой llama3-8b - 15T).
- Плохо работает со всем, кроме кода. Хотя в целом относительно нормально говорит на русском.
Модель, статья
247
+2
Qwen-Polymath: многоязычный математический бенчмарк
Товарищи из Qwen собрали по 125 математических вопросов по 4 категориям сложности на 18 самых популярных языках в мире.
4 категории:
1. top - самые сложные олимпиады, самая сложная математика.
2. high - задачи, требующие критического мышления, но не требующие глубоких теоретических знаний.
3. medium - школьные задачи и самые простые олимпиады.
4. low - базовая алгебра, геометрия, теория вероятностей и статистика, в основном в виде текстовых задач.
Задачки переводили так:
- Предварительно перевели всё через gpt-4o
- эксперты в области математики выделили из оригинальных задач на английском термины, которые нельзя переводить неправильно
- финальным этапом переводчики-люди исправляли перевод gpt-4o с учетом критически важных терминов
По итогу в бенчмарке лучше всего показывает себя Qwen-3-235B, после идут Gemini-2.5-Pro и Deepseek-R1.
Блогпост, статья, датасет
247
+1
Qwen3 - Вышел. Короткий обзор:
- 0.6B, 1.7B, 8B, 14B, 32B, 30B-A3B, 235B-A22B
- 32K контекс для моделей 0.6B-4B, 128K для всего остального
- Размышляющие и не-размышляющие модели в одном. Можно переключать через подсказку.
- 109 языков, сильная многоязычная производительность (радует).
- Улучшенные агентные способности.
- 36T токенов в претрене.
- Метрики на экране :)
Блогпост, демо, веса загружаются прямо сейчас
247
+2
GLM-4-0414
Странное название выбрали авторы, со старой GLM-4 её объединяет только архитектора - модель обучена с нуля.
Основные моменты:
- Четыре версии: 9B, 32B, Z1-9B, Z1-32B. Z1 это ризонеры.
- Версий на самом деле 6. У Z1 есть "rumination" варианты для deep research. Это, похоже, первые модели специально для такого в опенсорсе.
- Обучены на 15Т токенов. К сожалению, на русском говорит так себе.
- По бенчмаркам SOTA, причем в представленных замерах обходит даже огромный Deepseek V3 и Qwen Max (и значительно).
- Базовые версии тоже выложили.
- Лицензия MIT.
Веса
247
+2
Llama4 - вышла.
Пока две версии: 7Bx16 MoE (109B в целом, 17B активных), 3Bx128 (400B в целом, 17B активных). Будет еще одна, 288B активных, 2Т в целом, 16 экспертов. Архитектура "маленьких" явно вдохновлена Deepseek.
По бенчаркам 400B версия сливает Deepseek V3, 100B обходит текущие модели в своем диапазоне.
Контекст 10 миллионов - это приятно. Еще очень качественный посттрейнинг - модель сильно прокачали по человечности (возможно даже слишком)
247
Qwen2.5-Omni
Кратко:
- 7B модель (вообще 11B🙂)
- Умеет понимать картинки, видео, звук, текст
- Умеет генерировать звук и текст
- Языки английский/китайский
- Apache 2.0
- Умеет в стриминг со всеми модальностями сразу (например, общаться голосом, одновременно смотря на видео)
- Голос звучит прикольно, не сильно хуже 4o и Gemini - но только на английском и китайском.
Блогпост, статья, модель, демо
247
+1
Официальные результаты бенчмарков V3-0324:
- MMLU-Pro: 75.9 → 81.2 (+5.3)
- GPQA: 59.1 → 68.4 (+9.3)
- AIME: 39.6 → 59.4 (+19.8) (это уровень o1-mini лол)
- LiveCodeBench: 39.2 → 49.2 (+10.0)
Независимые результаты:
- Aider Polyglot benchmark: 55.1% (лучше, чем o3-medium и sonnet 3.5, но хуже, чем R1 и sonnet 3.7)
- KCORES LLM Arena (код): 328.3
247
Deepseek выложили обновленный V3. Я честно ждал, пока они дадут хоть какую-нибудь инфу по бенчмаркам или что-то в этом роде, но прошло 5 часов, а README.md все ещё пустой.
По ощущениям, модель сильно улучшилась в качестве по коду, математике и creative writing. А ещё стала более живой на русском, чем-то напоминает Sonnet.
https://huggingface.co/deepseek-ai/DeepSeek-V3-0324
247
WritingPrompts-ru и Ideya-preview-8k
Продолжаю вносить вклад в русскоязычное LLM-комьюнити. Перевёл euclaise/writingprompts на русский через новую Gemma-3-27b-it.
Оригинальный датасет это набор подсказок для написания художественных текстов из r/writingprompts + самый залайканый комментарий с, собственно, текстом, написанным по подсказке. Пока я перевел только подсказки, хотя планирую и сами истории тоже.
Датасеты с подсказками, типа этого, полезны для генерации синтетических данных и обучения русскоязычных creative writing / roleplay моделей, с которыми, честно говоря, пока не очень.
Ideya-preview-8k - как раз такой датасет, истории писала та же Gemma-3-27b-it. Превью он из-за того, что там только 8 тысяч подсказок+текстов, а планирую я сгенерировать все 270 тысяч. В большей части средняя длина сгенерированной истории - 500 слов, но ближе к концу я поменял промты.
WritingPrompts-ru, Ideya-preview-8k
247
Gemma 3 вышла!
Первые моменты:
- Модель в 4 размерах: 1B, 4B, 12B, 27B.
- Мультимодальность по картинкам.
- Поддержка более 140 (!) языков, самая мультиязычная open source SOTA модель на данный момент.
- Контекст 128К токенов.
- Как и в прошлой модели маленькие версии дистилировали по-настоящему, logit'ами
Презентации пока еще не было, но модели и статью уже выложили.
Модель, техрепорт
247
Reka-flash-3
Есть такой стартап - RekaAI, некоторое время они делали чат модели общего назначения с архитектурой encoder-decoder (типа T5). А вот буквально 20 минут назад они вложили свою новую модель - Reka Flash 3. Да не просто выложили, а ещё и в open source. К сожалению, это не T5, это Llama. Но тем не менее:
- 20B параметров
- Apache 2.0
- Умеет в русский язык (не официально, но вполне нормально).
- Это модель размышления, по оценкам на уровне o1-mini/QwQ-32B.
Модель
