ru
Feedback

Не попадитесь на канал ботавода! Telemetrio находит и помечает такие каналы 👉 Хотите видеть метку — оформите подписку 👈

Krist/Blog

Krist/Blog

Открыть в Telegram

Веду свой уютный канал про старые и новые железки и не железки, нейросети и не нейросети и вообще всё, что мне интересно. Вступайте в чатик @kristchat Писать сюда - @kristaller

Больше
247
Подписчики
Нет данных24 часа
+17 дней
+930 дней
Архив постов
DeepSeek-R1-0528 Новая версия R1: - Качество выросло по всем бенчмаркам. - Модель конечно не достигла уровня o3 и Gemini 2.5
DeepSeek-R1-0528 Новая версия R1: - Качество выросло по всем бенчмаркам. - Модель конечно не достигла уровня o3 и Gemini 2.5 Pro, но очень к ним приблизилась. - Модель теперь использует значительно больше токенов на размышления (почти в 2 раза на сложных задачах). - Теперь поддерживает системный промпт. - Есть distill версия на основе Qwen3-8b (на момент написания заметки еще не выложили). - Как и раньше, MIT лицензия. Модель

Всем привет! Рад сообщить о нашем новом релизе RuadaptQwen3-32B-Instruct 🎉. Это адаптированная версия Qwen3-32B, которая также является гибридным ризонером с режимом размышлений по-умолчанию. Отличия текущего релиза от прошлых: 1. Версионирование: теперь версионирование моделей будет идти внутри одного репозитория, но в Versions будут отмечены даты и соответствующие коммиты, которые могут быть использованы, если кому-то больше понравится “прошлая версия”. Таким образом мне проще выкладывать текущие наработки, которые я все еще не могу назвать итоговыми, но которые уже неплохи на мой взгляд. 2. Процедура адаптации была улучшена: токенайзер содержит потерянные смайлы и не содержит ненужных цифр, количество данных в continued pretraining было увеличено вдвое и еще несколько минорных изменений процедуры, которые приводят к бОльшему качеству на выходе. Так как для Qwen3-32B не была выложена базовая версия, мы сделали ее сами, дообучив только эмбеддинги (входные и выходные) на +-миллиарде токенов. 3. Новый набор для SFT и пока что отсутствие Pref-tuning этапа: в этот раз данные для обучения были сгенерированы на основе большой модели Qwen3-235B-A22B. Для сохранения функции переключения между режимами, в 30% случаев think содержимое выбрасывалось и добавлялся /no_think токен к последнему сообщению пользователя. Для 10% случаев, когда размышления оставались добавлялся токен /think. Используемый датасет выложен и упомянут в карточке модели. 4. Метрик пока нет, но в целом имеется некоторая просадка на мат. задачах, однако для обычного использования все должно быть +- на уровне исходной версии. Если заметите плохие или наоборот хорошие стороны модели - обязательно пишите, так как сейчас активно идут работы над инструктивной частью и фидбек по поводу проблем будет очень актуален. Модель: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct GGUF: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct-GGUF Space: https://huggingface.co/spaces/RefalMachine/RuadaptQwen3

Falcon H1 Новая серия гибридных многоязычных моделей от TII. Основные моменты: - Attention + Mamba2. Меньше памяти, быстрее и
+4
Falcon H1 Новая серия гибридных многоязычных моделей от TII. Основные моменты: - Attention + Mamba2. Меньше памяти, быстрее инференс, чем у традиционных трансформеров. - Много моделей: 0.5B, 1.5B, 1.5B-Deep (больше "глубины"), 7B, 32B, все имеют базовую и чат вариацию. - Хорошая многоязычность. Модель обучалась на 18 языках, в том числе на русском. По-русски говорит хуже Gemma 3, но лучше Qwen 3. - Контекст 256 тысяч токенов. - Производительность на уровне Qwen3 соответствующих размеров, при том, что видела модель в два раза меньше токенов. - Пермисивная лицензия (но не Apache 2.0/MIT) Блог, веса, демо

Qwen WorldPM Товарищи из Qwen изучают законы масштабирования reward моделей. Короткий обзор: - Взяли большой корпус реальных данных о человеческих предпочтених. Обучили на этих данных множество моделей с разным размером и количеством обучающих примеров. - При увеличении обучающей выборки и размера модели стабильно растет качество обноружения фактических ошибок в ответах. - В случае с математикой, кодом и прочими доменами, где есть объективных истинный ответ, более крупные модели значительно лучше маленьких. - А вот в случае субъективных метрик (аля chatbot arena) особых улучшений от масштабирования нет. Еще интересные находки: - StackExchange - самый качественный источник данных о предпочтениях. - У больших моделей есть "момент озарения", когда у модели резко падает loss. - Авторы используют GRPO, а не PPO и им норм🙂 Статья, модель

Seed-Coder-8B SOTA модель для кода в размере 8B. Короткий обзор: - 3 версии: base, instruct и reasoning. - Для фильтрации код
Seed-Coder-8B SOTA модель для кода в размере 8B. Короткий обзор: - 3 версии: base, instruct и reasoning. - Для фильтрации кода использовали в основном LLM - это позволило значительно улучшить качество данных. - "Всего" 6 триллионов токенов в претрене. Значительно меньше, чем у конкурентов. (Скажем, Qwen3 учился на 36 триллионах, а у старой llama3-8b - 15T). - Плохо работает со всем, кроме кода. Хотя в целом относительно нормально говорит на русском. Модель, статья

Qwen-Polymath: многоязычный математический бенчмарк Товарищи из Qwen собрали по 125 математических вопросов по 4 категориям с
+2
Qwen-Polymath: многоязычный математический бенчмарк Товарищи из Qwen собрали по 125 математических вопросов по 4 категориям сложности на 18 самых популярных языках в мире. 4 категории: 1. top - самые сложные олимпиады, самая сложная математика. 2. high - задачи, требующие критического мышления, но не требующие глубоких теоретических знаний. 3. medium - школьные задачи и самые простые олимпиады. 4. low - базовая алгебра, геометрия, теория вероятностей и статистика, в основном в виде текстовых задач. Задачки переводили так: - Предварительно перевели всё через gpt-4o - эксперты в области математики выделили из оригинальных задач на английском термины, которые нельзя переводить неправильно - финальным этапом переводчики-люди исправляли перевод gpt-4o с учетом критически важных терминов По итогу в бенчмарке лучше всего показывает себя Qwen-3-235B, после идут Gemini-2.5-Pro и Deepseek-R1. Блогпост, статья, датасет

Qwen3 - Вышел. Короткий обзор: - 0.6B, 1.7B, 8B, 14B, 32B, 30B-A3B, 235B-A22B - 32K контекс для моделей 0.6B-4B, 128K для все
+1
Qwen3 - Вышел. Короткий обзор: - 0.6B, 1.7B, 8B, 14B, 32B, 30B-A3B, 235B-A22B - 32K контекс для моделей 0.6B-4B, 128K для всего остального - Размышляющие и не-размышляющие модели в одном. Можно переключать через подсказку. - 109 языков, сильная многоязычная производительность (радует). - Улучшенные агентные способности. - 36T токенов в претрене. - Метрики на экране :) Блогпост, демо, веса загружаются прямо сейчас

Qwen3 сегодня. Возможно.
Qwen3 сегодня. Возможно.

GLM-4-0414 Странное название выбрали авторы, со старой GLM-4 её объединяет только архитектора - модель обучена с нуля. Основн
+2
GLM-4-0414 Странное название выбрали авторы, со старой GLM-4 её объединяет только архитектора - модель обучена с нуля. Основные моменты: - Четыре версии: 9B, 32B, Z1-9B, Z1-32B. Z1 это ризонеры. - Версий на самом деле 6. У Z1 есть "rumination" варианты для deep research. Это, похоже, первые модели специально для такого в опенсорсе. - Обучены на 15Т токенов. К сожалению, на русском говорит так себе. - По бенчмаркам SOTA, причем в представленных замерах обходит даже огромный Deepseek V3 и Qwen Max (и значительно). - Базовые версии тоже выложили. - Лицензия MIT. Веса

Llama4 - вышла. Пока две версии: 7Bx16 MoE (109B в целом, 17B активных), 3Bx128 (400B в целом, 17B активных). Будет еще одна,
+2
Llama4 - вышла. Пока две версии: 7Bx16 MoE (109B в целом, 17B активных), 3Bx128 (400B в целом, 17B активных). Будет еще одна, 288B активных, 2Т в целом, 16 экспертов. Архитектура "маленьких" явно вдохновлена Deepseek. По бенчаркам 400B версия сливает Deepseek V3, 100B обходит текущие модели в своем диапазоне. Контекст 10 миллионов - это приятно. Еще очень качественный посттрейнинг - модель сильно прокачали по человечности (возможно даже слишком)

Qwen2.5-Omni Кратко: - 7B модель (вообще 11B🙂) - Умеет понимать картинки, видео, звук, текст - Умеет генерировать звук и текст - Языки английский/китайский - Apache 2.0 - Умеет в стриминг со всеми модальностями сразу (например, общаться голосом, одновременно смотря на видео) - Голос звучит прикольно, не сильно хуже 4o и Gemini - но только на английском и китайском. Блогпост, статья, модель, демо

Ладно, Gemini 2.5 Pro Experimental это лучшая reasoning модель🫡
Ладно, Gemini 2.5 Pro Experimental это лучшая reasoning модель🫡

Официальные результаты бенчмарков V3-0324: - MMLU-Pro: 75.9 → 81.2 (+5.3) - GPQA: 59.1 → 68.4 (+9.3) - AIME: 39.6 → 59.4 (+19
+1
Официальные результаты бенчмарков V3-0324: - MMLU-Pro: 75.9 → 81.2 (+5.3) - GPQA: 59.1 → 68.4 (+9.3) - AIME: 39.6 → 59.4 (+19.8) (это уровень o1-mini лол) - LiveCodeBench: 39.2 → 49.2 (+10.0) Независимые результаты: - Aider Polyglot benchmark: 55.1% (лучше, чем o3-medium и sonnet 3.5, но хуже, чем R1 и sonnet 3.7) - KCORES LLM Arena (код): 328.3

А ещё Qwen выложили новую Qwen2.5-VL-32B со зрением. Блогпост
А ещё Qwen выложили новую Qwen2.5-VL-32B со зрением. Блогпост

Deepseek выложили обновленный V3. Я честно ждал, пока они дадут хоть какую-нибудь инфу по бенчмаркам или что-то в этом роде, но прошло 5 часов, а README.md все ещё пустой. По ощущениям, модель сильно улучшилась в качестве по коду, математике и creative writing. А ещё стала более живой на русском, чем-то напоминает Sonnet. https://huggingface.co/deepseek-ai/DeepSeek-V3-0324

WritingPrompts-ru и Ideya-preview-8k Продолжаю вносить вклад в русскоязычное LLM-комьюнити. Перевёл euclaise/writingprompts на русский через новую Gemma-3-27b-it. Оригинальный датасет это набор подсказок для написания художественных текстов из r/writingprompts + самый залайканый комментарий с, собственно, текстом, написанным по подсказке. Пока я перевел только подсказки, хотя планирую и сами истории тоже. Датасеты с подсказками, типа этого, полезны для генерации синтетических данных и обучения русскоязычных creative writing / roleplay моделей, с которыми, честно говоря, пока не очень. Ideya-preview-8k - как раз такой датасет, истории писала та же Gemma-3-27b-it. Превью он из-за того, что там только 8 тысяч подсказок+текстов, а планирую я сгенерировать все 270 тысяч. В большей части средняя длина сгенерированной истории - 500 слов, но ближе к концу я поменял промты. WritingPrompts-ru, Ideya-preview-8k

🙂
🙂

Gemma 3 вышла! Первые моменты: - Модель в 4 размерах: 1B, 4B, 12B, 27B. - Мультимодальность по картинкам. - Поддержка более 140 (!) языков, самая мультиязычная open source SOTA модель на данный момент. - Контекст 128К токенов. - Как и в прошлой модели маленькие версии дистилировали по-настоящему, logit'ами Презентации пока еще не было, но модели и статью уже выложили. Модель, техрепорт

Вот это денёк (не факт конечно что прямо выпустят, но держим кулачки)
Вот это денёк (не факт конечно что прямо выпустят, но держим кулачки)

Reka-flash-3 Есть такой стартап - RekaAI, некоторое время они делали чат модели общего назначения с архитектурой encoder-deco
Reka-flash-3 Есть такой стартап - RekaAI, некоторое время они делали чат модели общего назначения с архитектурой encoder-decoder (типа T5). А вот буквально 20 минут назад они вложили свою новую модель - Reka Flash 3. Да не просто выложили, а ещё и в open source. К сожалению, это не T5, это Llama. Но тем не менее: - 20B параметров - Apache 2.0 - Умеет в русский язык (не официально, но вполне нормально). - Это модель размышления, по оценкам на уровне o1-mini/QwQ-32B. Модель