fa
Feedback

فریب کلاهبرداران را نخورید! تل‌متریو این کانال‌ها را شناسایی و برچسب‌گذاری می‌کند 👉 برای مشاهده برچسب، اشتراک تهیه کنید 👈

Krist/Blog

Krist/Blog

رفتن به کانال در Telegram

Веду свой уютный канал про старые и новые железки и не железки, нейросети и не нейросети и вообще всё, что мне интересно. Вступайте в чатик @kristchat Писать сюда - @kristaller

نمایش بیشتر
247
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+17 روز
+930 روز

در حال بارگیری داده...

کانال‌های مشابه
هیچ داده‌ای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
ژوئن '25
ژوئن '25
+1
در 1 کانال‌ها
مه '25
+14
در 1 کانال‌ها
Get PRO
آوریل '25
+19
در 3 کانال‌ها
Get PRO
مارس '25
+73
در 1 کانال‌ها
Get PRO
فوریه '250
در 4 کانال‌ها
Get PRO
ژانویه '250
در 0 کانال‌ها
Get PRO
دسامبر '24
+20
در 1 کانال‌ها
Get PRO
نوامبر '240
در 1 کانال‌ها
Get PRO
اکتبر '24
+13
در 0 کانال‌ها
Get PRO
سپتامبر '240
در 0 کانال‌ها
Get PRO
اوت '24
+26
در 0 کانال‌ها
Get PRO
ژوئیه '240
در 1 کانال‌ها
Get PRO
ژوئن '240
در 0 کانال‌ها
Get PRO
مه '24
+17
در 0 کانال‌ها
Get PRO
آوریل '240
در 0 کانال‌ها
Get PRO
مارس '24
+79
در 0 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
12 ژوئن0
11 ژوئن0
10 ژوئن0
09 ژوئن0
08 ژوئن0
07 ژوئن0
06 ژوئن0
05 ژوئن0
04 ژوئن0
03 ژوئن0
02 ژوئن0
01 ژوئن+1
پست‌های کانال
DeepSeek-R1-0528 Новая версия R1: - Качество выросло по всем бенчмаркам. - Модель конечно не достигла уровня o3 и Gemini 2.5
DeepSeek-R1-0528 Новая версия R1: - Качество выросло по всем бенчмаркам. - Модель конечно не достигла уровня o3 и Gemini 2.5 Pro, но очень к ним приблизилась. - Модель теперь использует значительно больше токенов на размышления (почти в 2 раза на сложных задачах). - Теперь поддерживает системный промпт. - Есть distill версия на основе Qwen3-8b (на момент написания заметки еще не выложили). - Как и раньше, MIT лицензия. Модель

2
Всем привет! Рад сообщить о нашем новом релизе RuadaptQwen3-32B-Instruct 🎉. Это адаптированная версия Qwen3-32B, которая также является гибридным ризонером с режимом размышлений по-умолчанию. Отличия текущего релиза от прошлых: 1. Версионирование: теперь версионирование моделей будет идти внутри одного репозитория, но в Versions будут отмечены даты и соответствующие коммиты, которые могут быть использованы, если кому-то больше понравится “прошлая версия”. Таким образом мне проще выкладывать текущие наработки, которые я все еще не могу назвать итоговыми, но которые уже неплохи на мой взгляд. 2. Процедура адаптации была улучшена: токенайзер содержит потерянные смайлы и не содержит ненужных цифр, количество данных в continued pretraining было увеличено вдвое и еще несколько минорных изменений процедуры, которые приводят к бОльшему качеству на выходе. Так как для Qwen3-32B не была выложена базовая версия, мы сделали ее сами, дообучив только эмбеддинги (входные и выходные) на +-миллиарде токенов. 3. Новый набор для SFT и пока что отсутствие Pref-tuning этапа: в этот раз данные для обучения были сгенерированы на основе большой модели Qwen3-235B-A22B. Для сохранения функции переключения между режимами, в 30% случаев think содержимое выбрасывалось и добавлялся /no_think токен к последнему сообщению пользователя. Для 10% случаев, когда размышления оставались добавлялся токен /think. Используемый датасет выложен и упомянут в карточке модели. 4. Метрик пока нет, но в целом имеется некоторая просадка на мат. задачах, однако для обычного использования все должно быть +- на уровне исходной версии. Если заметите плохие или наоборот хорошие стороны модели - обязательно пишите, так как сейчас активно идут работы над инструктивной частью и фидбек по поводу проблем будет очень актуален. Модель: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct GGUF: https://huggingface.co/RefalMachine/RuadaptQwen3-32B-Instruct-GGUF Space: https://huggingface.co/spaces/RefalMachine/RuadaptQwen3
141
3
Falcon H1 Новая серия гибридных многоязычных моделей от TII. Основные моменты: - Attention + Mamba2. Меньше памяти, быстрее и+4
Falcon H1 Новая серия гибридных многоязычных моделей от TII. Основные моменты: - Attention + Mamba2. Меньше памяти, быстрее инференс, чем у традиционных трансформеров. - Много моделей: 0.5B, 1.5B, 1.5B-Deep (больше "глубины"), 7B, 32B, все имеют базовую и чат вариацию. - Хорошая многоязычность. Модель обучалась на 18 языках, в том числе на русском. По-русски говорит хуже Gemma 3, но лучше Qwen 3. - Контекст 256 тысяч токенов. - Производительность на уровне Qwen3 соответствующих размеров, при том, что видела модель в два раза меньше токенов. - Пермисивная лицензия (но не Apache 2.0/MIT) Блог, веса, демо
452
4
Qwen WorldPM Товарищи из Qwen изучают законы масштабирования reward моделей. Короткий обзор: - Взяли большой корпус реальных данных о человеческих предпочтених. Обучили на этих данных множество моделей с разным размером и количеством обучающих примеров. - При увеличении обучающей выборки и размера модели стабильно растет качество обноружения фактических ошибок в ответах. - В случае с математикой, кодом и прочими доменами, где есть объективных истинный ответ, более крупные модели значительно лучше маленьких. - А вот в случае субъективных метрик (аля chatbot arena) особых улучшений от масштабирования нет. Еще интересные находки: - StackExchange - самый качественный источник данных о предпочтениях. - У больших моделей есть "момент озарения", когда у модели резко падает loss. - Авторы используют GRPO, а не PPO и им норм🙂 Статья, модель
369
5
Seed-Coder-8B SOTA модель для кода в размере 8B. Короткий обзор: - 3 версии: base, instruct и reasoning. - Для фильтрации код
Seed-Coder-8B SOTA модель для кода в размере 8B. Короткий обзор: - 3 версии: base, instruct и reasoning. - Для фильтрации кода использовали в основном LLM - это позволило значительно улучшить качество данных. - "Всего" 6 триллионов токенов в претрене. Значительно меньше, чем у конкурентов. (Скажем, Qwen3 учился на 36 триллионах, а у старой llama3-8b - 15T). - Плохо работает со всем, кроме кода. Хотя в целом относительно нормально говорит на русском. Модель, статья
419
6
Qwen-Polymath: многоязычный математический бенчмарк Товарищи из Qwen собрали по 125 математических вопросов по 4 категориям с+2
Qwen-Polymath: многоязычный математический бенчмарк Товарищи из Qwen собрали по 125 математических вопросов по 4 категориям сложности на 18 самых популярных языках в мире. 4 категории: 1. top - самые сложные олимпиады, самая сложная математика. 2. high - задачи, требующие критического мышления, но не требующие глубоких теоретических знаний. 3. medium - школьные задачи и самые простые олимпиады. 4. low - базовая алгебра, геометрия, теория вероятностей и статистика, в основном в виде текстовых задач. Задачки переводили так: - Предварительно перевели всё через gpt-4o - эксперты в области математики выделили из оригинальных задач на английском термины, которые нельзя переводить неправильно - финальным этапом переводчики-люди исправляли перевод gpt-4o с учетом критически важных терминов По итогу в бенчмарке лучше всего показывает себя Qwen-3-235B, после идут Gemini-2.5-Pro и Deepseek-R1. Блогпост, статья, датасет
409
7
Qwen3 - Вышел. Короткий обзор: - 0.6B, 1.7B, 8B, 14B, 32B, 30B-A3B, 235B-A22B - 32K контекс для моделей 0.6B-4B, 128K для все+1
Qwen3 - Вышел. Короткий обзор: - 0.6B, 1.7B, 8B, 14B, 32B, 30B-A3B, 235B-A22B - 32K контекс для моделей 0.6B-4B, 128K для всего остального - Размышляющие и не-размышляющие модели в одном. Можно переключать через подсказку. - 109 языков, сильная многоязычная производительность (радует). - Улучшенные агентные способности. - 36T токенов в претрене. - Метрики на экране :) Блогпост, демо, веса загружаются прямо сейчас
327
8
Qwen3 сегодня. Возможно.
Qwen3 сегодня. Возможно.
582
9
GLM-4-0414 Странное название выбрали авторы, со старой GLM-4 её объединяет только архитектора - модель обучена с нуля. Основн+2
GLM-4-0414 Странное название выбрали авторы, со старой GLM-4 её объединяет только архитектора - модель обучена с нуля. Основные моменты: - Четыре версии: 9B, 32B, Z1-9B, Z1-32B. Z1 это ризонеры. - Версий на самом деле 6. У Z1 есть "rumination" варианты для deep research. Это, похоже, первые модели специально для такого в опенсорсе. - Обучены на 15Т токенов. К сожалению, на русском говорит так себе. - По бенчмаркам SOTA, причем в представленных замерах обходит даже огромный Deepseek V3 и Qwen Max (и значительно). - Базовые версии тоже выложили. - Лицензия MIT. Веса
303
10
Llama4 - вышла. Пока две версии: 7Bx16 MoE (109B в целом, 17B активных), 3Bx128 (400B в целом, 17B активных). Будет еще одна,+2
Llama4 - вышла. Пока две версии: 7Bx16 MoE (109B в целом, 17B активных), 3Bx128 (400B в целом, 17B активных). Будет еще одна, 288B активных, 2Т в целом, 16 экспертов. Архитектура "маленьких" явно вдохновлена Deepseek. По бенчаркам 400B версия сливает Deepseek V3, 100B обходит текущие модели в своем диапазоне. Контекст 10 миллионов - это приятно. Еще очень качественный посттрейнинг - модель сильно прокачали по человечности (возможно даже слишком)
497
11
Qwen2.5-Omni Кратко: - 7B модель (вообще 11B🙂) - Умеет понимать картинки, видео, звук, текст - Умеет генерировать звук и текст - Языки английский/китайский - Apache 2.0 - Умеет в стриминг со всеми модальностями сразу (например, общаться голосом, одновременно смотря на видео) - Голос звучит прикольно, не сильно хуже 4o и Gemini - но только на английском и китайском. Блогпост, статья, модель, демо
954
12
Ладно, Gemini 2.5 Pro Experimental это лучшая reasoning модель🫡
Ладно, Gemini 2.5 Pro Experimental это лучшая reasoning модель🫡
317
13
Официальные результаты бенчмарков V3-0324: - MMLU-Pro: 75.9 → 81.2 (+5.3) - GPQA: 59.1 → 68.4 (+9.3) - AIME: 39.6 → 59.4 (+19+1
Официальные результаты бенчмарков V3-0324: - MMLU-Pro: 75.9 → 81.2 (+5.3) - GPQA: 59.1 → 68.4 (+9.3) - AIME: 39.6 → 59.4 (+19.8) (это уровень o1-mini лол) - LiveCodeBench: 39.2 → 49.2 (+10.0) Независимые результаты: - Aider Polyglot benchmark: 55.1% (лучше, чем o3-medium и sonnet 3.5, но хуже, чем R1 и sonnet 3.7) - KCORES LLM Arena (код): 328.3
383
14
А ещё Qwen выложили новую Qwen2.5-VL-32B со зрением. Блогпост
А ещё Qwen выложили новую Qwen2.5-VL-32B со зрением. Блогпост
270
15
Deepseek выложили обновленный V3. Я честно ждал, пока они дадут хоть какую-нибудь инфу по бенчмаркам или что-то в этом роде, но прошло 5 часов, а README.md все ещё пустой. По ощущениям, модель сильно улучшилась в качестве по коду, математике и creative writing. А ещё стала более живой на русском, чем-то напоминает Sonnet. https://huggingface.co/deepseek-ai/DeepSeek-V3-0324
249
16
WritingPrompts-ru и Ideya-preview-8k Продолжаю вносить вклад в русскоязычное LLM-комьюнити. Перевёл euclaise/writingprompts на русский через новую Gemma-3-27b-it. Оригинальный датасет это набор подсказок для написания художественных текстов из r/writingprompts + самый залайканый комментарий с, собственно, текстом, написанным по подсказке. Пока я перевел только подсказки, хотя планирую и сами истории тоже. Датасеты с подсказками, типа этого, полезны для генерации синтетических данных и обучения русскоязычных creative writing / roleplay моделей, с которыми, честно говоря, пока не очень. Ideya-preview-8k - как раз такой датасет, истории писала та же Gemma-3-27b-it. Превью он из-за того, что там только 8 тысяч подсказок+текстов, а планирую я сгенерировать все 270 тысяч. В большей части средняя длина сгенерированной истории - 500 слов, но ближе к концу я поменял промты. WritingPrompts-ru, Ideya-preview-8k
1 421
17
🙂
🙂
292
18
Gemma 3 вышла! Первые моменты: - Модель в 4 размерах: 1B, 4B, 12B, 27B. - Мультимодальность по картинкам. - Поддержка более 140 (!) языков, самая мультиязычная open source SOTA модель на данный момент. - Контекст 128К токенов. - Как и в прошлой модели маленькие версии дистилировали по-настоящему, logit'ами Презентации пока еще не было, но модели и статью уже выложили. Модель, техрепорт
1 303
19
Вот это денёк (не факт конечно что прямо выпустят, но держим кулачки)
Вот это денёк (не факт конечно что прямо выпустят, но держим кулачки)
681
20
Reka-flash-3 Есть такой стартап - RekaAI, некоторое время они делали чат модели общего назначения с архитектурой encoder-deco
Reka-flash-3 Есть такой стартап - RekaAI, некоторое время они делали чат модели общего назначения с архитектурой encoder-decoder (типа T5). А вот буквально 20 минут назад они вложили свою новую модель - Reka Flash 3. Да не просто выложили, а ещё и в open source. К сожалению, это не T5, это Llama. Но тем не менее: - 20B параметров - Apache 2.0 - Умеет в русский язык (не официально, но вполне нормально). - Это модель размышления, по оценкам на уровне o1-mini/QwQ-32B. Модель
273