Светлый Уголок | ии
Open in Telegram
Тут сначала замечают, потом обсуждают. AI-инсайды, свежие сигналы, честные мнения и свои инструменты. Светлый уголок — авторский канал про ИИ без скуки.
Show moreThe country is not specifiedThe category is not specified
659
Subscribers
+424 hours
+297 days
+10730 days
Posts Archive
Непрерывное обучение ииииии... ox alpha похоже этого достигла. Поздравляю команду GLM.
🏯 Alibaba начала тестировать Qwen 4 ... иии это мощно.
Сегодня на WebDev Arena появилась новая модель под кодовым названием
Paloma.
1⃣ Это самый сильный чекпойнт Alibaba после Qwen3.8 Max. Во фронтенде она приблизилась к Kimi K3 и иногда выглядит даже лучше, но по стабильности пока уступает обеим моделям.
На Text Arena также тестируется Magnus, вероятно, ещё один вариант Qwen 4.
Один из наших источников ранее говорил, что Qwen 4 планируют выпустить уже в сентябре. Судя по появлению Paloma и Magnus, Alibaba начала готовить модель к релизу.2⃣ Параллельно компания привлекает $10,2 млрд через размещение 710 млн новых акций в Гонконге. Все вырученные средства направят на развитие ИИ и расширение инфраструктуры. Это очень хороший толчок к развитию.
В комментариях мы прикрепили ещё несколько выводов данной модели, оцените их.
WAN 3 с тем же промптом. 🔥🔥 Вы недооценили эту модель, она действительно потрясающая, это самая близкая к Seedance 2.5 по качеству модель.
🍷 @Waguri_Kaoruko8
Alibaba начала тестировать Qwen 4
Сегодня на WebDev Arena появилась новая модель под кодовым названием
Paloma. Это самый сильный чекпойнт Alibaba после Qwen3.8 Max. Во фронтенде она приблизилась к Kimi K3 и иногда выглядит даже лучше, но по стабильности пока уступает обеим моделям.
На Text Arena также тестируется Magnus, вероятно, ещё один вариант Qwen 4.
Один из наших источников ранее говорил, что Qwen 4 планируют выпустить уже в сентябре. Судя по появлению Paloma и Magnus, Alibaba начала готовить модель к релизу.Параллельно компания привлекает $10,2 млрд через размещение 710 млн новых акций в Гонконге. Все вырученные средства направят на развитие ИИ и расширение инфраструктуры.
+1
🟠Anthropic тестируют две новые модели:
Claude-marshmallow-eap и Claude-melon-eap.
⚪️ Обе модели имеют отсечку знаний начала 2025.
* Opus 5 и Fable 5 имеют отсечку конец 2025
⚪️Marshmallow лучше Melon, но обе модели не дотягивают до уровня Fable.
Мы думаем, что это ранний снапшот Opus 5.1
Вот несколько генераций omni trash 1.2.
Если честно — продвижения ноль. Тоже самое было с veo 3.1, относительно veo 3.0.
Google готовится выпустить обновлённую версию Omni Flash (models/gemini-omni-1.1-flash)
Идентификатор базовой модели — "omni-1p2", что указывает на то, что Google использует чекпоинт Omni Flash 1.2 для версии 1.1
Прикреплённое видео — это результат её работы, сгенерированный за 43 секунды. Хотелось бы, чтобы они вообще не выпускали её на этом этапе...
🍷 @Lentils80
Сканирование безопасности Claude теперь работает на Claude Mythos 5, доступное сегодня в публичной бете для всех клиентов Claude Enterprise.
Задействуйте нашу самую мощную модель безопасности для вашей кодовой базы, без необходимости отдельного доступа к модели.
🍷 @claudeai
Прозрачные фоны теперь доступны в предпросмотре для GPT-Image-2 в API.
Создавайте переиспользуемые ассеты, которые можно размещать на любом фоне: для изображений продуктов, графического дизайна, макетов сайтов и маркетинговых кампаний.
🍷 @OpenAIDevs
На Arena AI появилась возможная Kimi K3.1
На Arena AI тестируется новая анонимная модель под кодовым названием
adamant-ananke. Мы предполагаем, что это следующая модель Kimi, возможно K3.1.
Заметного скачка пока не видно. По нашему пользовательскому опыту, модель ведёт себя примерно как K3. И кстати полноценно проверить её пока не получается: ответы периодически зависают или завершаются ошибкой.⚪️ В рассуждениях мы нашли грязный токен семейства Kimi. Похожая строка уже встречалась в ранних версиях моделей Moonshot. ⚪️ Сама модель постоянно называет себя Claude. Поэтому её происхождение всё ещё вызывает сомнения и не позволяет уверенно связать adamant-ananke с Kimi. ⚪️ Cuttof знаний, похоже, остался прежним. Модель знает события середины 2025 года, но не узнаёт более свежие релизы. Пишем об этом сейчас, чтобы держать вас в курсе. После выхода Kimi K3 прошло уже достаточно времени, поэтому появление следующего чекпойнта Moonshot вполне ожидаемо. ❗️ Примечание: принадлежность adamant-ananke к Moonshot официально не подтверждена. Это может быть Kimi K3.1, промежуточная версия или модель другой лаборатории.
🐋 DeepSeek V4 Flash наконец получила зрение.
Api docs. Цены не изменились.
DeepSeek выпустила экспериментальную V4-Flash-Vision-Exp. Как они показывают в бенчмарках модель подросла. Модель уже доступна в API и принимает изображения вместе с текстом.
Вероятно, похожее обновление позже получит и V4 Pro.
⚪️ Текстовые способности остались на уровне V4 Flash. По заявлению DeepSeek, агенты, рассуждения и знания не изменились.
❗️ Примечание: Поддержка модели уже появилась в DeepSeek Harness 0.1.1.
И да, DeepSeek Harness с Pro-версией снова, похоже, перенаправляет запросы на Opus 5. Да что ж такое. Об этом сделаем отдельный пост позже.Мнение от автора:
Похоже, DeepSeek постепенно идёт к единой мультимодальной линейке и со временем перестанет выпускать зрение отдельной версией. Сейчас компании важнее привести в порядок уже выпущенные модели. Мультимодальность полезна, но без стабильного качества и нормальной работы текущей Pro она мало что изменит.
Google наконец починила длинный контекст Gemini (но это не точно)
В GDM-MRCR v2 Full с 8 иголками Gemini 3.7 Flash лучше всех моделей на графике держится при увеличении контекста.
На 500K токенов: ☀️ Gemini 3.7 Flash: 77,7% ☀️ GPT-5.6 Sol: 61,9% ☀️ Opus 5: 42,5% ☀️ DeepSeek V4 Pro: 33,4% На полном миллионе Gemini сохраняет 63,5%, тогда как прошлая 3.5 Flash падает до 26%.
Хотя мы все знаем, что по общему качеству, по реальным задачам и другим оценкам Opus 5 и GPT-5.6 Sol все равно заметно сильнее.Первые улучшения были заметны ещё в 3.6 Flash, но настоящий скачок случился только сейчас. Если вы заметили, что 3.7 реже теряет старые детали в длинных переписках и документах, вам не показалось. Claude Code и Codex уже умеют сжимать старую историю во время длинной работы, поэтому размер сырого контекста постепенно теряет прежний вес. Но для задач, где нужно сразу загрузить огромный документ или переписку, прогресс у Gemini действительно большой. * Хотя я лично, честно говоря, не проверял, насколько стало лучше с этим всем. Недавно, кстати, появились слухи о Gemini 3.8 flash но, не верьте всему этому просто так. Модель ещё нигде не засветилась, предпосылок на подобное не было.
👀 Китайские лаборатории готовят новую волну моделей
Мы собрали всё, что сейчас известно о следующих моделях Alibaba, ByteDance, Tencent и Xiaomi.
⚪️ Qwen3.8-27B оказалась очень сильной для своего размера. Оптимизированная мультимодальная модель с открытыми весами хорошо держит длинный контекст, а в браузерных играх и 3D по первым примерам работает примерно на уровне Opus 4.6, иногда даже лучше.
☀️ Хорошее видео с примерами Qwen3.8-27B. ☀️ Пример с Minecraft.Рядом готовится Qwen3.8-35B-A3B. Это компактная MoE-модель на 35B параметров, из которых активны только 3B. Она уже появилась в коде ModelScope. Источник GitHub.
☀️ Пример одной генерации Qwen3.8-35B-A3B.Что ожидается дальше? ⚪️ Qwen 4. Мы предполагаем, что Alibaba уже начала ранние тесты модели. На Arena AI появлялся сильный чекпойнт Kiana, который сейчас отключён.
Один из наших источников, заранее назвавший августовский выход Qwen3.8, рассказал, что на конференции в Париже ему сообщили о планах выпустить Qwen-4 в сентябре 2026 года.⚪️ Модель ByteDance на 10T параметров. Financial Times со ссылкой на три источника пишет, что компания уже ведёт претрейн модели размером до 10 трлн параметров. Обучение должно занять от трёх до шести месяцев, а окончательный размер определят позже. Во внутренних инструментах ByteDance также появилась тестовая линия
agent 10Tpm. Мы предполагаем, что она может относиться к той же модели или её ранней агентной конфигурации. Сама подпись 10Tpm размер модели не раскрывает.
⚪️ HY4. На Arena AI появился ранний чекпойнт следующей модели Tencent. По первым результатам скачок относительно HY3 есть, но до текущих лидеров ей пока далеко.
⚪️ MiMo 3. Xiaomi тоже начала тестировать новый чекпойнт. На Arena раскрылось внутреннее название oracle и провайдер xiaomiV1. Вероятно, это MiMo 3 и её быстрая версия. Первые результаты пока выглядят слабо.
Mimo 3 ждут многие, так как модель mimo 2.5 славилась своей производительностью, и скоростью, и стоимостью, относительно прошлого deepseek-v4-pro эта модель была очень хорошей.❗️ Примечание: Qwen 4, HY4 и MiMo 3 официально ещё не представлены. Названия и характеристики могут измениться до релиза.
✏️ Name updates
gemini-3.5-pro ➡️ gemini-3.7-flash-high
gemini-3.5-pro ➡️ gemini-3.7-flash-high
name: null ➡️ andwise-evfd
organization: null ➡️ google
provider: null ➡️ googleWithThoughtSignatures
019fb6ba-031f-7e6b-ac0b-33dc6569bbc4
displayName: ✏️ Name updates
gemini-3.5-pro ➡️ gemini-3.7-flash-high
gemini-3.5-pro ➡️ gemini-3.7-flash-high
name: null ➡️ andwise-evfd
organization: null ➡️ google
provider: null ➡️ googleWithThoughtSignatures
019fb6ba-031f-7e6b-ac0b-33dc6569bbc4
displayName: GLM-5.3 уже доступен через GLM Coding Plan API и ZCode.
«Доступ к API и открытые веса будут предоставляться поэтапно после тщательной оценки безопасности»
