☝🏻Anthropic представила Claude Opus 5
Anthropic сравнивает новинку не с конкурентами, а с собственной топовой моделью Claude Fable 5 — и делает ставку на то, что
Opus 5 подбирается к её уровню интеллекта примерно за половину цены.🤖
Стоимость осталась прежней — 5 долларов за миллион входных токенов и 25 долларов за миллион выходных, ровно как у предшественника Opus 4.8.
При этом модель стала дефолтной на тарифе Claude Max и самой мощной из доступных на Claude Pro.
☝🏻Прирост в кодинге выглядит наиболее убедительно.
На бенчмарке Frontier-Bench v0.1
Opus 5 обходит все остальные модели и более чем вдвое превосходит результат Opus 4.8 — при меньшей стоимости задачи.
На CursorBench 3.2 в режиме максимального усилия модель отстаёт от лучшего результата Fable 5
менее чем на 0,5%, но обходится примерно
вдвое дешевле за задачу.💻
☝🏻Самая громкая цифра релиза — ARC-AGI-3, тест на решение принципиально новых задач, который считается устойчивым к «натаскиванию».
Opus 5 набрал 30,2%, более чем
втрое превысив лучший результат, который когда-либо показывала любая модель на этом бенчмарке.
Для сравнения: Opus 4.8 набирал на нём около 1,5%.
☝🏻Есть успехи и в «офисной» части.
На Zapier AutomationBench, где модель должна довести бизнес-задачу от начала до конца, показатель прохождения примерно
в 1,5 раза выше, чем у ближайшего конкурента при той же цене за задачу — причём даже на минимальном уровне усилий
Opus 5 проходит больше задач, чем любая другая модель.
На бенчмарке компьютерного управления OSWorld 2.0
модель превосходит лучший результат Fable 5, тратя чуть больше трети его стоимости.
Компания также называет Opus 5 своей
самой сильной общедоступной моделью для научной работы.
Прогресс заметнее всего в органической химии — например, при выводе структуры молекул из спектроскопических данных модель на 10,2 процентных пункта опережает Opus 4.8, а на задачах по предсказанию влияния мутаций на функции белка — на 7,7 пункта.
По безопасности Anthropic утверждает, что автоматический поведенческий аудит
признал Opus 5 самой согласованной моделью компании: 2,3 балла по общему уровню несогласованного поведения — минимум среди недавних релизов.
☝🏻☝🏻Модель специально
не обучали на кибертасках; она почти догнала Mythos 5 в поиске уязвимостей, но заметно
отстаёт в разработке эксплойтов под них.
Классификаторы
блокируют пентест и
генерацию эксплойтов, а срабатывать они должны примерно на 85% реже, чем у Fable 5
🔻Общая логика релиза читается ясно: гонка ИИ смещается от чистой мощности к экономике повседневного использования.
Anthropic
по-прежнему рекомендует Fable 5 для самых сложных автономных проектов, но для ежедневной работы теперь предлагает модель, которая думает почти так же, а считает деньги гораздо лучше.