Anthropic

Уровень B · Специализированные модели или модели второго выбора.

Claude Opus 5

Всё ещё способен, но текущие проблемы с выполнением инструкций делают его вторым выбором после обзора.

Проверенные данные о модели

Идентичность, ограничения и цены

Источник провайдера · проверено 01.09.2026 ↗
Статус
Текущая
ID модели API
claude-opus-5
Контекст
1M
Максимальный вывод
128K
Лицензия
Не подтверждено публично
Способ доступа
Не подтверждено публично
Модальности
Не подтверждено публично
Аппаратное обеспечение
Не подтверждено публично
Цена API / 1 млн токенов
$5 за ввод · $— кэшированный ввод · $25 за вывод

Визуальные тесты с одинаковым промптом

Просмотреть фактические прогонки

Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

11 запусков

Симулятор полета на метле в Хогвартсе

Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Симулятор механических часов

Интерактивное тестирование часов: механическая читаемость, точное относительное движение и управление в 3D в реальном времени.

Симулятор Требушета Штормграда

Тестирование осадного моделирования Counterweight с проверкой связанных механизмов, предсказанием траектории, камерами для снарядов и интерактивной настройкой.

Редакционный вердикт

Где подходит эта модель

Вернуться ко всем тестам →

Claude Opus 5 находится в уровне B. Команда ожидала, что он станет прорывом, но текущий опыт работы продвинутых пользователей оказался менее надежным, чем GPT-5.6, при выполнении инструкций и предоставлении работы в требуемой форме.

Лучшее для

  • Обзор рабочих процессов Claude
  • Продолжение сильного плана
  • Задачи, где инструменты Anthropic уже внедрены

Внимание

  • Следование инструкциям может быть непоследовательным
  • Опыт продвинутых пользователей может отличаться от ожиданий на момент запуска
  • Избегайте годового обязательства, пока гонка моделей меняется так быстро

Почему она занимает это место

  1. Уровень B, а не A, отражает разрыв между его потенциальными возможностями и текущим опытом команды в доставке результатов.
  2. Основная забота команды заключается в практическом выполнении инструкций и их реализации, а не в утверждении, что у модели нет исходных возможностей.
  3. Спекуляции о том, почему поведение изменилось, не рассматриваются как доказательство; размещение отражает только наблюдаемый опыт рабочего процесса.

Доказательства

2026-08-27

Рейтинг редакционной модели Mantis

Основной вывод: Claude Opus 5 в настоящее время находится в уровне B.

Редакционная таблица на август 2026 года ставит Claude Opus 5 на 12-е место.

Открытый исходный код →

Официальный профиль бенчмарка

Опубликованные результаты за пределами наших визуальных тестов

Anthropic сообщает о достижениях по сравнению с Opus 4.8 в программировании, использовании компьютера, веб-исследованиях и профессиональной работе. Каждая строка сохраняет опубликованный уровень усилий, систему и количество испытаний, если система карты их предоставляет.

Источник AnthropicИюль 2026Исходный отчет →
Кодирование

SWE-bench Pro

79.2%
Использование компьютера

OSWorld 2.0

70.57%
Веб-исследование

BrowseComp

90.8%
Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
БенчмаркОбластьБаллНастройка / сравнение
SWE-bench ProКодирование79.2%Среднее значение пяти испытаний в стандартной конфигурации с максимальными усилиями.
Claude Fable 580.0%
Claude Opus 579.2%
Claude Opus 4.869.2%
GPT-5.6 Sol64.6%
OSWorld 2.0Использование компьютера70.57%Успех с первой попытки за пять прогонов на Ubuntu 1080p с ограничением в 500 действий.
Claude Opus 570.57%
Claude Fable 566.1%
GPT-5.6 Sol62.6%
Claude Opus 4.855.7%
BrowseCompВеб-исследование90.8%Поиск, извлечение, программные инструменты и код с бюджетом в 10 миллионов токенов и сжатие.Anthropic не публикует точную метку усилия Opus для этой строки.
Claude Opus 590.8%
GPT-5.6 Sol90.4%
Claude Fable 587.4%
Claude Opus 4.884.3%
SWE-bench МногоязычноеМногоязычное кодирование89.5%300 задач на девяти языках; в среднем пять попыток.
Claude Opus 589.5%
Claude Fable 586.6%
Claude Opus 4.884.4%
SWE-bench МультимодальныйВизуальное кодирование59.4%Визуальный контекст задачи во внутренней системе Anthropic; в среднем пять попыток.
Claude Opus 559.4%
Claude Fable 554.1%
Claude Opus 4.838.4%
DeepSWE v1.1Долгосрочное программирование68.8%113 задач; в среднем пять попыток.
GPT-5.6 Sol72.7%
Claude Fable 569.7%
Claude Opus 568.8%
Claude Opus 4.859.0%
FrontierCode 1.1 ОсновнойАгентное кодирование53.4%Лучший результат при среднем усилии; средний прогон и оценка Cognition @5.
Claude Fable 553.5%
Claude Opus 553.4%
GPT-5.6 Sol47.5%
Claude Opus 4.846.5%
FrontierBench v0.1Работа в терминале44.4%Внутренний запуск Anthropic при максимальном усилии по 74 задачам с мини-SWE-агентом на GKE.Отдельный запуск таблицы-резюме Harbor показывает 43,3%; эта строка использует сопоставимый внутренний запуск Anthropic.
Claude Opus 544.4%
GPT-5.6 Sol макс37.5%
Claude Fable 5 макс33.7%
Claude Opus 4.818.7%
Последний экзамен человечества, без инструментовЭкспертные знания56.3%Адаптивное мышление, до 1 млн токенов, без сжатия.
Claude Fable 556.5%
Claude Opus 556.3%
Claude Opus 4.849.8%
Последний экзамен человечества, с инструментамиЗнания с помощью инструментов64.7%Поиск, извлечение, программные инструменты и код до 1 млн токенов с проверкой на загрязнение.
Claude Opus 564.7%
Claude Fable 563.9%
Claude Opus 4.857.9%
GDPval-AA v2Профессиональная работа1861 ЭлоНезависимый искусственный анализ, выполненный с максимальными усилиями по 220 заданиям в 44 профессиях.
AutomationBenchАвтоматизация бизнеса26.0%Максимальные усилия на приватном скрытом наборе с детерминированным выполнением рабочих процессов.
Claude Opus 526.0%
GPT-5.6 Sol18.1%
Claude Fable 517.4%
Claude Opus 4.817.0%