Anthropic
Claude Opus 5
Всё ещё способен, но текущие проблемы с выполнением инструкций делают его вторым выбором после обзора.
Проверенные данные о модели
Идентичность, ограничения и цены
- Статус
- Текущая
- ID модели API
claude-opus-5- Контекст
- 1M
- Максимальный вывод
- 128K
- Лицензия
- Не подтверждено публично
- Способ доступа
- Не подтверждено публично
- Модальности
- Не подтверждено публично
- Аппаратное обеспечение
- Не подтверждено публично
- Цена API / 1 млн токенов
- $5 за ввод · $— кэшированный ввод · $25 за вывод
Визуальные тесты с одинаковым промптом
Просмотреть фактические прогонки
Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

Роханская крепость
Тестирование сцены осады крепости: масштаб, освещение, архитектура и кинематографическая атмосфера.

Симулятор полета на метле в Хогвартсе
Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Jabberwock
Тестирование встречи в стиле тёмного фэнтези: дизайн существ, настроение леса и постановка повествования.

Мир с низкой полигонажностью
Стилизованная островная сцена для тестирования композиции, цвета и низкополигонального миростроения.

Симулятор механических часов
Интерактивное тестирование часов: механическая читаемость, точное относительное движение и управление в 3D в реальном времени.

Офисная жизнь
Офисная виньетка для тестирования логики повседневной сцены, объектов и достоверных офисных деталей.

Петри
Микроскопическая экосистема для тестирования органических форм, научной ясности и клеточных деталей.

Симулятор Требушета Штормграда
Тестирование осадного моделирования Counterweight с проверкой связанных механизмов, предсказанием траектории, камерами для снарядов и интерактивной настройкой.

Симулятор вселенной
Космическая система для тестирования орбитальной структуры, светящихся тел, масштаба и читаемости симуляции.

Вайс Сити
Неоновый прибрежный город для тестирования транспортных средств, архитектуры, атмосферы и плотной городской планировки.

Сборка по «Yingzao Fashi»
Сцена сборки древесины для тестирования структуры, соединений, порядка строительства и материала.
Официальный профиль бенчмарка
Опубликованные результаты за пределами наших визуальных тестов
Anthropic сообщает о достижениях по сравнению с Opus 4.8 в программировании, использовании компьютера, веб-исследованиях и профессиональной работе. Каждая строка сохраняет опубликованный уровень усилий, систему и количество испытаний, если система карты их предоставляет.
SWE-bench Pro
79.2%OSWorld 2.0
70.57%BrowseComp
90.8%Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
| Бенчмарк | Область | Балл | Настройка / сравнение |
|---|---|---|---|
| SWE-bench Pro | Кодирование | 79.2% | Среднее значение пяти испытаний в стандартной конфигурации с максимальными усилиями. |
| OSWorld 2.0 | Использование компьютера | 70.57% | Успех с первой попытки за пять прогонов на Ubuntu 1080p с ограничением в 500 действий. |
| BrowseComp | Веб-исследование | 90.8% | Поиск, извлечение, программные инструменты и код с бюджетом в 10 миллионов токенов и сжатие.Anthropic не публикует точную метку усилия Opus для этой строки. |
| SWE-bench Многоязычное | Многоязычное кодирование | 89.5% | 300 задач на девяти языках; в среднем пять попыток. |
| SWE-bench Мультимодальный | Визуальное кодирование | 59.4% | Визуальный контекст задачи во внутренней системе Anthropic; в среднем пять попыток. |
| DeepSWE v1.1 | Долгосрочное программирование | 68.8% | 113 задач; в среднем пять попыток. |
| FrontierCode 1.1 Основной | Агентное кодирование | 53.4% | Лучший результат при среднем усилии; средний прогон и оценка Cognition @5. |
| FrontierBench v0.1 | Работа в терминале | 44.4% | Внутренний запуск Anthropic при максимальном усилии по 74 задачам с мини-SWE-агентом на GKE.Отдельный запуск таблицы-резюме Harbor показывает 43,3%; эта строка использует сопоставимый внутренний запуск Anthropic. |
| Последний экзамен человечества, без инструментов | Экспертные знания | 56.3% | Адаптивное мышление, до 1 млн токенов, без сжатия. |
| Последний экзамен человечества, с инструментами | Знания с помощью инструментов | 64.7% | Поиск, извлечение, программные инструменты и код до 1 млн токенов с проверкой на загрязнение. |
| GDPval-AA v2 | Профессиональная работа | 1861 Эло | Независимый искусственный анализ, выполненный с максимальными усилиями по 220 заданиям в 44 профессиях. |
| AutomationBench | Автоматизация бизнеса | 26.0% | Максимальные усилия на приватном скрытом наборе с детерминированным выполнением рабочих процессов. |
Редакционный вердикт
Где подходит эта модель
Claude Opus 5 находится в уровне B. Команда ожидала, что он станет прорывом, но текущий опыт работы продвинутых пользователей оказался менее надежным, чем GPT-5.6, при выполнении инструкций и предоставлении работы в требуемой форме.
Лучшее для
Внимание
Почему она занимает это место
Доказательства
Рейтинг редакционной модели Mantis
Основной вывод: Claude Opus 5 в настоящее время находится в уровне B.
Редакционная таблица на август 2026 года ставит Claude Opus 5 на 12-е место.
Открытый исходный код →Связанные руководства