5модели на общих источниках таблиц
6модели на одной и той же оценке
1пока без ранжирования

Независимые измерения ведут. Результаты поставщиков остаются в отдельных, связанныc источниками линиях.

Независимое сравнение

Независимые оценки по 9 моделям.

Индекс искусственного анализа v4.1 объединяет девять оценок по программированию, агентной работе, науке, знаниям, физике и рассуждениям в длинном контексте. Чем выше, тем лучше.

Верхний индекс61Grok 4.6
Самый быстрый вывод178GPT-5.6 Luna, токены в секунду
Низкая смешанная цена$0.87GPT-5.6 Luna, за 1M токенов
  1. Grok 4.6Высокий
    61Источник AA ↗
  2. Claude Fable 5Max, резервная версия Opus 4.8
    60Источник AA ↗
  3. Claude Opus 5Адаптивное рассуждение, очень высокий
    60Источник AA ↗
  4. GPT-5.6 SolМакс
    59Источник AA ↗
  5. Kimi K3Рассуждение
    57Источник AA ↗
  6. 55Источник AA ↗
  7. GPT-5.5xвысокий
    55Источник AA ↗
  8. Grok 4.5Высокий
    54Источник AA ↗
  9. GPT-5.6 LunaВысокий
    46Источник AA ↗

Конфигурация имеет значение. Fable 5 включает опубликованную резервную версию Opus 4.8. Оценки GPT и Claude используют уровень усилий, указанный рядом с каждой моделью.

Исследователь стоимости

Рассчитайте стоимость вашей фактической рабочей нагрузки.

Установите входные и выходные токены для одной задачи. Исследователь применяет текущие цены из списка API и перерассчитывает каждую модель в том же сценарии.

Примеры рабочих нагрузок
МодельИндекс AAВход / 1МВыход / 1МСкоростьВаша задача
Claude Fable 5Anthropic · Max, Opus 4.8 резервный вариант60Индекс$10.00$50.0069.7tokens/sec$6.00Данные AA ↗Цена ↗
Claude Opus 5Anthropic · Адаптивное рассуждение, очень высокий60Индекс$5.00$25.0053.1tokens/sec$3.00Данные AA ↗Цена ↗
GPT-5.6 SolOpenAI · Max59Индекс$4.00$20.0077.1tokens/sec$2.40Данные AA ↗Цена ↗
Kimi K3Moonshot AI · Рассуждение57Индекс$3.00$15.0032.0tokens/sec$1.80Данные AA ↗Цена ↗
GPT-5.6 TerraOpenAI · Max55Индекс$2.50$15.00134.5tokens/sec$1.70Данные AA ↗Цена ↗
GPT-5.5OpenAI · Очень высокий55Индекс$5.00$30.0072.5tokens/sec$3.40Данные AA ↗Цена ↗
Grok 4.5Xai · Высокий54Индекс$2.00$6.0067.1tokens/sec$0.88Данные AA ↗Цена ↗
Grok 4.6Xai · Высокий61Индекс$2.00$6.0065.1tokens/sec$0.88Данные AA ↗Цена ↗
GPT-5.6 LunaOpenAI · Высокий46Индекс$1.00$6.00178.0tokens/sec$0.68Данные AA ↗Цена ↗

Включено: стандартный ввод и сгенерированный вывод по ценам API, проверено 01.09.2026.

Не включено: запись в кэш, вызовы инструментов, хранение, скидки за пакет, наценки провайдера или дополнительные токены, которые модель может использовать для завершения той же задачи.

Смешанный ориентир: Artificial Analysis также публикует цену за кэш-опыта/ввод/вывод 7:2:1. Самая низкая в этом наборе — GPT-5.6 Luna по $0,87 за 1М смешанных токенов.

Сравнимые диапазоны оценок

Держите несовместимые оценки раздельно.

Каждый график отображает один эталонный тест. Оранжевым отмечена одна исходная таблица. Обведенные отмечены использованием той же именованной оценки от другого издателя и не предполагается, что это идентичные запуски.

Агентное кодирование

SWE-bench Pro

Таблица сравнения GPT-5.6 ↗

Публичные задачи. Приведенные ниже оценки опубликованы в таблицах по различным моделям; усилия и окружение сохраняются в каждом источнике.

  1. Claude Fable 5
    80.0%Общая таблица
  2. Grok 4.5
    64.7%Та же оценка ↗
  3. GPT-5.6 Sol
    64.6%Общая таблица
  4. GPT-5.6 Terra
    63.4%Общая таблица
  5. GPT-5.6 Luna
    62.7%Общая таблица
  6. GPT-5.5
    59.4%Общая таблица
  7. Inkling
    54.3%Та же оценка ↗

Опубликовано в июле 2026 года. Откройте исходник перед использованием этих данных для принятия решения о покупке.

Терминальные агенты

Terminal-Bench 2.1

Таблица сравнения GPT-5.6 ↗

Выполнение задач через командную строку. Основные цифры используют общую таблицу OpenAI; другие заявленные оценки указаны отдельно, а не нормализованы.

  1. GPT-5.6 Sol
    88.8%Общая таблица
  2. GPT-5.6 Terra
    87.4%Общая таблица
  3. GPT-5.5
    85.6%Общая таблица
  4. GPT-5.6 Luna
    84.7%Общая таблица
  5. Grok 4.5
    83.3%Та же оценка ↗
  6. Claude Fable 5
    83.1%Общая таблица
  7. Inkling
    63.8%Та же оценка ↗

Опубликовано в июле 2026 года. Откройте исходник перед использованием этих данных для принятия решения о покупке.

Научное рассуждение

GPQA Diamond

Таблица модели Inkling по кроссмодельной оценке ↗

Вопросы по науке без использования инструментов. Эта ветка сохраняет видимую конфигурацию, о которой сообщалось, потому что бюджеты рассуждений различаются у разных провайдеров.

  1. GPT-5.6 Sol
    94.1%Общая таблица
  2. Claude Fable 5
    92.6%Общая таблица
  3. Inkling
    87.2%Общая таблица

Опубликовано в июле 2026 года. Откройте исходник перед использованием этих данных для принятия решения о покупке.

Методология

Ограничения этого сравнения

Результаты Индекса Искусственного Анализа получены с помощью одного независимого хаба. Точная конфигурация модели сохраняется для каждого результата.

Сценарии стоимости токенов умножают опубликованные цены на входные и выходные данные на введенную вами нагрузку. Они не включают инструменты, хранение, запись в кэш и скидки провайдера.

Отметка общей таблицы означает, что источник опубликовал сравниваемые модели в одной таблице. Отметка того же теста означает, что имя бенчмарка совпадает, но источник или конфигурация различаются.

Отсутствие данных не является низким результатом. Модели без совместимого публичного результата остаются без ранжирования до публикации воспроизводимого результата.

Наши визуальные прогоны Mantis представляют собой отдельный слой доказательств с тем же запросом. Используйте сравнение на живом прогоне, чтобы напрямую оценить качество сборки.

Просмотреть визуальные прогоны с тем же запросом →