Moonshot AI

Уровень A · Сильный с чёткими правилами работы.

Kimi K3

Kimi K3 обладает почти возможностями S-уровня, но стоимость и лимиты квоты делают его операционным выбором уровня A.

Проверенные данные о модели

Идентичность, ограничения и цены

Источник провайдера · проверено 01.09.2026 ↗
Статус
Текущая
ID модели API
kimi-k3
Контекст
1.05M
Максимальный вывод
131K
Лицензия
Не подтверждено публично
Способ доступа
Не подтверждено публично
Модальности
Не подтверждено публично
Аппаратное обеспечение
Не подтверждено публично
Цена API / 1 млн токенов
$3 за ввод · $0,3 за кэшированный ввод · $15 за вывод

Рекомендуется для этого руководства

Kimi

Используйте ту же семью Kimi, что тестировалась на этой странице. Проверьте текущий план и доступность модели перед подпиской.

Лучшее для: Настройки Claude Code и работа с учётом стоимости модели

Проверить планы KimiПартнерская ссылка. Она поддерживает Mantis без дополнительных затрат для вас.

Визуальные тесты с одинаковым промптом

Просмотреть фактические прогонки

Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

10 запусков

Симулятор полета на метле в Хогвартсе

Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Симулятор механических часов

Интерактивное тестирование часов: механическая читаемость, точное относительное движение и управление в 3D в реальном времени.

Редакционный вердикт

Где подходит эта модель

Вернуться ко всем тестам →

Kimi K3 хорошо справляется с долгим кодированием, использованием инструментов и визуальной итерацией. Команда исчерпала лимиты коротких и месячных планов во время регулярного использования, поэтому это размещение учитывает доступ и стоимость, а также чистую производительность.

Лучшее для

  • Долгосрочного кодирования в Kimi Code
  • Задач с большими репозиториями и использованием инструментов
  • Визуальной итерации по скриншотам
  • Интеллектуальной работы с длинным контекстом

Внимание

  • Лимиты месячных и коротких планов повлияли на использование командой
  • Премиальная цена за вывод
  • Используйте совместимую с K3 систему и сохраняйте историю размышлений
  • Избегайте переключения на K3 в середине сессии

Почему она занимает это место

  1. Moonshot набрал 67,5 на DeepSWE, 88,3 на Terminal-Bench 2.1, 81,2 на FrontierSWE и 77,8 на Program Bench при максимальных усилиях. Различия в используемых системах не позволяют сделать универсальный рейтинг.
  2. K3 выполнил девять визуальных запросов Mantis, предоставляя проверяемый вывод помимо оценок поставщиков.
  3. Размещение в категории A отражает исчерпание квот подписки и затраты, а не снижение чистого интеллекта.

Доказательства

2026-08-27

Рейтинг редакционной модели Mantis

Основной вывод: Kimi K3 в настоящее время находится в категории А.

Редакционный список за август 2026 года ставит Kimi K3 на 4-е место.

Открытый исходный код →
2026-07-16

Kimi K3: Open Frontier Intelligence

Основной вывод: В таблице релизов Moonshot представлены результаты конкурентного программирования, агентные и визуальные показатели, включая 88,3% на Terminal-Bench 2.1 и 81,2% на FrontierSWE.

Это результаты, предоставленные поставщиками при максимальных усилиях по рассуждению, и они варьируются в зависимости от используемого агента, поэтому они демонстрируют передовые возможности K3, но не являются сопоставимым общим баллом.

Открытый исходный код →
2026-07-16

Визуальный набор бенчмарков Mantis: Kimi K3

Основной вывод: K3 выполнил все девять общих визуальных бенчмарков в наборе Mantis.

Результаты предоставляют практическую проверку качества визуальной реализации наряду с опубликованными результатами бенчмарков.

Открытый исходный код →

Официальный профиль бенчмарка

Опубликованные результаты за пределами наших визуальных тестов

Moonshot сообщает, что Kimi K3 работает на максимальной когнитивной нагрузке по программированию, исследованию, использованию инструментов, работе с документами и зрению. Официальная таблица смешивает различные окружения провайдеров для некоторых задач агентов, поэтому каждая строка сохраняет свои настройки оценки.

Источник Moonshot AIАвгуст 2026Исходный отчет →
Академическое рассуждение

GPQA Diamond

93.5%
Кодирование

DeepSWE

67.5%
Агентное кодирование

Terminal-Bench 2.1

88.3%
Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
БенчмаркОбластьБаллНастройка / сравнение
GPQA DiamondАкадемическое рассуждение93.5%Максимальная когнитивная нагрузка, температура 1.0, top-p 0.95.
GPT-5.6 Sol94.1%
Kimi K393.5%
Claude Fable 592.6%
GLM 5.291.2%
DeepSWEКодирование67.5%Kimi Code harness на задачах DeepSWE v1.1.Официальный результат в рейтинге под mini-SWE-agent составляет 67.3%.
GPT-5.6 Sol73.0%
Claude Fable 570.0%
Kimi K367.5%
GPT-5.567.0%
Claude Opus 4.859.0%
Terminal-Bench 2.1Агентное кодирование88.3%Kimi Code harness; коллеги используют лучший заявленный окружение каждого провайдера.
GPT-5.6 Sol88.8%
Kimi K388.3%
Claude Fable 588.0%
Claude Opus 4.884.6%
GPT-5.583.4%
SWE-МарафонДолгосрочное программирование42.0%Claude Code для Kimi и Claude; Codex для GPT-5.6 по ветке задач с калибровкой H20 от 9 июля.
Kimi K342.0%
Claude Opus 4.840.0%
GPT-5.6 Sol39.0%
Claude Fable 535.0%
BrowseCompАгентское исследование91.2%Сжатие контекста до 300 тысяч токенов; полный прогон с контекстом в 1 млн без управления контекстом набрал 90,4%.
Kimi K391.2%
GPT-5.6 Sol90.4%
Claude Fable 588.0%
GPT-5.584.4%
DeepSearchQA (F1)Глубокое исследование95.0%Максимальные усилия при рассуждении, температура 1,0, top-p 1,0.
Kimi K395.0%
Claude Fable 594.2%
Claude Opus 4.893.1%
MCPMark-ПровереноИспользование инструментов94.5%Максимальные усилия при рассуждении, температура 1,0, top-p 1,0.
Kimi K394.5%
GPT-5.6 Sol92.9%
GPT-5.592.9%
Claude Fable 587.4%
AutomationBenchАвтоматизация рабочих процессов30.8%Общедоступный поднабор из 600 заданий с официальной настройкой бенчмарка.
Kimi K330.8%
GPT-5.6 Sol29.7%
Claude Fable 529.1%
Claude Opus 4.827.2%
SpreadsheetBench 2Работа с электронными таблицами34.8%Claude Code для Kimi и Claude; Codex для моделей GPT.
Kimi K334.8%
Claude Fable 534.7%
GPT-5.6 Sol32.4%
Claude Opus 4.831.6%
OmniDocBenchПонимание документов91.1%Максимальные усилия при рассуждении; среднее значение по трём мультимодальным прогонкам.
Kimi K391.1%
Claude Fable 589.8%
GPT-5.589.4%
Claude Opus 4.887.9%
MMMU-ProМультимодальное рассуждение81.6% / 83.4%Без инструментов / с Python; исходный порядок ввода; среднее значение по трём прогонкам.
GPT-5.6 Sol83.0% / 84.6%
Kimi K381.6% / 83.4%
Claude Fable 581.2% / 86.5%
GPT-5.581.2% / 83.2%
CharXiv (RQ)Рассуждение по диаграммам84.8% / 91.3%Без инструментов / с Python; среднее значение по трём прогонкам.
Claude Fable 588.9% / 93.5%
Kimi K384.8% / 91.3%
GPT-5.6 Sol84.6% / 89.1%
GPT-5.584.1% / 89.0%