Moonshot AI
Kimi K3
Kimi K3 обладает почти возможностями S-уровня, но стоимость и лимиты квоты делают его операционным выбором уровня A.
Проверенные данные о модели
Идентичность, ограничения и цены
- Статус
- Текущая
- ID модели API
kimi-k3- Контекст
- 1.05M
- Максимальный вывод
- 131K
- Лицензия
- Не подтверждено публично
- Способ доступа
- Не подтверждено публично
- Модальности
- Не подтверждено публично
- Аппаратное обеспечение
- Не подтверждено публично
- Цена API / 1 млн токенов
- $3 за ввод · $0,3 за кэшированный ввод · $15 за вывод
Рекомендуется для этого руководства
Kimi
Используйте ту же семью Kimi, что тестировалась на этой странице. Проверьте текущий план и доступность модели перед подпиской.
Лучшее для: Настройки Claude Code и работа с учётом стоимости модели
Проверить планы KimiПартнерская ссылка. Она поддерживает Mantis без дополнительных затрат для вас.Визуальные тесты с одинаковым промптом
Просмотреть фактические прогонки
Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

Роханская крепость
Тестирование сцены осады крепости: масштаб, освещение, архитектура и кинематографическая атмосфера.

Симулятор полета на метле в Хогвартсе
Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Jabberwock
Тестирование встречи в стиле тёмного фэнтези: дизайн существ, настроение леса и постановка повествования.

Мир с низкой полигонажностью
Стилизованная островная сцена для тестирования композиции, цвета и низкополигонального миростроения.

Симулятор механических часов
Интерактивное тестирование часов: механическая читаемость, точное относительное движение и управление в 3D в реальном времени.

Офисная жизнь
Офисная виньетка для тестирования логики повседневной сцены, объектов и достоверных офисных деталей.

Петри
Микроскопическая экосистема для тестирования органических форм, научной ясности и клеточных деталей.

Симулятор вселенной
Космическая система для тестирования орбитальной структуры, светящихся тел, масштаба и читаемости симуляции.

Вайс Сити
Неоновый прибрежный город для тестирования транспортных средств, архитектуры, атмосферы и плотной городской планировки.

Сборка по «Yingzao Fashi»
Сцена сборки древесины для тестирования структуры, соединений, порядка строительства и материала.
Официальный профиль бенчмарка
Опубликованные результаты за пределами наших визуальных тестов
Moonshot сообщает, что Kimi K3 работает на максимальной когнитивной нагрузке по программированию, исследованию, использованию инструментов, работе с документами и зрению. Официальная таблица смешивает различные окружения провайдеров для некоторых задач агентов, поэтому каждая строка сохраняет свои настройки оценки.
GPQA Diamond
93.5%DeepSWE
67.5%Terminal-Bench 2.1
88.3%Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
| Бенчмарк | Область | Балл | Настройка / сравнение |
|---|---|---|---|
| GPQA Diamond | Академическое рассуждение | 93.5% | Максимальная когнитивная нагрузка, температура 1.0, top-p 0.95. |
| DeepSWE | Кодирование | 67.5% | Kimi Code harness на задачах DeepSWE v1.1.Официальный результат в рейтинге под mini-SWE-agent составляет 67.3%. |
| Terminal-Bench 2.1 | Агентное кодирование | 88.3% | Kimi Code harness; коллеги используют лучший заявленный окружение каждого провайдера. |
| SWE-Марафон | Долгосрочное программирование | 42.0% | Claude Code для Kimi и Claude; Codex для GPT-5.6 по ветке задач с калибровкой H20 от 9 июля. |
| BrowseComp | Агентское исследование | 91.2% | Сжатие контекста до 300 тысяч токенов; полный прогон с контекстом в 1 млн без управления контекстом набрал 90,4%. |
| DeepSearchQA (F1) | Глубокое исследование | 95.0% | Максимальные усилия при рассуждении, температура 1,0, top-p 1,0. |
| MCPMark-Проверено | Использование инструментов | 94.5% | Максимальные усилия при рассуждении, температура 1,0, top-p 1,0. |
| AutomationBench | Автоматизация рабочих процессов | 30.8% | Общедоступный поднабор из 600 заданий с официальной настройкой бенчмарка. |
| SpreadsheetBench 2 | Работа с электронными таблицами | 34.8% | Claude Code для Kimi и Claude; Codex для моделей GPT. |
| OmniDocBench | Понимание документов | 91.1% | Максимальные усилия при рассуждении; среднее значение по трём мультимодальным прогонкам. |
| MMMU-Pro | Мультимодальное рассуждение | 81.6% / 83.4% | Без инструментов / с Python; исходный порядок ввода; среднее значение по трём прогонкам. |
| CharXiv (RQ) | Рассуждение по диаграммам | 84.8% / 91.3% | Без инструментов / с Python; среднее значение по трём прогонкам. |

Редакционный вердикт
Где подходит эта модель
Kimi K3 хорошо справляется с долгим кодированием, использованием инструментов и визуальной итерацией. Команда исчерпала лимиты коротких и месячных планов во время регулярного использования, поэтому это размещение учитывает доступ и стоимость, а также чистую производительность.
Лучшее для
Внимание
Почему она занимает это место
Доказательства
Рейтинг редакционной модели Mantis
Основной вывод: Kimi K3 в настоящее время находится в категории А.
Редакционный список за август 2026 года ставит Kimi K3 на 4-е место.
Открытый исходный код →Kimi K3: Open Frontier Intelligence
Основной вывод: В таблице релизов Moonshot представлены результаты конкурентного программирования, агентные и визуальные показатели, включая 88,3% на Terminal-Bench 2.1 и 81,2% на FrontierSWE.
Это результаты, предоставленные поставщиками при максимальных усилиях по рассуждению, и они варьируются в зависимости от используемого агента, поэтому они демонстрируют передовые возможности K3, но не являются сопоставимым общим баллом.
Открытый исходный код →Визуальный набор бенчмарков Mantis: Kimi K3
Основной вывод: K3 выполнил все девять общих визуальных бенчмарков в наборе Mantis.
Результаты предоставляют практическую проверку качества визуальной реализации наряду с опубликованными результатами бенчмарков.
Открытый исходный код →Связанные руководства