Лаборатория Thinking Machines

Inkling

Проходы бенчмарка версии 1.0 по общим визуальным подсказкам Mantis.

Проверенные данные о модели

Идентичность, ограничения и цены

Источник провайдера · проверено 01.09.2026 ↗
Статус
Текущая
ID модели API
Не подтверждено публично
Контекст
1M
Максимальный вывод
Не подтверждено публично
Лицензия
Не подтверждено публично
Способ доступа
Не подтверждено публично
Модальности
Не подтверждено публично
Аппаратное обеспечение
Не подтверждено публично
Цена API / 1 млн токенов
Не подтверждено публично

Визуальные тесты с одинаковым промптом

Просмотреть фактические прогонки

Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

9 прогонок

Симулятор полета на метле в Хогвартсе

Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Официальный профиль бенчмарка

Опубликованные результаты за пределами наших визуальных тестов

Thinking Machines представляет Inkling как настраиваемую мультимодальную модель с открытыми весами, а не как самую сильную модель в каждой категории. Эти строки используют текущую карточку модели с сайта при усилии 0.99 и температуре 1.0.

Источник Thinking MachinesИюль 2026Исходный отчет →
Математика

AIME 2026

97.1%
Академическое рассуждение

GPQA Diamond

87.2%
Агентное кодирование

SWE-bench Проверено

77.6%
Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
БенчмаркОбластьБаллНастройка / сравнение
AIME 2026Математика97.1%Усилие 0.99 и температура 1.0.
Claude Fable 599.9%
GPT-5.6 Sol99.9%
GLM 5.299.2%
Inkling97.1%
GPQA DiamondАкадемическое рассуждение87.2%Внешне сообщенный результат, воспроизведенный в карточке модели Inkling.
GPT-5.6 Sol94.1%
Gemini 3.1 Pro94.1%
Claude Fable 592.6%
Kimi K2.691.1%
Inkling87.2%
SWE-bench ПровереноАгентное кодирование77.6%Усилие 0.99, температура 1.0 и ограничение траектории кодирования 256K токенов.
Claude Fable 595.0%
GPT-5.6 Sol82.2%
DeepSeek V4 Pro80.6%
GLM 5.280.0%
Inkling77.6%
SWE-bench Pro PublicАгентное кодирование54.3%Усилие 0.99, температура 1.0 и ограничение траектории кодирования 256K токенов.
Claude Fable 580.0%
GPT-5.6 Sol64.6%
GLM 5.262.1%
Inkling54.3%
Terminal-Bench 2.1 Best HarnessТерминальные агенты63.8%Усилие 0.99 и температура 1.0; варианты с веб-поиском оцениваются в ноль.
GPT-5.6 Sol89.5%
Claude Fable 584.6%
GLM 5.282.7%
Inkling63.8%
MCP AtlasИспользование инструментов76.0%Текущее значение страницы модели сайта Thinking Machines.Старый README Hugging Face сообщает 74,1%; используется карточка модели с сайта.
Claude Fable 583.3%
GPT-5.6 Sol81.8%
GLM 5.277.8%
Inkling76.0%
BrowseComp с управлением контекстомАгентское исследование77.1%Запуск карточки модели с включенным управлением контекстом.
GPT-5.6 Sol90.8%
Claude Fable 588.0%
Gemini 3.1 Pro85.9%
DeepSeek V4 Pro83.4%
Inkling77.1%
IFBenchСледование инструкциям79.8%Усилие 0.99 и температура 1.0.
Nemotron 3 Ultra81.4%
Inkling79.8%
Gemini 3.1 Pro77.1%
DeepSeek V4 Pro76.5%
Global-MMLU-LiteМногоязычные знания88.7%Усилие 0.99 и температура 1.0.
Claude Fable 593.3%
Gemini 3.1 Pro92.7%
GPT-5.6 Sol91.8%
GLM 5.289.2%
Inkling88.7%
MMMU-Pro Standard 10Мультимодальное рассуждение73.5%Внешне сообщаемый результат; длинная сторона изображения изменена по протоколу карточки модели.
Claude Fable 584.2%
GPT-5.6 Sol83.0%
Gemini 3.1 Pro82.0%
Inkling73.5%
VoiceBenchАудио91.4%Усилие 0.99 и температура 1.0.
Gemini 3.1 Pro94.3%
Inkling91.4%
FORTRESS ПротиводействиеБезопасность78.0%Оценка отказа от атаки согласно карточке модели.
Claude Fable 596.0%
GPT-5.6 Sol82.4%
Inkling78.0%
Nemotron 3 Ultra77.6%