Лаборатория Thinking Machines
Inkling
Проходы бенчмарка версии 1.0 по общим визуальным подсказкам Mantis.
Проверенные данные о модели
Идентичность, ограничения и цены
- Статус
- Текущая
- ID модели API
- Не подтверждено публично
- Контекст
- 1M
- Максимальный вывод
- Не подтверждено публично
- Лицензия
- Не подтверждено публично
- Способ доступа
- Не подтверждено публично
- Модальности
- Не подтверждено публично
- Аппаратное обеспечение
- Не подтверждено публично
- Цена API / 1 млн токенов
- Не подтверждено публично
Визуальные тесты с одинаковым промптом
Просмотреть фактические прогонки
Откройте сгенерированную сцену для тестирования или сравните этот промпт с другой моделью.

Роханская крепость
Тестирование сцены осады крепости: масштаб, освещение, архитектура и кинематографическая атмосфера.

Симулятор полета на метле в Хогвартсе
Тестирование сцены полета на метле: глубина, визуальные подсказки движения, масштаб замка и фантастическое настроение.

Jabberwock
Тестирование встречи в стиле тёмного фэнтези: дизайн существ, настроение леса и постановка повествования.

Мир с низкой полигонажностью
Стилизованная островная сцена для тестирования композиции, цвета и низкополигонального миростроения.

Офисная жизнь
Офисная виньетка для тестирования логики повседневной сцены, объектов и достоверных офисных деталей.

Петри
Микроскопическая экосистема для тестирования органических форм, научной ясности и клеточных деталей.

Симулятор вселенной
Космическая система для тестирования орбитальной структуры, светящихся тел, масштаба и читаемости симуляции.

Вайс Сити
Неоновый прибрежный город для тестирования транспортных средств, архитектуры, атмосферы и плотной городской планировки.

Сборка по «Yingzao Fashi»
Сцена сборки древесины для тестирования структуры, соединений, порядка строительства и материала.
Официальный профиль бенчмарка
Опубликованные результаты за пределами наших визуальных тестов
Thinking Machines представляет Inkling как настраиваемую мультимодальную модель с открытыми весами, а не как самую сильную модель в каждой категории. Эти строки используют текущую карточку модели с сайта при усилии 0.99 и температуре 1.0.
AIME 2026
97.1%GPQA Diamond
87.2%SWE-bench Проверено
77.6%Полная официальная таблица бенчмарков12 строк с настройками источника и диаграммами коллег
| Бенчмарк | Область | Балл | Настройка / сравнение |
|---|---|---|---|
| AIME 2026 | Математика | 97.1% | Усилие 0.99 и температура 1.0. |
| GPQA Diamond | Академическое рассуждение | 87.2% | Внешне сообщенный результат, воспроизведенный в карточке модели Inkling. |
| SWE-bench Проверено | Агентное кодирование | 77.6% | Усилие 0.99, температура 1.0 и ограничение траектории кодирования 256K токенов. |
| SWE-bench Pro Public | Агентное кодирование | 54.3% | Усилие 0.99, температура 1.0 и ограничение траектории кодирования 256K токенов. |
| Terminal-Bench 2.1 Best Harness | Терминальные агенты | 63.8% | Усилие 0.99 и температура 1.0; варианты с веб-поиском оцениваются в ноль. |
| MCP Atlas | Использование инструментов | 76.0% | Текущее значение страницы модели сайта Thinking Machines.Старый README Hugging Face сообщает 74,1%; используется карточка модели с сайта. |
| BrowseComp с управлением контекстом | Агентское исследование | 77.1% | Запуск карточки модели с включенным управлением контекстом. |
| IFBench | Следование инструкциям | 79.8% | Усилие 0.99 и температура 1.0. |
| Global-MMLU-Lite | Многоязычные знания | 88.7% | Усилие 0.99 и температура 1.0. |
| MMMU-Pro Standard 10 | Мультимодальное рассуждение | 73.5% | Внешне сообщаемый результат; длинная сторона изображения изменена по протоколу карточки модели. |
| VoiceBench | Аудио | 91.4% | Усилие 0.99 и температура 1.0. |
| FORTRESS Противодействие | Безопасность | 78.0% | Оценка отказа от атаки согласно карточке модели. |