Grok 4.6 НА САМОМ ДЕЛЕ ХОРОШ! (Реальные тесты и обзор)
Grok 4.6 наконец-то стал настоящей моделью для кодирования. Не просто сносной, а на одном уровне с Fable 5 и GPT-5.6 Sol по общему интеллекту. Это большой сдвиг по сравнению с Grok 4.5, которая была быстрой и подходящей для быстрых задач агентов, но не тем, чему можно было бы доверять при длительных сессиях кодирования. Новая версия использует ту же базовую модель, что и 4.5, но пост-тренировочные работы и поведенческие корректировки сделали её гораздо более связной для проекта с длинным горизонтом кодирования.
Настоящее доказательство пришло из нашего набора тестов на mantis.guru. Мы дали Grok 4.6 один огромный запрос: создать все 16 проектов, используя суб-агентов. Это огромный объём для одного запуска, и при этом использовалось всего около 40% недельного лимита использования. Для сравнения, выполнение того же теста на Fable 5 или GPT-5.6 Sol, вероятно, полностью исчерпало бы лимит. Соотношение стоимости к результату легко является лучшей частью этого релиза.
Момент с Хельмовой Падью
Выдающимся результатом стала Хельмова Падь. Ни одна другая модель, включая Fable 5, не передала детали факелов, дождь и освещение так хорошо. Это выглядело как настоящая осада. Только это было самым впечатляющим запуском, который мы видели. Внимание к деталям действительно было сильным.
Остальные 15 запусков
Вот в чем загвоздка. Большинство других проектов были средними, а некоторые провальными. Симуляция хищник против жертвы в чашке Петри была наоборот: жертва побеждала хищника каждый раз, даже когда мы добавляли больше хищников. Симуляция офисной жизни показывала работников, пробегающих прямо через столы, проблема с поиском пути, которую ни одна модель пока не решила. Jabberwock даже не загружался, потому что игре нужен был WebGL, и Grok 4.6 правильно указал ограничение, но все равно запуск оказался неудачным.
Некоторые другие результаты были смешанными. Целевая страница пролистывания города работала, но анимация перепрыгивала вперед вместо того, чтобы пролетать через сцену, как это делает Quen 3.8 Max. Башенная защита с низкой полигональностью имела неплохую графику, но сломанный алгоритм поиска пути и непонятные конечные цели. Симулятор механических часов был красивым, но просто показывал внутренности часов без готового изделия. Starfall Arena была играбельной, но слишком простой.
Симулятор вселенной стал приятным сюрпризом, с более точным ощущением масштаба, чем другие модели. Крыша в китайской архитектуре была неудачной: не торчало наружу, хотя эрозия возраста больше походила на плесень, чем на трещины. В Vice City были удобные переключения дня и ночи, а симулятор требушета идеально реализовал физику, но интерфейс был застряв в углу. Grok 4.6 фактически запустил свою лучшую работу на Хельмовой Глубине, а затем ушёл в остальное.
Что это значит для тебя
Если вам нужен один отличный результат, Grok 4.6 справится с этим. Если вам нужно 16 надёжных результатов из одного запроса, ожидать можно, что будет три-четыре отличных и много посредственных. Мы подозреваем, что запуск каждого теста в отдельной сессии, когда Grok 4.6 выполняет собственное кодирование вместо управления подагентами, даст гораздо лучшие результаты. Мы планируем проверить это в следующий раз.
Практическое руководство: используйте Grok 4.6 для длинных задач по кодированию, когда вы можете рассматривать и дорабатывать один проект за раз. Соотношение цены и качества сложно превзойти, и впервые Grok становится надёжным первым выбором для кодирования. Просто не ожидайте одинакового качества при обработке большого пакета заданий.
