НОВЫЙ DeepSeek v4 Flash Создал Эти Игры... за $1!
Мы только что протестировали новую версию DeepSeek V4 Flash через наш стандартный набор испытаний для разработчиков игр, и результаты заставляют серьезно задуматься о том, как вы расходуете бюджет на API. Это модель 731, облегченная версия с 284 миллиардами общих параметров, но только 13 миллиардами активных на токен. Это соотношение важно, потому что поддерживает консистентное рассуждение без вычислительных затрат флагманов с триллионом параметров.
Мы заставили её создать 11 мини-проектов, от симулятора Хелмсовской Пади до рендеринга механических часов. Общая стоимость: меньше $1. Это покрыло 200 миллионов токенов и 868 запросов к API. Для сравнения, та же нагрузка обошлась нам примерно в $30 на GPT-5.6 Sol и $57 на Fable 5. Если вы прототипируете или используете вспомогательных агентов, эта разница в цене полностью меняет расчёты рабочего процесса.
Где он действительно проявляется
Модель справилась с задачами, которые мы обычно поручаем крупным игрокам. Она создала рабочую игру Jabberwocky с логикой прогрессии, симуляцию хищник-жертва на чашке Петри с точными графиками популяции и низкополигональный клон Minecraft с крафтом. Алгоритм поиска пути в симуляторе офисной жизни был корявым (работники проходили сквозь холодильники), но поведение при отключении света было новой функцией, которой мы не видели у других моделей.
Нас удивили её способности к планированию. Мы предложили ей организовать подагентов для сборки, и она определила объём работы, контролировала выполнение и находила ошибки в коде подагентов на полпути. Это не типичное легковесное поведение. Она также хорошо справилась с тестом на сборку китайской архитектуры, достаточно для завершения крыши — то, что даже передовые модели часто не могут завершить.
Где вам все еще нужны тяжеловесы
Не позволяйте графикам производительности вводить вас в заблуждение. Маркетинговые показатели DeepSeek выглядят лучше, чем у GLM 5.2, но помните, что GLM использует гораздо больше общих и активных параметров. Когда мы сравнивали результаты напрямую, различия проявлялись в полировке и логике.
Claude Opus 5 по-прежнему лидирует в сложных задачах. Его Helms Deep имел работающую логику подъемного моста и лучшие эффекты дождя. Симулятор механических часов показал реальную геометрию шестеренок с многослойной глубиной, тогда как V4 Flash выдал более простую вращающуюся сборку. Kimi K3 остается действующим чемпионом для Jabberwocky, с превосходным прогрессом в игре и детализацией текстур в тестах на эрозию времени.
V4 Flash также провалился на симуляторе вселенной, создавая тёмные, пикселизированные планеты, которые совсем не походили на стандартные результаты, которые мы видим от моделей с этим в их обучающих данных. Физика требушета работала, но визуальная часть была грубой по сравнению с средневековой боевой машиной Opus 5.
Как на самом деле использовать это
Относитесь к V4 Flash как к очень умному стажёру, а не к старшему архитектору. Используйте его для исследовательских задач, простых кодинговых итераций и рутинной автоматизации. Если вы запускаете систему с несколькими агентами, пусть триллион-параметровые модели справляются со сложной координацией, пока V4 Flash генерирует мелкие компоненты и пул-реквесты.
Мы запустили это через Codex на VPS, используя стандартный высокий уровень логического усилия. Не доводите логическое мышление до максимума. Легковесные модели перегружаются, если их слишком нагружать, а V4 Flash показывает лучший результат, когда вы даете ей четкие инструкции и позволяете выполнять их. Она хорошо следует указаниям, что делает её идеальной для вспомогательных ролей.
Итог: если вы запускаете проект и не можете оправдать расходы в $20–$50 за одну сессию сборки, V4 Flash обеспечивает 80% результата за сущие копейки. Просто не ждите эффекта "вау" или сложной логики флагманских моделей. Подбирайте инструмент под задачу, и ваш кошелек скажет вам спасибо.
