Анализ отрасли · 22 июля 2026
Gemini 3.6 Flash приземляется с треском: вдвое быстрее, но не умнее 3.5
Gemini 3.6 Flash вдвое быстрее, чем 3.5, но не умнее. С GPT-5.6 Luna, показывающей лучшие результаты за меньшие деньги, реакция сообщества стала враждебной.

Gemini 3.6 Flash — это серьезное улучшение эффективности, замаскированное под разочаровывающий выпуск модели. Она сокращает время выполнения задач вдвое и занимает первое место по скорости выполнения, но независимые тесты показывают отсутствие повышения интеллекта по сравнению с 3.5 Flash. Для покупателей, сравнивающих чистые возможности за доллар, GPT-5.6 Luna в настоящее время делает нового трудягу Google неуклюжим.
Google представила Gemini 3.6 Flash как новый рабочий инструмент для программирования, мультимодального анализа, работы с компьютером и создания AI-агентов. Первый независимый результат тестирования не впечатлил: он не оказался умнее модели, которую заменял.
В обновленном Индексе Искусственного Анализа, Gemini 3.6 Flash при высоком уровне рассуждений набрал 50, столько же, сколько Gemini 3.5 Flash. Он занял #21 из 186 моделей в классе сравнения, на одно место позади GPT-5.6 Luna при максимальном уровне рассуждений.
Один только рейтинг не был бы фатальным. Балл в 50 все еще значительно выше среднего показателя 31 для сравнимых моделей. Проблема в сравнении стоимости. Gemini стоит $1,50 за миллион входных токенов и $7,50 за миллион выходных токенов. GPT-5.6 Luna стоит $1,00 и $6,00 при наборе 51 очка.
Google выпустила новую модель Flash, которая немного менее умная и дороже, чем конкурирующая облегчённая модель OpenAI. Сообщество увидело график и спросило, что именно было улучшено.
График запуска и лидерская таблица рассказывают разные истории
Google объявление о запуске представляет 3.6 Flash как явный шаг вперёд по поколению. Выбранные показатели показывают прирост по сравнению с 3.5 Flash в долгосрочном программировании, инженерии машинного обучения, познавательной работе и использовании компьютеров.

Эти достижения реальны в пределах представленных оценок:
- DeepSWE: 49% для Flash 3.6, по сравнению с 37% для Flash 3.5.
- MLE-Bench: 63,9%, по сравнению с 49,7%.
- GDPval-AA v2: 1421, по сравнению с 1349.
- OSWorld-Verified: 83,0%, по сравнению с 78,4%.
Но широкий комплексный индекс задает другой вопрос. Искусственный Анализ объединяет девять оценок, охватывающих агентскую работу, конечное использование, программирование, научное мышление, надежность знаний и рассуждения в долгом контексте. В этом более широком тесте улучшения были сбалансированы ровными или более слабыми результатами в других областях. GDPval-AA улучшился, в то время как Последний Экзамен Человечества снизился на три процентных пункта до 38%. Общий балл остался на уровне 50.
Это источник разногласий в день запуска. Google может честно утверждать, что 3.6 Flash лучше по нескольким важным производственным нагрузкам. Критики могут честно сказать, что он обеспечил нулевой общий прирост интеллекта по основному независимому индексу.
Как Gemini 3.6 Flash оценивается
Снимок Artificial Analysis от 22 июля показывает, что у модели раздвоение личности:
| Метрика | Gemini 3.6 Flash (высокий) | GPT-5.6 Luna (максимум) | Что это значит |
|---|---|---|---|
| Индекс интеллекта | 50, #21 | 51, #16 | У Luna небольшое преимущество в возможностях |
| Скорость генерации | 303,6 токенов/с, #1 | 189,7 токенов/с, #12 | Gemini примерно на 60% быстрее после начала генерации |
| Цена ввода | $1.50 / 1M | $1,00 / 1M | Gemini берет на 50% больше |
| Цена вывода | $7,50 / 1M | $6,00 / 1M | Gemini взимает на 25% больше |
| Окно контекста | 1 млн токенов | 1 млн токенов | Преимущества нет ни у одного |
| Токены вывода индекса | 59M | 130M | Gemini значительно менее многословен |
Следовательно, основная критика в заголовке в целом справедлива, но неполна. Luna на один пункт умнее и имеет более низкие цены за токен. Однако Gemini работает гораздо быстрее и использовал менее половины токенов вывода во время индексации. В зависимости от объема работы такая сжатость может снизить общую стоимость и время восстановления, даже если цена за токен выше.
Искусственный Анализ зафиксировал в среднем 1,3 минуты на задачу, снизившись с 2,7 минуты для Gemini 3.5 Flash. Оценочная стоимость выполнения одной эталонной задачи снизилась примерно на 18%, с $0,59 до $0,50. Скорость вывода достигла примерно 304 токенов в секунду, что является самым быстрым результатом в его классе сравнения на момент публикации.
Он не выигрывает в интеллекте, но необычно эффективен.
Реакция сообщества была мгновенной и в основном враждебной.
Наиболее распространенная критика свела запуск к одной болезненной диаграмме. Разработчик Маркос Эрнанс сравнил Gemini 3.6 Flash с GPT-5.6 Luna и написал: «Что мы делаем, Google?» Его пост представил Gemini как худшую модель при цене в 2,5 раза выше.

Еще одна вирусная реакция сосредоточилась на отсутствии прогресса: Gemini 3.6 Flash набрал те же 50 баллов, что и 3.5 Flash, несмотря на получение нового номера версии. Темы на Reddit в сообществах Gemini, Antigravity, Cursor и в общих AI-сообществах повторяли три жалобы:
- Оценка интеллекта не улучшилась. Для пользователей, ожидающих, что новая модель будет значительно умнее, сокращение времени выполнения задач вдвое воспринимается как выпуск оптимизации под поколенческим названием.
- Luna делает цены менее привлекательными. Модель OpenAI немного опережает по тому же индексу, при этом взимая меньшую плату за входные и выходные токены.
- Google все еще не выпустил Gemini 3.5 Pro в широком доступе. Некоторые пользователи восприняли еще один релиз Flash как отвлекающий маневр от более дорогой модели, которую они ожидали.
Тон варьировался от разочарованного до радостно враждебного. Одна тема на Antigravity называла модель менее умной и более дорогой, чем Luna. В обсуждении сообщества Gemini утверждали, что скорость должна быть исключительной, чтобы оправдать её позицию. Пользователи Cursor сосредоточились на оценках кодирования и более высокой цене за токен.
Это не научное исследование пользователей. Социальные платформы вознаграждают возмущение, таблицы производительности упрощают сложные компромиссы, а разница в один индексный пункт не является доказательством того, что одна модель выиграет в каждой реальной задаче. Но повторение одного и того же возражения в разных сообществах имеет значение: Google не сумел сделать предложение ценности очевидным при запуске.
Почему скорость все еще имеет значение
Сильнейший аргумент в пользу Gemini начинается с числа, которое критики обычно опускают: первое место по скорости вывода.
Разработчики, создающие агентов, платят не только за правильные окончательные ответы. Они платят временем работы, вызовами инструментов, неудачными циклами, сгенерированными токенами и задержкой, прежде чем агент сможет исправить ошибку. Модель, которая выполняет среднее тестовое задание за 1,3 минуты вместо 2,7, может быть более полезной, даже если её составной показатель интеллекта не меняется.
Google также утверждает, что 3.6 Flash использует на 17% меньше выходных токенов, чем 3.5 Flash, и требует меньше шагов рассуждений, туров и вызовов инструментов. В документации к API сказано, что модель делает меньше нежелательных изменений кода, сокращает циклы отладки, улучшает следование инструкциям и теперь поддерживает использование компьютера как встроенный инструмент. Она принимает текст, изображения, аудио и видео, имеет Контекстное окно на 1 миллион токенов, и может выдавать до 64 000 выходных токенов.
Появляются и первые положительные отзывы. Некоторые разработчики говорят, что Gemini Flash лучше подходит для быстрой фронтенд-итерации и мелких исправлений благодаря своей скорости. Другие отмечают, что быстрый модель может быстрее повторять попытки и восстанавливаться при агентном кодировании, что не отражается на одной диаграмме «интеллект против стоимости».
Google даже признает слабость, которую обычно скрывают маркетинговые бенчмарки: человеческие оценщики предпочитали более ранние модели для визуального оформления и стилизации. Официальное руководство по миграции рекомендует давать явные инструкции по дизайну при использовании 3.6 Flash для работы с UI. Это полезное предупреждение для разработчиков, рассчитывающих, что модель автоматически обеспечит вкус.
Почему запуск все еще кажется разочаровывающим
Название «3.6» подразумевает более умного преемника. Вместо этого доказательства описывают оптимизацию производства:
- Тот же широкий показатель интеллекта.
- В два раза меньше времени на выполнение задачи.
- Меньше выходных токенов.
- Более низкая стоимость выхода по сравнению с 3.5 Flash.
- Лучшие результаты по выбранным агентным и компьютерным бенчмаркам.
- Хуже значение, чем у GPT-5.6 Luna, если вашим приоритетом является максимальный индексный балл за доллар API.
Это значительное инженерное обновление. Это не очевидный скачок возможностей, которого люди привыкли ожидать от выпуска новой передовой модели.
Google усугубил проблему восприятия, выпустив 3.6 Flash, заявляя при этом, что Gemini 3.5 Pro всё ещё тестируется с партнёрами. Пользователи, которые ждали следующего крупного скачка в интеллектуальных способностях Gemini, получили вместо этого более быструю версию существующей модели. Тем временем Luna от OpenAI предлагает более прозрачное соотношение тестов и цены, а быстрые открытые или недорогие модели продолжают сокращать разрыв.
В результате получается модель, которая может работать чрезвычайно хорошо внутри производственных агентов, но выглядит плохо в двухсекундном тесте в социальных сетях: точка ниже и дальше вправо.
Кто должен использовать её
Gemini 3.6 Flash имеет смысл использовать для:
- агентов с высокой пропускной способностью, где задержка выполнения задач важнее, чем последний показатель интеллектуальных тестов;
- мультимодальных процессов, которым нужен нативный ввод изображений, аудио и видео;
- рабочие нагрузки на компьютерах, построенные вокруг стека агентов Google;
- анализ длинных документов, диаграмм и данных;
- команды, которые уже используют Gemini 3.5 Flash и хотят снизить стоимость задач и уменьшить число бесконтрольных циклов.
Сложнее рекомендовать для:
- покупателей, выбирающих исключительно по интеллекту на доллар API;
- кодировочных рабочих нагрузок, где GPT-5.6 Luna уже работает надежно;
- генерации визуального интерфейса без точных дизайнерских спецификаций;
- пользователей, ожидающих широкий новый уровень возможностей, а не операционное улучшение.
Решение о покупке
Gemini 3.6 Flash может быть одной из самых практичных моделей агентов от Google, но разочарование сообщества вполне понятно. Независимые тесты не показали прироста интеллекта по сравнению с 3.5 Flash, в то время как более дешёвая модель OpenAI набрала немного больше. Она быстро выполняет задачи, но не лидирует по широкому интеллекту или цене за токен.
Источники
- Google: Представляем Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
- Google AI для разработчиков: Подробности API Gemini 3.6 Flash и руководство по миграции
- Google DeepMind: Карточка модели Gemini 3.6 Flash
- Artificial Analysis: Результаты модели Gemini 3.6 Flash
- Artificial Analysis: Gemini 3.6 Flash сокращает время на задачу вдвое без улучшения интеллекта
- Artificial Analysis: Результаты модели GPT-5.6 Luna
- Критика Маркоса Эрнанза в день запуска на X
- Обсуждение в сообществе Gemini: «Меньше интеллекта за больше денег»
- Обсуждение бенчмарка сообщества Antigravity
Запустите это в работу
Оцените модель на основе вашей рабочей нагрузки, измеряя скорость, стоимость, частоту сбоев и усилия по проверке вместе.
Попробовать
Выполните те же 20 репрезентативных задач на вашей текущей модели и одной альтернативной, затем зафиксируйте принятые результаты и общее время проверки.
Докажите, что это сработало
Опубликуйте набор подсказок, настройки, правила отказа, затраченное время, стоимость и количество принятых результатов, чтобы сравнение можно было повторить.
Где это может оплатить
Для сервиса с поддержкой ИИ лучшая маршрутизация может улучшить производительность или маржу. Меняйте модели только тогда, когда количество выполненных задач это подтверждает.
Держите в поле зрения
- Более высокая пропускная способность может быть важнее выигрыша в бенчмарке для повторяющейся работы с большим объемом.
- Кодирование, мультимодальный анализ, использование компьютера и рабочие нагрузки агентов требуют отдельных тестов задач.
- Полезное сравнение — это стоимость и время на принятый результат, а не только цена или оценка интеллекта.