Руководство по выпуску · 31 августа 2026 года

Gemini Omni 1.1 Flash — это генератор видео, а не анализатор длинного видео

Google Gemini Omni 1.1 Flash генерирует и редактирует короткие видео. Вот точные идентификаторы API, цены, ограничения и почему эталон для инструмента длинного видео здесь не применим.

Время чтения
7 мин
Проверено
31 августа 2026
Абстрактные кадры фильма, движущиеся по синей временной шкале с маркером ограничения в десять секунд
Контекстное окно в 1 миллион токенов не превращает генератор десятисекундного видео в модель транскрипции длинного видео.
Итог

Gemini Omni 1.1 Flash — это платная, общедоступная модель генерации и редактирования видео с полезными творческими настройками и необычно прозрачным ценообразованием по разрешению. Это не модель для анализа длинного видео с контекстом в 1 миллион токенов и цепочкой инструментов, подразумеваемая ранними обзорами запуска: Google ограничивает исходное видео десятью секундами, документирует вывод только в формате видео через API Gemini и не поддерживает вызовы функций через Enterprise-подключение.

Google выпустила Gemini Omni 1.1 Flash 27 августа 2026 года как модель для генерации и редактирования разговорного видео. Идентификатор стабильного API Gemini точно равен gemini-omni-1.1-flash. Google размещает его на платном уровне и предоставляет через Interactions API в Google AI Studio.

Звучит просто. Сложной частью является название. «Gemini», «Omni» и окно контекста в 1 048 576 токенов могут создать впечатление, что продукт является общей моделью мультимодального рассуждения для обработки длинных записей, написания субтитров и вызова инструментов. Таблицы возможностей самой компании Google описывают гораздо более узкий продукт.

Проверенный путь и цена

С Страница модели API Gemini указывает код стабильной модели как gemini-omni-1.1-flash. Он принимает текст, изображения и до десяти секунд видео для редактирования или продления и возвращает видео. Выходной файл может длиться от трех до десяти секунд с частотой 24 кадра в секунду в разрешении 360p, 720p, 1080p или 4K.

С официальная страница ценообразования API Gemini, проверено 31 августа 2026 года, не включает бесплатный тариф. Стандартные платные тарифы:

МетрЦена
Ввод текста, изображения, видео или аудио$1.50 за 1М токенов
Вывод текста, включая размышления$9.00 за 1М токенов
Вывод видео$17.50 за 1М токенов
Видео 360p$0.03 за сгенерированную секунду
Видео 720p$0.10 за сгенерированную секунду
Видео 1080p$0.15 за сгенерированную секунду
Видео 4K$0.30 за сгенерированную секунду

Google утверждает, что видео в 720p потребляет 5792 выходных токена в секунду, что делает скорость токенов примерно $0,10 за сгенерированную секунду. Таким образом, 10-секундный принятый видеоклип в 720p имеет компонент видео-выхода по прайс-листу около $1 до учета входных токенов и неудачных попыток. Тарифы по разрешению взяты из таблицы цен запуска Google; скорости токенов и конверсия 720p также указаны в тексте на странице с ценами.

Два официальных пути используют разные идентификаторы

Поверхности для разработчиков Google не используют одну универсальную строку. Стабильный маршрут Gemini API использует gemini-omni-1.1-flash. Страница модели Gemini Enterprise Agent Platform списки gemini-omni-1.1-flash-preview и метки, которые проставляют этот маршрут как Preview.

Сохраняйте эти написания буквально. Не добавляйте -preview в запрос Gemini API только потому, что страница Enterprise использует его, и не удаляйте -preview из развертывания для предприятий. Страница Enterprise перечисляет глобальный регион, фиксированную квоту, лимит ввода в 131 072 токена и лимит вывода в 57 920 токенов. Эти показатели, специфичные для маршрута, не должны перезаписывать задокументированное API Gemini окно контекста на 1 048 576 токенов.

Что фактически добавляет Omni 1.1

Google публикация о запуске представляет пять практических дополнений:

  • расширять сцены десятисекундными приращениями до совокупно 40 секунд;
  • использовать до десяти секунд предыдущего контекста во время расширения;
  • интерполировать между указанными первым и последним кадрами;
  • создавать черновики в 360p перед выводом изображения в более высоком разрешении;
  • увеличивать разрешение выходного файла до 1080p или 4K и использовать короткие справочные видео.

Google утверждает, что черновики в 360p могут быть до 60% быстрее, чем в 720p, и стоить в три раза меньше. Это заявление о пропускной способности поставщика, а не независимый результат задержки. Та же разница применима к описаниям Google о повышенной согласованности, контроле и готовности к производству.

Почему предложенный бенчмарк для длинных видео был остановлен

Мы разработали фиксированный тест на основе трех примерно 30-минутных видео на английском, испанском и хинди. Каждый запуск предполагал, что модель извлечет субтитры и выполнит вызов функции, которая создает структурированную карту глав. Контрольная проверка была намеренно проведена до получения или загрузки медиа.

Маршрут не прошел эту предварительную проверку по трем независимым ограничениям:

  1. Длительность ввода: Google документирует максимум десяти секунд исходного видео для редактирования и расширения, а не 30-минутную запись.
  2. Тип вывода: страница модели Gemini API документирует вывод видео, а не вывод текста субтитров.
  3. Инструменты: таблица возможностей Enterprise явно отмечает функцию вызова как неподдерживаемую.

Показатель контекста в 1,048,576 токенов не отменяет эти ограничения, специфичные для модальности. Загрузка видео из общественного домена в любом случае создаст расходы без проверки заявленной гипотезы. Замена их на клипы длиной десять секунд тихо изменит задачу. Использование другой модели Gemini проверит другой путь. Вызов эталона не был выполнен, и нет измеренного WER, улучшения задержки или стоимости за принятую результуру, чтобы сообщить.

Полный предварительный анализ, предложенный запрос, схема инструмента и ворота приёма сохраняются под benchmarks/gemini-omni-1-1-flash/. Эталон остаётся явно не выполнен. Он может быть активирован только в том случае, если Google задокументирует маршрут, который принимает полные установки, возвращает текст субтитров и поддерживает необходимый вызов функции.

Ограничения на использование и развертывание данных

Модель доступна только по платной подписке в таблице цен API Gemini. Условия Google API Gemini заявляет, что подсказки и ответы платной услуги не используются для улучшения их продуктов, хотя ведение журналов безопасности и работы по-прежнему применяется. Право на использование региона по-прежнему регулируется списком доступных регионовGoogle. Документы маршрута Enterprise указывают global регион и поддерживают как стандартный PayGo, так и фиксированную квоту; их ценообразование отдельно от цен в списке API Gemini.

Google устанавливает лимиты API Gemini в зависимости от аккаунта и уровня: активные значения RPM, TPM и RPD необходимо считывать в AI Studio для проекта выставления счетов, который будет выполнять оценку. Для этой задачи не было одобренных учетных данных или разрешения на расходы, поэтому значение лимита для конкретного аккаунта не указано.

Для производственной оценки держите приватные материалы вне экспериментальных аккаунтов, фиксируйте, какой маршрут и проект выставления счетов обрабатывали каждый запрос, и рассматривайте созданные клипы как непринятые до проверки человеком непрерывности, соответствия запросу, аудио, безопасности и отсутствия нежелательных артефактов.

Решение о покупке

Gemini Omni 1.1 Flash стоит протестировать для генерации коротких видео, редактирования, интерполяции и итерационного расширения сцен. Черновой уровень 360p дает командам разумный способ отклонять слабые концепции до оплаты за более крупный результат.

Его не следует выбирать для многоязычной транскрипции длинных видео или извлечения глав с помощью цепочки инструментов. Это разумные рабочие нагрузки семейства Gemini, но они не поддерживаются документированным интерфейсом этой модели. Честный вердикт — несоответствие интерфейсов, а не низкая оценка качества.

Источники

Запустите это в работу

Разделите количество токенов окна контекста модели и её ограничения на входные и выходные данные по конкретной модальности.

Попробовать

Прототипируйте один кадр в 360p перед оплатой за вывод в 720p, 1080p или 4K.

Докажите, что это сработало

Записывайте точный маршрут, разрешение, сгенерированные секунды, количество повторов, принятый результат и оплаченные токены для каждого теста.

Где это может оплатить

Для рабочих процессов видео на производстве сравнивайте стоимость за принятый кадр после проверки, а не за сырую генерацию.

Держите в поле зрения

  • Используйте буквальный идентификатор модели API Gemini `gemini-omni-1.1-flash`; документы платформы Enterprise Agent указывают другой идентификатор предварительного просмотра.
  • Составляйте бюджет исходя из длительности и разрешения сгенерированного видео, а не исходя из обычной экономики текстовых моделей.
  • Не тестируйте извлечение субтитров или цепочку инструментов по этому маршруту: документированные интерфейсы не поддерживают эту нагрузку.
Изучите рабочий процесс: как выбирать модель по задаче