Google запускает Gemini Omni 1.1 Flash с 40-секундным расширением сцен и апскейлингом до 4K
Gemini Omni 1.1 Flash добавляет более длительное расширение сцен, управление ключевыми кадрами, более быстрые черновики в 360p, видеореференсы и апскейлинг до 4K.
Google выпустила Gemini Omni 1.1 Flash — готовое к промышленному использованию обновление своей мультимодальной модели для генерации и редактирования видео. Главное улучшение — расширение сцен: при создании продолжения модель может анализировать до 10 секунд предшествующего видеоматериала, по сравнению с одной секундой у предыдущих моделей Google.
Разработчики могут продлевать видео шагами по 10 секунд до суммарной длины 40 секунд. По словам Google, более широкое окно референса помогает модели сохранять персонажей, движение, освещение, звук и повествовательный контекст при последовательных расширениях, устраняя одно из практических препятствий для создания последовательностей длиннее одного сгенерированного кадра.
Стабильная API-модель обозначается как gemini-omni-1.1-flash. Она принимает текст, изображения и видео и создаёт видео со звуком. В перечне моделей Google указаны длительность вывода от трёх до 10 секунд, разрешения 360p, 720p, 1080p или 4K и частота 24 кадра в секунду.
1. Расширение сцен теперь использует десять секунд контекста
Расширение сцен создаёт новый видеоматериал в конце существующего клипа. Gemini Omni 1.1 Flash может расширять как видео, ранее сгенерированное в API-взаимодействии, так и загруженное видео, переданное через Files API Google.
Для сгенерированного моделью видео разработчики могут передать идентификатор предыдущего взаимодействия через previous_interaction_id. Это сохраняет состояние предыдущей генерации без необходимости повторно загружать получившееся видео. Затем разработчики могут запросить продолжение на естественном языке, включая инструкции по движению камеры, диалогам, музыке или событиям в следующей части сцены.
Загруженные клипы также можно расширять с помощью промпта, однако документация API устанавливает более строгие условия. Загруженный входной материал должен длиться не более 10 секунд, а модель может добавлять видеоматериал только в конец. Она не может добавить новую начальную часть или вставить расширение в середину клипа.
Правила для диалогов также зависят от рабочего процесса. Gemini Omni 1.1 Flash может генерировать дополнительный устный диалог при расширении собственного предыдущего результата через многоходовое взаимодействие. В настоящее время она не может расширить загруженное видео, в котором кто-то уже говорит, и добавить новый диалог, хотя бесшумное продолжение остаётся возможным.
Редактирование или расширение загруженных видео недоступно через API в Европейской экономической зоне, Швейцарии и Великобритании. Расширения видео, сгенерированных моделью, по-прежнему поддерживаются в доступных регионах.
Эти ограничения важны, поскольку указанная Google 40-секундная длительность описывает суммарное многошаговое расширение, а не одну 40-секундную генерацию. Каждое продолжение по-прежнему создаётся как более короткий сегмент, а предыдущее видео служит контекстом для следующего.
2. Ключевые кадры и референсы добавляют больше режиссёрского контроля
Gemini Omni 1.1 Flash добавляет интерполяцию между первым и последним кадром. Разработчик может предоставить два изображения, представляющие начало и конец кадра, а затем описать желаемый переход. Модель генерирует промежуточное движение как единое непрерывное видео.
Этот механизм даёт создателям больше контроля, чем один текстовый промпт. Конечные точки могут ограничивать композицию и расположение объекта, а промпт задаёт, как камера или сцена должна перемещаться между ними. Google называет среди предполагаемых сценариев орбиты камеры, переходы с зумом, резкие панорамирования и зацикленные клипы.
Модель также принимает короткие видеореференсы. По словам Google, референс может передать в новую сцену до трёх секунд движения, визуального контекста или информации о персонаже. В документации API отмечается, что звук в видеореференсе игнорируется, поэтому эту функцию следует понимать как визуальный и двигательный референс, а не как систему переноса аудио.
Эти элементы управления расширяют исходный подход Gemini Omni, а не заменяют его. Первый релиз Omni Flash уже поддерживал диалоговое редактирование: каждая правка на естественном языке могла опираться на предыдущий результат, пытаясь сохранить части сцены, которые пользователь не просил изменить. Версия 1.1 добавляет более явные ограничения для границ кадра, продолжений и движения на основе референсов.
Редактирование с сохранением состояния по-прежнему зависит от хранения взаимодействия. Если разработчик отключает хранение, получившееся видео позже нельзя редактировать через его previous_interaction_id. Для крупных результатов требуется иная обработка: Google рекомендует URI-доставку для видеофайлов размером более 4 МБ вместо возврата всего файла встроенным образом.
3. Рабочий процесс от черновика до готовой поставки по разрешению
Google позиционирует генерацию в 360p как режим для черновиков. Компания утверждает, что превью в 360p могут генерироваться до 60% быстрее стандартного вывода в 720p, на основе сравнительной пропускной способности системы, и стоят втрое дешевле.
Это заявление о производительности относится именно к сравнению генерации в 360p и 720p. Оно не является общим утверждением, что каждый запрос Omni 1.1 будет выполняться на 60% быстрее предыдущей модели.
Этот вариант с более низким разрешением предназначен для рабочих процессов, в которых перед выбором финального клипа тестируются несколько вариантов промпта, камеры или композиции. Приложения могут создавать недорогие превью, сравнивать их и резервировать обработку в более высоком разрешении для выбранного результата.
Разрешение API по умолчанию — 720p. Разработчики могут запросить вывод в 1080p или 4K, но документация Google определяет оба формата как масштабированный вывод. Следовательно, модель не документирована как генерирующая нативные кадры 4K напрямую; она создаёт масштабированную версию для поставки.
Это различие важно для производственных команд, оценивающих мелкие детали. Файл в 4K предоставляет итоговый материал в более высоком разрешении, но само по себе это обозначение не гарантирует такую же сохранность деталей, как у материала, изначально сгенерированного или снятого в нативном разрешении 4K.
4. Доступность и переход от превью к стабильному API
Google выпустила gemini-omni-1.1-flash как стабильную, общедоступную версию модели 27 августа 2026 года. Прежний идентификатор gemini-omni-flash-preview остаётся в перечне как превью-версия, тогда как на странице Google о прекращении поддержки указано, что для стабильной модели дата отключения не объявлена.
Разработчики могут получить доступ к Omni 1.1 через Gemini API в Google AI Studio. Корпоративные клиенты могут разрабатывать решения с ней через Gemini Enterprise Agent Platform. Этот статус релиза важен для компаний, которые не решались интегрировать превью-идентификатор в поддерживаемые продукты: стабильное имя модели теперь даёт определённую производственную цель, хотя Google не опубликовала дату прекращения её поддержки.
Gemini Omni 1.1 Flash также глобально доступна в Google Flow для подписчиков Google AI Plus, Pro и Ultra. Расширение сцен доступно подписчикам этих трёх уровней в приложении Gemini. В объявлении Google не говорится, что каждый новый элемент управления API одинаково представлен в каждом потребительском интерфейсе.
Существующие интеграции расширяют охват модели за пределы собственных инструментов Google. По словам Google, Gemini Omni Flash интегрирована в Adobe Firefly, а Figma Weave и Runway входят в число творческих платформ, использующих модель. Эти интеграции являются примерами, заявленными компаниями, а не независимыми оценками производительности.
5. Практические преимущества и документированные ограничения
Для разработчиков творческих инструментов релиз предоставляет через одну модель несколько этапов обычного видеопроцесса: создание идей в низком разрешении, генерацию кадров с управляемыми конечными точками, диалоговую доработку, продолжение сцен и поставку в высоком разрешении. Поэтому API может поддерживать итеративные интерфейсы, в которых пользователи развивают предыдущие генерации, а не начинают каждый кадр заново с нового промпта.
10-секундный контекст расширения может уменьшить заметные разрывы, но не гарантирует их полного устранения. В карточке модели Google указано, что полная согласованность между правками, сцены со сложным движением и идеально точный текст по-прежнему остаются сложными задачами. Поэтому заявления об улучшенной непрерывности следует рассматривать как относительные по сравнению с предыдущим односекундным окном контекста, а не как обещание бесшовных результатов в каждой последовательности.
API также не поддерживает редактирование голоса или загруженные аудиореференсы. Оно ограничивает редактирование изображений с некоторыми узнаваемыми людьми, а для изображений с несовершеннолетними в ЕЭЗ, Швейцарии и Великобритании действуют дополнительные ограничения.
Для контента, созданного или отредактированного в приложении Gemini, Google Flow или YouTube, Google заявляет, что применяет незаметный водяной знак SynthID и учётные данные контента C2PA. Опубликованное заявление Google прямо называет эти продукты и не должно восприниматься как подтверждение того, что каждое видео, возвращаемое напрямую через Gemini API, получает такую же обработку происхождения.
Частые вопросы
Как называется API-модель?
Идентификатор стабильной модели — gemini-omni-1.1-flash. Google также указывает gemini-omni-flash-preview как превью-версию.
Может ли Gemini Omni 1.1 Flash сгенерировать 40-секундное видео за один запрос?
Google описывает расширения шагами по 10 секунд до суммарной длины 40 секунд. Стандартные выходные клипы по-прежнему имеют длительность от трёх до 10 секунд.
Генерирует ли модель нативное видео 4K?
В документации API Google 1080p и 4K описываются как масштабированные результаты. Разрешение генерации по умолчанию — 720p.
Может ли она расширить любое загруженное видео?
Нет. Загруженные видео должны быть длительностью не более 10 секунд, расширение ограничено концом клипа, а также действуют региональные ограничения и ограничения, связанные с диалогом.
Где доступна Gemini Omni 1.1 Flash?
Она доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Подписчики Google AI Plus, Pro и Ultra также могут получить к ней доступ через Google Flow, а расширение сцен предлагается в приложении Gemini.
Источники
- Оригинальное объявление Google AI в X
- Google: Gemini Omni 1.1 Flash позволяет создавать решения с большим контролем
- Google AI for Developers: спецификации модели Gemini Omni Flash
- Google AI for Developers: генерация и редактирование видео с Gemini Omni Flash
- Google AI for Developers: примечания к выпускам Gemini API
- Google DeepMind: карточка модели Gemini Omni Flash
Share