Google、40秒のシーン拡張と4Kアップスケーリングを備えたGemini Omni 1.1 Flashをリリース
Gemini Omni 1.1 Flashは、より長いシーン拡張、キーフレーム制御、高速な360pドラフト、動画リファレンス、4Kアップスケーリングを追加する。
Googleは、マルチモーダル動画生成・編集モデルの本番対応アップデートであるGemini Omni 1.1 Flashをリリースした。中心的な強化点はシーン拡張であり、継続映像を生成する際に、従来のGoogleモデルでは1秒だった先行映像を最大10秒まで参照できる。
開発者は動画を10秒単位で延長でき、累積で40秒まで拡張できる。Googleによると、より大きな参照ウィンドウにより、連続する拡張全体でキャラクター、動き、照明、音声、物語上のコンテキストをモデルが維持しやすくなり、単一の生成ショットより長いシーケンスを制作する際の実務的な障壁の一つに対応するという。
安定版APIモデルの識別子はgemini-omni-1.1-flashである。テキスト、画像、動画を受け取り、音声付き動画を出力する。Googleのモデル一覧では、出力時間は3秒から10秒、解像度は360p、720p、1080p、4K、フレームレートは毎秒24フレームとされている。
一、シーン拡張で10秒のコンテキストを利用可能に
シーン拡張は、既存クリップの末尾に新たな映像を生成する機能である。Gemini Omni 1.1 Flashは、APIインタラクションで以前に生成された動画、またはGoogleのFiles API経由で提供されたアップロード動画のいずれも拡張できる。
モデル生成動画では、開発者は以前のインタラクションの識別子をprevious_interaction_idを通じて渡せる。これにより、生成結果の動画を再アップロードすることなく、前回の生成状態を維持できる。その後、カメラ移動、台詞、音楽、シーン後半で起きる出来事などの指示を含め、自然言語で継続を要求できる。
アップロードしたクリップもプロンプトで拡張できるが、APIドキュメントではより厳しい条件が定められている。アップロード入力は10秒以下でなければならず、モデルが映像を追加できるのは末尾のみである。新たな冒頭を前に追加したり、クリップの途中に拡張を挿入したりすることはできない。
台詞に関するルールもワークフローによって異なる。Gemini Omni 1.1 Flashは、マルチターンのインタラクションを通じて自身の以前の出力を拡張する場合、追加の話し言葉の台詞を生成できる。一方、すでに誰かが話しているアップロード動画を拡張して台詞を追加することは現時点ではできないが、無音の継続映像は可能である。
欧州経済領域、スイス、英国では、APIを通じたアップロード動画の編集または拡張は利用できない。モデルが生成した動画の拡張は、利用可能な地域では引き続きサポートされる。
これらの制約は重要である。なぜならGoogleの40秒という数値は、1回の40秒生成ではなく、複数ステップによる累積的な拡張を指すためだ。各継続映像は依然として短いセグメントとして生成され、前の映像が次の映像のコンテキストとして機能する。
二、キーフレームとリファレンスで演出の制御を強化
Gemini Omni 1.1 Flashは、最初と最後のフレーム間の補間を追加した。開発者はショットの開始と終了を表す2枚の画像を提供し、望む遷移を記述できる。モデルはその間の動きを一続きの動画として生成する。
この仕組みにより、クリエイターはテキストプロンプト単独よりも高い制御性を得られる。終点の画像で構図や被写体配置を制約しつつ、プロンプトでその間にカメラやシーンをどのように動かすかを指定できる。Googleは、カメラの周回、ズーム遷移、ウィップパン、ループ動画を想定用途として挙げている。
モデルは短い動画リファレンスも受け取る。Googleによると、リファレンスは新しいシーンに対し、動き、視覚的コンテキスト、キャラクター情報を最大3秒分提供できる。APIドキュメントでは、動画リファレンス内の音声は無視されるとされているため、この機能は音声転送システムではなく、視覚と動きのリファレンスとして理解すべきである。
これらの制御機能は、従来のGemini Omniアプローチを置き換えるのではなく拡張する。最初のOmni Flashリリースはすでに会話型編集をサポートしており、各自然言語による修正は、ユーザーが変更を求めていないシーン部分を維持しようとしながら、前回の出力を基に構築できた。バージョン1.1では、ショット境界、継続、リファレンス駆動の動きに対して、より明示的な制約を追加する。
ステートフルな編集は依然としてインタラクションの保存に依存する。開発者がストレージを無効にすると、生成された動画は後からprevious_interaction_idを通じて編集できない。大容量の出力では異なる取り扱いも必要であり、Googleは4 MBを超える動画ファイルについて、ファイル全体をインラインで返すのではなくURI配信を推奨している。
三、ドラフトから納品までの解像度ワークフロー
Googleは360p生成をドラフトモードとして位置付けている。同社によると、360pプレビューは比較システムスループットに基づき、標準的な720p出力と比べて最大60%高速に生成でき、コストは3分の1である。
この性能に関する説明は、360p生成と720p生成の比較に限定される。すべてのOmni 1.1リクエストが以前のモデルより60%高速に完了するという一般的な主張ではない。
この低解像度オプションは、最終クリップを選択する前に、複数のプロンプト、カメラ、構図のバリエーションを試すワークフロー向けに設計されている。アプリケーションは低コストのプレビューを生成して比較し、選ばれた結果に対してのみ高解像度処理を割り当てられる。
APIのデフォルト解像度は720pである。開発者は1080pまたは4K出力を要求できるが、Googleのドキュメントでは両形式をアップスケール出力としている。したがって、モデルがネイティブ4Kフレームを直接生成するとは文書化されておらず、アップスケールされた納品用バージョンを生成する。
この違いは、細部を評価する制作チームにとって重要である。4Kファイルは高解像度の納品物を提供するが、そのラベルだけで、ネイティブ4K解像度で生成または撮影された映像と同等のディテール保持が確立されるわけではない。
四、提供状況とプレビューから安定版APIへの移行
Googleは、gemini-omni-1.1-flashを2026年8月27日にモデルの安定版かつ一般提供版としてリリースした。従来のgemini-omni-flash-preview識別子はプレビュー版として引き続き一覧に掲載されており、Googleの廃止ページでは安定版モデルの終了日は発表されていないとしている。
開発者はGoogle AI StudioのGemini APIを通じてOmni 1.1にアクセスできる。エンタープライズ顧客はGemini Enterprise Agent Platformを通じてこれを利用して構築できる。このリリースステータスは、プレビュー識別子を継続保守する製品に統合することをためらっていた企業にとって重要である。Googleは終了日を公表していないものの、安定版モデル名は明確な本番対象を提供する。
Gemini Omni 1.1 Flashは、Google AI Plus、Pro、Ultraの契約者向けにGoogle Flowでもグローバルに利用できる。シーン拡張は、Geminiアプリでこれら3つのティアの契約者に提供される。Googleの発表では、すべての新しいAPI制御が各コンシューマー向けインターフェースで同一に公開されるとは述べていない。
既存の統合により、モデルの利用範囲はGoogle自身のツールを超えて広がる。Googleによると、Gemini Omni FlashはAdobe Fireflyに統合されており、Figma WeaveとRunwayもこのモデルを使用するクリエイティブプラットフォームに含まれる。これらの統合は、独立した性能評価ではなく、企業が報告した事例である。
五、実務上の利点と文書化された制限
クリエイティブツール開発者にとって、このリリースは従来型の動画ワークフローの複数段階を1つのモデルで提供する。すなわち、低解像度でのアイデア出し、終点を制御したショット生成、会話型の修正、シーン継続、高解像度での納品である。そのためAPIは、ユーザーが新しいプロンプトから各ショットを作り直すのではなく、以前の生成結果から分岐できる反復的なインターフェースをサポートできる。
10秒の拡張コンテキストは視覚的な不連続を減らす可能性があるが、それを完全に防ぐ保証ではない。Googleのモデルカードは、編集全体での完全な一貫性、複雑な動きを含むシーン、完全に正確なテキストは依然として困難だとしている。したがって、連続性の改善に関する主張は、あらゆるシーケンスでシームレスな結果を約束するものではなく、従来の1秒のコンテキストウィンドウと比較した相対的なものとして扱うべきである。
APIは音声編集やアップロードした音声リファレンスもサポートしない。特定の識別可能な人物を含む画像の編集を制限しており、欧州経済領域、スイス、英国では未成年者を含む画像に追加の制限が適用される。
Geminiアプリ、Google Flow、YouTube内で生成または編集されたコンテンツについて、Googleは知覚できないSynthID透かしとC2PA Content Credentialsを適用するとしている。Googleが公表した説明はこれらの製品を具体的に挙げており、Gemini APIを通じて直接返されるすべての動画が同じ来歴処理を受けることの確認として読むべきではない。
よくある質問
APIモデル名は何ですか?
安定版モデルの識別子はgemini-omni-1.1-flashです。Googleはgemini-omni-flash-previewもプレビュー版として掲載しています。
Gemini Omni 1.1 Flashは1回のリクエストで40秒の動画を生成できますか?
Googleは、10秒単位の拡張を累積で最大40秒まで行えると説明しています。標準的な出力クリップは引き続き3秒から10秒です。
このモデルはネイティブ4K動画を生成しますか?
GoogleのAPIドキュメントでは、1080pと4Kをアップスケール出力として説明しています。デフォルトの生成解像度は720pです。
あらゆるアップロード動画を拡張できますか?
いいえ。アップロード動画は10秒以下である必要があり、拡張はクリップ末尾に限られ、地域および台詞に関する制限が適用されます。
Gemini Omni 1.1 Flashはどこで利用できますか?
Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformを通じて利用できます。Google AI Plus、Pro、Ultraの契約者はGoogle Flowでもアクセスでき、Geminiアプリではシーン拡張が提供されます。
参考ソース
Share