Google、Gemini APIにエージェント型動画処理を追加、トークン使用量を最大88%削減
Geminiは長時間動画を動的に検査できるようになり、Googleはトークン使用量を最大88%削減、コストを66%削減、精度を7%向上できると報告している。
目次 · 11
GoogleはGemini API向けにエージェント型動画理解をリリースした。固定レートでの動画検査を、クエリに応じて録画のどの部分を調べるか選べるプロセスに置き換えるものだ。Googleは、このモードによりトークン使用量を最大88%削減し、分析コストを最大66%削減し、動画分析ベンチマークで精度を最大7%向上できると報告している。
この機能は2026年9月1日、Interactions APIとGenerateContent APIの両方でGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite向けに提供開始された。Google AI StudioおよびGemini Enterprise Agent Platformを通じて、アップロードしたファイルと公開YouTube動画で利用できる。
Googleはその翌日にGemini 3.8 Flashをリリースした。9月3日時点で、公開中の開発者向けドキュメントには、このモデルもエージェント型動画理解をサポートすると記載されている。ただし、当初の発表と9月1日のリリースノートで挙げられているのは、先行する3つのFlashモデルのみである。
一、Geminiはすべての動画を固定レートで処理する必要がなくなった
Geminiのデフォルトの静的動画処理モードは、1秒あたり1フレームの固定レートでフレームを抽出し、生成された動画コンテキストを1回のパスでモデルに投入する。開発者はサンプリングレートを調整できるが、モデルが質問に回答する前に選択しなければならない。
これは長時間録画においてトレードオフを生む。高いサンプリングレートはより多くのコンテキストと入力トークンを消費する一方、低いレートでは、サンプリングされたフレーム間で発生する短時間の動作、編集境界、視覚的な欠陥、その他のイベントを見逃す可能性がある。開発者は、文字起こしを検索し、動画をセグメントに分割し、有望な区間を再サンプリングする独自の前処理パイプラインを構築できるが、その作業はモデルの外部にある。
エージェント型処理では、これらの判断をGeminiの推論ループ内に移す。モデルはプロンプトに応じてタイムラインを移動し、選択したフレームまたは音声を要求し、文字起こしを検査し、異なるフレームレートまたは解像度で関連区間を再訪できる。動画全体の固定表現を自動的にコンテキストへ入れるのではなく、必要だと判断した証拠を読み込む。
これは新たな動画生成システムではなく、内部的なツール使用の一形態である。Geminiは引き続き提供された映像に関する質問へ回答しており、変更点は回答を生成する前に視覚的・音声的な証拠を収集する方法にある。
Googleは、サブ秒単位の瞬間検索、異常検出、反復動作のカウント、物体カウント、複数時間にわたる録画の検索を対象アプリケーションとして挙げている。動的再サンプリングは、初期スキャンで急速な動きや微細な視覚的変化を含む短い区間が特定された場合に特に有用である。
二、開発者は動画ごとにモードを選択できる
Interactions APIでは、動画入力のprocessingフィールドを"agentic"に設定することで、この機能を有効にする。対応するGenerateContentの設定では、SDKに応じてmediaProcessingまたはmedia_processingを使用する。
選択はリクエスト単位ではなく、動画単位で行われる。そのため、複数の録画を比較するアプリケーションは、同じプロンプト内で長時間の講義にはエージェント型処理を使用しつつ、短い実験には静的処理を維持できる。
Googleはエージェント型モードを常に高速なものとして提示していないため、この違いは重要である。ドキュメントでは、5分未満のレイテンシに敏感なクリップ、および録画全体で一貫したフレームレベルのカバレッジが必要な作業には、静的処理を推奨している。エージェント型ナビゲーションでは、モデルが応答を生成する前に内部推論とツール往復を行うため、短いクリップでは最初のトークンまでの時間が長くなる可能性がある。
Interactions APIでは、このナビゲーションが発生した証拠を取得できる。応答には、最終的なモデル出力の前にprocessing_callおよびprocessing_resultステップを含められる。アプリケーションはこれらのステップを使用して進行状況のトレースを表示できるが、内部呼び出しごとに応答を送る必要はない。GenerateContentの応答も同様に、マルチターン推論コンテキストのためにMEDIA_PROCESSINGツール呼び出しと応答パートを保持する。
ステートフルなインタラクションでは、動画コンテキストをターンをまたいで保持することもできる。これにより、アプリケーションがモデルの以前の検査プロセスを手動で再構築しなくても、ユーザーはフォローアップの質問を行える。
既存のGemini動画入力制限は引き続き適用される。Googleのドキュメントによると、Gemini 2.5以降のモデルは1回のリクエストで最大10本の動画を受け取れる。YouTube入力は非公開または限定公開ではなく公開でなければならず、無料枠のユーザーは1日あたり8時間のYouTube動画アップロードに制限される。
三、効率に関する主張は動画と質問に左右される
Googleが強調する測定値は、すべてのリクエストに対する固定の削減率ではなく、最大改善値である。同社は、標準的な動画分析ベンチマークにおいて、トークン消費量を最大88%削減、分析コストを最大66%削減、精度を最大7%向上できると報告している。
主張される効果は、10分間の教育動画、90分間の講義、数時間に及ぶ録画を含む長尺コンテンツに最も関連する。こうした入力では、狭く絞った質問に対して、録画全体の固定レート表現ではなく、文字起こしの一節と少数の視覚的区間だけで十分な場合がある。
トークン消費量は、クエリの複雑さと動的サンプリングの深さに依存する。詳細な質問では、Geminiがより多くのセグメントを検査したり、選択した部分を1秒あたり1フレーム以上でサンプリングしたりする可能性がある。したがって、開発者はすべてのリクエストで宣伝されている88%の削減を達成できるとは想定できない。
Googleはエージェント型動画理解に別途の機能料金を追加していない。リクエストには、該当モデルの標準Gemini APIトークン価格が適用される。報告されているコスト削減は、割引されたエージェント型動画料金ではなく、処理するトークン数が少ないことによるものだ。
66%という最大コスト削減も、88%という最大トークン削減より小さい。これらの数値を、1つの保証されたワークロードを表すものとして組み合わせるべきではない。いずれもベンチマーク上の最大値であり、完全なリクエストには、選択したモデルの価格体系に基づいて課金される動的に読み込まれたメディア、推論、出力トークンが含まれ得る。
Googleの数値は引き続きベンダー報告である。この発表は動画分析ベンチマーク全体の結果を説明し、Gemini 3.7 Flashによる長時間動画理解、高速動作のカウント、ニードル・イン・ア・ヘイスタック検索を実演しているが、すべての本番ワークロードが同じ程度に改善することを示すものではない。このモードを採用するチームは、自らの動画、プロンプト、レイテンシ要件、評価基準を用いて対応するテストを実施する必要がある。
四、直近の影響は長時間動画アプリケーションの設計に及ぶ
この変更により、開発者が長時間動画をGeminiに送信する前に、文字起こし検索システムやキーフレーム選択システムを別途構築する必要性が減る。アプリケーションは録画と質問を提供し、どの証拠を取得するかをモデルに判断させ、返された処理ステップを検査してエージェント型ナビゲーションが使用されたことを確認できる。
コスト見積もりも変化する。静的処理では、入力サイズが動画の長さと選択したサンプリング構成により直接的に結び付く。エージェント型処理では、対象を絞ったクエリを大幅に低コスト化できる一方、トークン使用量はモデルが何を読み込むと判断するかによって変動する。本番システムでは、動画の長さだけに依存するのではなく、クエリのクラスごとに使用量を測定する必要がある。
更新された開発者ガイドによると、現行のサポートマトリクスはGemini 3.8 Flash、3.7 Flash、3.6 Flash、3.5 Flash-Liteを対象としている。静的モードは引き続きデフォルトであるため、既存の統合が自動的に処理動作を切り替えることはない。
このAPIリリースは展開の第一段階である。Googleによると、エージェント型動画理解はその後、消費者向けGeminiアプリのFlashおよびFlash-Liteモデルにも提供される。同社は今後数か月で、YouTubeの「Ask YouTube」機能にもこれを使用し、動画の視覚的コンテンツにより密接に根ざした回答を提供する計画だ。Googleは、いずれの消費者向け統合についても正確な展開日を示していない。
よくある質問
エージェント型動画理解とは何ですか?
ユーザーの質問に基づき、動画全体を固定フレームレートで処理する代わりに、動画セグメント、フレーム、音声、文字起こしの一節を動的に選択するGeminiの処理モードである。
どのGeminiモデルが対応していますか?
Googleの現行ドキュメントには、Gemini 3.8 Flash、Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteが記載されている。当初の9月1日の提供開始時には、後者の3モデルが対象だった。
トークン使用量は常に88%削減されますか?
いいえ。Googleは「最大」88%としている。実際の消費量は、動画、クエリの複雑さ、モデルが関連セグメントをどの程度広範に再サンプリングするかによって決まる。
エージェント型処理を有効にすると高額になりますか?
別途の機能料金はない。標準Gemini APIトークン価格が適用されるが、消費トークン数はリクエストごとに異なる。
開発者は短い動画にも使用すべきですか?
必ずしもそうではない。Googleは、5分未満のレイテンシに敏感なクリップと、動画全体を均一にフレームレベルで検査する必要があるタスクには静的処理を推奨している。
参考ソース
Share