AI News字數 2543閱讀時長7 分鐘

Google 為 Gemini API 加入代理式影片處理,最高可減少 88% Token 用量

Gemini 現可動態檢視長影片;Google 表示可最高減少 88% Token、降低 66% 成本,並提升 7% 準確度。

文章目錄 · 11
  1. 一、Gemini 不再需要以固定速率處理每段影片
  2. 二、開發人員可為每段影片選擇模式
  3. 三、效率聲稱取決於影片及問題
  4. 四、即時影響在於長影片應用程式設計
  5. 常見問題
  6. 甚麼是代理式影片理解?
  7. 哪些 Gemini 模型支援它?
  8. 它是否一定可減少 88% Token 用量?
  9. 啟用代理式處理是否更昂貴?
  10. 開發人員應否用於短影片?
  11. 參考來源

Google 已為 Gemini API 推出代理式影片理解功能,取代固定速率的影片檢視方式,改為可按查詢導向選擇錄影中哪些部分需要檢視的流程。Google 表示,該模式在其影片分析基準測試中最高可減少 88% Token、降低最高 66% 分析成本,並提升最高 7% 準確度。

這項功能於 2026 年 9 月 1 日推出,支援 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,並適用於 Interactions API 與 GenerateContent API。用戶可透過 Google AI Studio 及 Gemini Enterprise Agent Platform,對已上載檔案及公開 YouTube 影片使用此功能。

Google 在一天後推出 Gemini 3.8 Flash。截至 9 月 3 日,現行開發人員文件亦列出該模型支援代理式影片理解,儘管原有公告及 9 月 1 日的發佈說明只提及較早推出的三個 Flash 模型。

一、Gemini 不再需要以固定速率處理每段影片

Gemini 預設的靜態影片處理模式會以每秒一個影格的固定速率擷取影格,並在單一次處理中把所得影片脈絡放入模型。開發人員可調整抽樣速率,但必須在模型回答問題前作出選擇。

這會為長錄影帶來取捨。較高抽樣速率會消耗更多脈絡及輸入 Token,而較低速率則可能遺漏抽樣影格之間出現的短暫動作、剪輯邊界、視覺瑕疵或其他事件。開發人員可自行建立預處理流程,搜尋逐字稿、把影片切分為片段,並重新抽樣有潛力的區間,但這些工作都在模型以外進行。

代理式處理把這些決定移入 Gemini 的推論迴圈。模型可因應提示在時間軸中導航、要求特定影格或音訊、檢視逐字稿,並以不同影格率或解像度重新檢視相關區間。它會載入自行判定為必要的證據,而非自動把整段影片的固定表示形式放入脈絡。

這是一種內部工具使用形式,而不是新的影片生成系統。Gemini 仍然是在回答有關所提供片段的問題;改變的是它在作答前如何蒐集視覺及音訊證據。

Google 指出,次秒級時刻擷取、異常偵測、重複動作計數、物件計數,以及在長達數小時的錄影中搜尋,都是目標應用。當初步掃描找出含有快速移動或細微視覺變化的短暫區間時,動態重新抽樣尤其相關。

二、開發人員可為每段影片選擇模式

在 Interactions API 中,開發人員可把影片輸入的 processing 欄位設為 "agentic",以啟用此功能。相應的 GenerateContent 設定會視乎 SDK 而使用 mediaProcessingmedia_processing

選擇是按每段影片作出,而不是按每個請求作出。因此,一個比較多段錄影的應用程式可在同一提示中,為一堂長講課使用代理式處理,同時為一個簡短實驗保留靜態處理。

這個分別相當重要,因為 Google 並沒有把代理式模式描述為在所有情況下都更快。其文件建議,對於少於五分鐘且對延遲敏感的片段,以及需要在整段錄影中維持一致逐影格覆蓋的工作,應使用靜態處理。代理式導航可能會增加短片段的首個 Token 產生時間,因為模型會在生成回應前進行內部推理及工具來回呼叫。

Interactions API 會顯示這種導航已發生的證據。回應可在最終模型輸出前包含 processing_callprocessing_result 步驟。應用程式可利用這些步驟展示進度追蹤,但毋須為每次內部呼叫傳送回覆。GenerateContent 回應同樣會保留 MEDIA_PROCESSING 工具呼叫及回應部分,以供多輪推理脈絡使用。

影片脈絡亦可在有狀態互動中跨回合保留。這讓用戶可提出後續問題,毋須由應用程式手動重建模型先前的檢視過程。

現有的 Gemini 影片輸入限制仍然適用。Google 文件表示,Gemini 2.5 及之後的模型每個請求最多可接收 10 段影片。YouTube 輸入必須是公開影片,不能是私人或不公開影片;免費層級用戶每天的 YouTube 影片上載限額為八小時。

三、效率聲稱取決於影片及問題

Google 的主打數據是最高改善幅度,並非每個請求都適用的固定減幅。公司表示,在其標準影片分析基準測試中,Token 用量最高可減少 88%、分析成本最高可降低 66%,而準確度最高可提升 7%。

所聲稱的增益最適用於長篇內容,包括 10 分鐘教學影片、90 分鐘講課,以及長達數小時的錄影。對於這些輸入,針對性很強的問題可能只需一段逐字稿及少量視覺區間,而毋須使用整段錄影的固定速率表示形式。

Token 用量會取決於查詢複雜度及動態抽樣的深度。詳細問題可能令 Gemini 檢視更多片段,或以每秒超過一個影格的速率抽樣特定部分。因此,開發人員不能假設每個請求都可達到所宣傳的 88% 減幅。

Google 並未為代理式影片理解另設功能收費。請求會按相關模型的標準 Gemini API Token 價格計費。所報告的成本減幅來自處理較少 Token,而不是代理式影片費率折扣。

66% 的最高成本減幅亦低於 88% 的最高 Token 減幅。這些數字不應合併理解為某個保證工作負載的結果:它們是基準測試中的最高值,而完整請求可包括動態載入的媒體、推理及輸出 Token,並按所選模型的定價收費。

Google 的數字仍屬供應商自行報告。公告描述了影片分析基準測試的結果,並展示 Gemini 3.7 Flash 在長影片理解、快速動作計數及大海撈針式擷取方面的表現,但並未證明每個生產工作負載都會有同等幅度的改善。採用此模式的團隊將需要使用自身影片、提示、延遲要求及評分準則進行配對測試。

四、即時影響在於長影片應用程式設計

這項改變減少了開發人員在把長影片傳送至 Gemini 前,建立獨立逐字稿搜尋及關鍵影格選取系統的需要。應用程式可提供錄影及問題,讓模型決定要擷取哪些證據,並檢視回傳的處理步驟,以確認已使用代理式導航。

它亦改變了成本估算方式。靜態處理令輸入大小與影片時長及所選抽樣設定有較直接的關係。代理式處理可令針對性查詢大幅降低成本,但其 Token 用量會隨模型決定載入的內容而變化。生產系統將需要按查詢類別量度使用量,而非只依賴影片長度。

根據更新後的開發人員指南,目前支援矩陣涵蓋 Gemini 3.8 Flash、3.7 Flash、3.6 Flash 及 3.5 Flash-Lite。靜態模式仍是預設值,因此現有整合不會自動轉換處理行為。

API 發佈是第一個部署階段。Google 表示,代理式影片理解其後將登陸面向消費者的 Gemini 應用程式中的 Flash 及 Flash-Lite 模型。公司亦計劃在未來數月把它用於 YouTube 的「Ask YouTube」功能,讓答案更貼近影片的視覺內容。Google 沒有為兩項消費者整合提供確切推出日期。

常見問題

甚麼是代理式影片理解?

它是一種 Gemini 處理模式,會根據用戶問題動態選取影片片段、影格、音訊及逐字稿段落,而不是以固定影格率處理整段錄影。

哪些 Gemini 模型支援它?

Google 現行文件列出 Gemini 3.8 Flash、Gemini 3.7 Flash、Gemini 3.6 Flash 及 Gemini 3.5 Flash-Lite。原本於 9 月 1 日推出時涵蓋後面三個模型。

它是否一定可減少 88% Token 用量?

不是。Google 表示為「最高」88%。實際用量取決於影片、查詢複雜度,以及模型重新抽樣相關片段的程度。

啟用代理式處理是否更昂貴?

沒有另設功能費用。標準 Gemini API Token 定價適用,但所消耗的 Token 數量會因請求而異。

開發人員應否用於短影片?

未必。Google 建議,對於少於五分鐘且對延遲敏感的片段,以及需要對整段影片進行一致逐影格檢視的工作,應使用靜態處理。

參考來源

Share

分享這篇文章