Google 推出 Gemini Omni 1.1 Flash,支援 40 秒場景延伸及 4K 升頻
Gemini Omni 1.1 Flash 加入更長的場景延伸、關鍵影格控制、更快速的 360p 草稿、影片參考及 4K 升頻功能。
Google 已發布 Gemini Omni 1.1 Flash,這是其多模態影片生成及編輯模型可投入生產環境的更新。核心升級是場景延伸:模型在生成延續片段時,最多可檢視前面 10 秒的影片素材,而 Google 先前的模型只可檢視一秒。
開發人員可每次把影片延長 10 秒,累積長度最多可達 40 秒。Google 表示,較大的參考視窗有助模型在連續延伸時保留角色、動作、光線、音訊及敘事上下文,處理製作長於單一生成鏡頭序列時其中一項實際障礙。
穩定版 API 模型的識別名稱為 gemini-omni-1.1-flash。它接受文字、圖片及影片輸入,並生成附帶音訊的影片。Google 的模型列表列明,輸出時長為 3 至 10 秒,解析度可選 360p、720p、1080p 或 4K,幀率為每秒 24 幀。
一、場景延伸現可使用 10 秒上下文
場景延伸會在現有片段的結尾生成新影片素材。Gemini Omni 1.1 Flash 可延伸在 API 互動中先前生成的影片,或透過 Google Files API 提交的上載影片。
對於模型生成的影片,開發人員可透過 previous_interaction_id 傳入較早互動的識別碼。這可保留先前生成的狀態,毋須再次上載所得影片。開發人員其後可用自然語言要求生成延續內容,包括下一部分場景中的鏡頭移動、對白、音樂或事件指示。
上載片段亦可配合提示詞延伸,但 API 文件設定了較嚴格的條件。上載輸入不得超過 10 秒,模型亦只可在結尾附加影片素材。它不能在前面加入新的開場,或在片段中段插入延伸內容。
對白規則亦取決於工作流程。Gemini Omni 1.1 Flash 可在多輪互動中延伸自己較早的輸出時,生成額外的口述對白。目前它不能延伸已有說話者的上載影片並加入更多對白,不過仍可生成無聲的延續片段。
在歐洲經濟區、瑞士及英國,無法透過 API 編輯或延伸上載影片。在可用地區,仍支援延伸由模型生成的影片。
這些限制很重要,因為 Google 所指的 40 秒,是累積、多步延伸,而非單次生成 40 秒影片。每次延續仍會以較短片段生成,之前的影片素材會作為下一段的上下文。
二、關鍵影格及參考素材提供更直接的導演控制
Gemini Omni 1.1 Flash 加入首尾影格插補功能。開發人員可提供兩張分別代表鏡頭開始及結束的圖片,然後描述所需的轉換。模型會把中間動作生成為一段連續影片。
這個機制讓創作者較單靠文字提示詞有更多控制。起點及終點可限制構圖及主體位置,而提示詞則指定鏡頭或場景應如何在兩者之間移動。Google 列舉鏡頭環繞、變焦轉換、甩鏡及循環片段為預期用途。
模型亦接受短影片參考。Google 表示,一段參考素材可為新場景提供最多 3 秒的動作、視覺上下文或角色資訊。API 文件指出,影片參考中的音訊會被忽略,因此這項功能應理解為視覺及動作參考,而非音訊轉移系統。
這些控制功能是延伸原有 Gemini Omni 的做法,而非取代它。首個 Omni Flash 版本已支援對話式編輯:每次自然語言修訂均可建基於之前的輸出,同時嘗試保留使用者未要求改動的場景部分。1.1 版本為鏡頭邊界、延續及由參考素材驅動的動作加入更明確的限制。
有狀態編輯仍取決於儲存互動。如開發人員停用儲存,所得影片其後便不能透過其 previous_interaction_id 再次編輯。大型輸出亦需要不同處理方式:Google 建議影片檔案超過 4 MB 時使用 URI 傳送,而非把整個檔案內嵌回傳。
三、由草稿到交付的解析度工作流程
Google 將 360p 生成功能定位為草稿模式。該公司表示,根據比較系統吞吐量,360p 預覽的生成速度最多可比標準 720p 輸出快 60%,成本則為三分之一。
這項效能說明特別是比較 360p 與 720p 生成。它並非泛指每個 Omni 1.1 請求都會較先前模型快 60%。
這個較低解析度選項,專為在選定最終片段前測試多個提示詞、鏡頭或構圖變體的工作流程而設。應用程式可生成成本較低的預覽、比較它們,並把較高解析度處理留給選定結果。
API 的預設解析度為 720p。開發人員可要求 1080p 或 4K 輸出,但 Google 的文件把兩種格式均列為升頻輸出。因此,文件並未說明模型會直接生成原生 4K 幀;它生成的是經升頻的交付版本。
這個分別與製作團隊評估細節表現有關。4K 檔案提供較高解析度的交付成品,但單憑這個標籤,並不能證明其細節保留程度與原生 4K 生成或拍攝的影片相同。
四、供應情況及由預覽版轉為穩定 API
Google 於 2026 年 8 月 27 日發布 gemini-omni-1.1-flash,作為模型的穩定、正式可用版本。較早的 gemini-omni-flash-preview 識別名稱仍列為預覽版本,而 Google 的棄用頁面表示,尚未公布穩定模型的停止服務日期。
開發人員可在 Google AI Studio 透過 Gemini API 使用 Omni 1.1。企業客戶可透過 Gemini Enterprise Agent Platform 以它建構產品。這個發布狀態對於原本不願把預覽識別名稱整合至長期維護產品的公司具有影響:穩定模型名稱現時提供明確的生產目標,雖然 Google 尚未公布停止支援日期。
Gemini Omni 1.1 Flash 亦已在 Google Flow 向 Google AI Plus、Pro 及 Ultra 訂閱者全球提供。這三個層級的訂閱者可在 Gemini 應用程式使用場景延伸。Google 的公告沒有表示每項新增 API 控制都會在各個消費者介面以完全相同方式提供。
現有整合令模型的覆蓋範圍擴展至 Google 自家工具以外。Google 表示 Gemini Omni Flash 已整合至 Adobe Firefly,而 Figma Weave 及 Runway 則屬於採用該模型的創意平台。這些整合是公司自行報告的例子,而非獨立效能評估。
五、實際優點及已記錄限制
對創意工具開發人員而言,這次發布透過同一模型提供傳統影片工作流程的多個階段:低解析度構思、由端點控制的鏡頭生成、對話式修訂、場景延續及高解析度交付。因此,API 可支援迭代式介面,讓使用者由較早生成結果分支,而非每個鏡頭都由新提示詞重新開始。
10 秒延伸上下文或可減少明顯的不連續情況,但不保證完全消除。Google 的模型卡表示,跨編輯內容的一致性、包含複雜動作的場景,以及完全準確的文字仍然具挑戰。因此,關於連貫性改善的說法,應視為相對於先前一秒上下文視窗的提升,而非承諾每個序列都能得到無縫結果。
API 亦不支援語音編輯或上載音訊參考。它限制編輯包含某些可辨識人士的圖片,而在歐洲經濟區、瑞士及英國,包含未成年人的圖片亦適用額外限制。
對於在 Gemini 應用程式、Google Flow 或 YouTube 內生成或編輯的內容,Google 表示會套用不可察覺的 SynthID 水印及 C2PA Content Credentials。Google 已發布的聲明特別點名這些產品,不應解讀為確認每段直接透過 Gemini API 回傳的影片均獲得相同的溯源處理。
常見問題
API 模型名稱是甚麼?
穩定模型識別名稱為 gemini-omni-1.1-flash。Google 亦把 gemini-omni-flash-preview 列為預覽版本。
Gemini Omni 1.1 Flash 可否在一次請求中生成 40 秒影片?
Google 表示可每次延伸 10 秒,累積長度最多可達 40 秒。標準輸出片段仍介乎 3 至 10 秒。
模型會生成原生 4K 影片嗎?
Google 的 API 文件把 1080p 及 4K 描述為升頻輸出。預設生成解析度為 720p。
它可延伸任何上載影片嗎?
不可以。上載影片必須為 10 秒或以下,延伸只限於片段結尾,並受地區及對白限制所規限。
Gemini Omni 1.1 Flash 在哪裡可用?
它可透過 Google AI Studio 中的 Gemini API 及 Gemini Enterprise Agent Platform 使用。Google AI Plus、Pro 及 Ultra 訂閱者亦可透過 Google Flow 使用,而 Gemini 應用程式則提供場景延伸。
參考來源
Share