Google 发布 Gemini Omni 1.1 Flash,支持 40 秒场景延展和 4K 升采样
Gemini Omni 1.1 Flash 新增更长的场景延展、关键帧控制、更快的 360p 草稿、视频参考和 4K 升采样。
Google 已发布 Gemini Omni 1.1 Flash,这是其多模态视频生成和编辑模型的面向生产环境更新。核心升级是场景延展:与 Google 之前的模型只能查看前面 1 秒的画面相比,该模型在生成续接内容时最多可分析此前 10 秒的素材。
开发者可每次将视频延展 10 秒,累计长度最长可达 40 秒。Google 表示,更大的参考窗口有助于模型在连续延展过程中保持角色、动作、光照、音频和叙事上下文的一致性,从而解决制作长于单个生成镜头的序列时面临的一个实际障碍。
稳定版 API 模型标识为 gemini-omni-1.1-flash。它接受文本、图像和视频输入,并生成带音频的视频。Google 的模型列表规定,输出时长为 3 至 10 秒,分辨率可选 360p、720p、1080p 或 4K,帧率为每秒 24 帧。
一、场景延展现可使用 10 秒上下文
场景延展会在现有片段的末尾生成新画面。Gemini Omni 1.1 Flash 可以延展此前在 API 交互中生成的视频,也可以延展通过 Google Files API 提供的上传视频。
对于模型生成的视频,开发者可通过 previous_interaction_id 传入此前交互的标识符。这样可保留前一次生成的状态,无需再次上传生成的视频。随后,开发者可以使用自然语言请求续接内容,包括对镜头运动、对白、音乐或场景下一部分事件的指示。
上传的片段也可以通过提示词进行延展,但 API 文档设定了更严格的条件。上传输入不得超过 10 秒,且模型只能在末尾追加画面。它无法在开头前置新的内容,也无法在片段中间插入延展内容。
对白规则也取决于工作流程。Gemini Omni 1.1 Flash 在通过多轮交互延展其自身此前输出时,可以生成额外的口语对白。目前,它无法延展其中已有说话者的上传视频并添加更多对白,不过仍可生成无声的续接内容。
在欧洲经济区、瑞士和英国,无法通过 API 编辑或延展上传的视频。模型生成视频的延展功能在可用地区仍受支持。
这些限制之所以重要,是因为 Google 所说的 40 秒指的是累计的多步骤延展,而不是一次生成 40 秒视频。每次续接仍会生成为较短的片段,前一段视频作为下一段的上下文。
二、关键帧和参考素材提供更直接的导演控制
Gemini Omni 1.1 Flash 新增首尾帧插值功能。开发者可以提供两张分别代表镜头开头和结尾的图像,然后描述所需的过渡效果。模型会将中间的动作生成为一段连续视频。
这一机制让创作者比仅使用文本提示词拥有更多控制力。起点和终点可以约束构图及主体位置,而提示词则指定镜头或场景应如何在两者之间移动。Google 将环绕运镜、变焦转场、甩镜和循环片段列为预期用途。
该模型也接受短视频参考。Google 表示,一段参考视频最多可向新场景贡献 3 秒的动作、视觉上下文或角色信息。API 文档指出,视频参考中的音频会被忽略,因此该功能应被理解为视觉和动作参考,而不是音频迁移系统。
这些控制功能是对原始 Gemini Omni 方法的扩展,而非替代。首个 Omni Flash 版本已支持对话式编辑:每次自然语言修订都可以基于上一次输出,同时尝试保留用户未要求更改的场景部分。1.1 版本为镜头边界、续接和由参考素材驱动的动作增加了更明确的约束。
有状态编辑仍取决于是否存储交互记录。如果开发者禁用存储,生成的视频之后便无法通过其 previous_interaction_id 进行编辑。大型输出也需要采用不同处理方式:Google 建议对于超过 4 MB 的视频文件使用 URI 传递,而不是内联返回整个文件。
三、从草稿到交付的分辨率工作流程
Google 将 360p 生成为草稿模式。该公司表示,根据系统吞吐量对比,360p 预览的生成速度可比标准 720p 输出快最多 60%,成本则为三分之一。
这项性能说明具体比较的是 360p 与 720p 的生成。它并非笼统宣称每个 Omni 1.1 请求都会比之前的模型快 60%。
这一低分辨率选项适用于在选定最终片段前测试多个提示词、镜头或构图变体的工作流程。应用程序可以生成低成本预览、对其进行比较,并将更高分辨率的处理留给选中的结果。
默认 API 分辨率为 720p。开发者可以请求 1080p 或 4K 输出,但 Google 的文档将两种格式均标为升采样输出。因此,文档并未说明该模型直接生成原生 4K 帧;它生成的是升采样后的交付版本。
这一差异与制作团队评估精细细节有关。4K 文件提供了更高分辨率的交付文件,但这一标签本身并不能证明其细节保留效果与原生 4K 分辨率生成或拍摄的素材相同。
四、可用性以及从预览版到稳定 API 的转变
Google 于 2026 年 8 月 27 日发布了 gemini-omni-1.1-flash,作为该模型稳定且全面可用的版本。此前的 gemini-omni-flash-preview 标识仍列为预览版本,而 Google 的弃用页面表示,尚未公布稳定模型的停用日期。
开发者可通过 Google AI Studio 中的 Gemini API 使用 Omni 1.1。企业客户可通过 Gemini Enterprise Agent Platform 基于该模型进行构建。对于此前不愿将预览版标识整合进长期维护产品的公司而言,这一发布状态具有重要意义:稳定模型名称现已提供明确的生产目标,尽管 Google 尚未公布停用日期。
Gemini Omni 1.1 Flash 也已在全球范围内向 Google AI Plus、Pro 和 Ultra 订阅者通过 Google Flow 提供。场景延展功能面向这三个层级的订阅者在 Gemini 应用中提供。Google 的公告并未说明每项新的 API 控制是否都以相同方式在各个消费者界面中开放。
现有集成将该模型的覆盖范围扩展至 Google 自有工具之外。Google 表示,Gemini Omni Flash 已集成至 Adobe Firefly,而 Figma Weave 和 Runway 也属于使用该模型的创意平台。这些集成是公司报告的示例,而非独立的性能评估。
五、实际优势和已记录的限制
对于创意工具开发者而言,此次发布通过一个模型提供了传统视频工作流程的多个阶段:低分辨率创意构思、端点受控的镜头生成、对话式修订、场景续接和高分辨率交付。因此,API 可以支持迭代式界面,让用户从此前生成结果分支,而不是通过新的提示词重新开始制作每一个镜头。
10 秒的延展上下文可能减少明显的不连续性,但并不能保证完全消除。Google 的模型卡指出,跨编辑的完整一致性、包含复杂动作的场景以及完全准确的文本仍然具有挑战性。因此,对连续性改善的主张应被视为相对于此前 1 秒上下文窗口的改进,而不是对每个序列都能获得无缝结果的承诺。
该 API 也不支持语音编辑或上传音频参考。它限制编辑包含某些可识别人物的图像,并且对于包含未成年人的图像,在欧洲经济区、瑞士和英国还适用额外限制。
对于在 Gemini 应用、Google Flow 或 YouTube 内生成或编辑的内容,Google 表示会应用不可感知的 SynthID 水印和 C2PA 内容凭证。Google 已发布的声明具体点名了这些产品,不应将其解读为确认通过 Gemini API 直接返回的每一段视频都会获得相同的来源标记处理。
常见问题
API 模型名称是什么?
稳定模型标识为 gemini-omni-1.1-flash。Google 还将 gemini-omni-flash-preview 列为预览版本。
Gemini Omni 1.1 Flash 能否在一次请求中生成 40 秒视频?
Google 描述的是每次 10 秒、累计最长 40 秒的延展。标准输出片段仍为 3 至 10 秒。
该模型会生成原生 4K 视频吗?
Google 的 API 文档将 1080p 和 4K 描述为升采样输出。默认生成分辨率为 720p。
它能延展任何上传视频吗?
不能。上传视频必须为 10 秒或更短,延展仅限于片段末尾,并且还适用地区和对白限制。
Gemini Omni 1.1 Flash 在哪里可用?
它可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用。Google AI Plus、Pro 和 Ultra 订阅者也可通过 Google Flow 使用它,Gemini 应用中则提供场景延展功能。
参考来源
Share