Google 为 Gemini API 添加智能体式视频处理,令令牌用量最多减少 88%
Gemini 现在可以动态检查长视频;Google 报告称,令牌用量最多减少 88%,成本最多降低 66%,准确率最高提升 7%。
文章目录 · 11
Google 已为 Gemini API 推出智能体式视频理解功能,以由查询驱动的流程取代固定速率的视频检查,使其能够选择录制内容中需要检查的部分。Google 报告称,该模式可最多减少 88% 的令牌用量、最多降低 66% 的分析成本,并在其视频分析基准测试中将准确率最多提升 7%。
该功能于 2026 年 9 月 1 日推出,面向 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,同时支持 Interactions API 和 GenerateContent API。用户可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 对已上传文件及公开 YouTube 视频使用该功能。
Google 在一天后发布了 Gemini 3.8 Flash。截至 9 月 3 日,实时开发者文档也将该模型列为支持智能体式视频理解,尽管原始公告和 9 月 1 日的发布说明仅提及此前三款 Flash 模型。
一、Gemini 不再必须以固定速率处理每一段视频
Gemini 默认的静态视频处理模式会以每秒一帧的固定速率提取画面,并在单次传递中将生成的视频上下文输入模型。开发者可以调整采样率,但必须在模型回答问题之前作出选择。
这会给长视频带来权衡。较高的采样率会消耗更多上下文和输入令牌,而较低的速率可能漏掉采样帧之间出现的短暂动作、剪辑边界、视觉缺陷或其他事件。开发者可以自行构建预处理流程来搜索转录文本、划分视频片段,并对有希望的区间重新采样,但这些工作位于模型之外。
智能体式处理将这些决策移入 Gemini 的推理循环。模型可以根据提示词浏览时间线、请求选定的画面或音频、检查转录文本,并以不同的帧率或分辨率重新检查相关区间。它会加载自己判断为必要的证据,而非自动将整段视频的固定表示输入上下文。
这是一种内部工具使用形式,而非新的视频生成系统。Gemini 仍在回答有关所提供视频素材的问题;变化在于它在生成答案前如何收集视觉和音频证据。
Google 将亚秒级时刻检索、异常检测、重复动作计数、物体计数,以及跨数小时录制内容的搜索列为目标应用场景。当初步扫描发现包含快速运动或细微视觉变化的短区间时,动态重新采样尤其具有相关性。
二、开发者可以为每段视频选择该模式
在 Interactions API 中,开发者可将视频输入的 processing 字段设为 "agentic" 来启用该功能。等效的 GenerateContent 配置会根据 SDK 使用 mediaProcessing 或 media_processing 设置。
选择针对每段视频而非每个请求作出。因此,比较多段录制内容的应用可以在同一提示词中对一堂长讲座使用智能体式处理,同时对一项简短实验保留静态处理。
这一区别很重要,因为 Google 并未将智能体模式描述为始终更快。其文档建议,对于时延敏感、时长不足五分钟的片段,以及需要对整段录制内容保持一致逐帧覆盖的工作,应使用静态处理。由于模型在生成响应前会执行内部推理和工具往返调用,智能体式导航可能增加短片段的首个令牌生成时间。
Interactions API 会提供这一导航已经发生的证据。响应可在最终模型输出前包含 processing_call 和 processing_result 步骤。应用可以利用这些步骤展示进度轨迹,尽管它们无需对每次内部调用发送回复。GenerateContent 响应同样会为多轮推理上下文保留 MEDIA_PROCESSING 工具调用和响应部分。
在有状态交互中,视频上下文也可跨轮次保留。这使用户能够提出后续问题,而无需应用手动重建模型此前的检查过程。
现有 Gemini 视频输入限制仍然适用。Google 文档称,Gemini 2.5 及后续模型一次请求最多可接收 10 段视频。YouTube 输入必须为公开视频,而不能是私密或不公开视频;免费层级用户每天上传的 YouTube 视频总时长限制为八小时。
三、效率声明取决于视频和问题
Google 的重点指标是最大改善幅度,而非每个请求的固定降幅。该公司报告称,在其标准视频分析基准测试中,令牌消耗最多降低 88%,分析成本最多降低 66%,准确率最多提高 7%。
所声称的收益与长篇内容最为相关,包括 10 分钟教学视频、90 分钟讲座和持续数小时的录制内容。对于这些输入,针对性很强的问题可能只需要一段转录文本和少数几个视觉区间,而非整段录制内容的固定速率表示。
令牌消耗取决于查询复杂度和动态采样深度。详细的问题可能会促使 Gemini 检查更多片段,或以高于每秒一帧的速率采样选定部分。因此,开发者不能假设每个请求都能达到宣传的 88% 降幅。
Google 尚未为智能体式视频理解增加单独的功能费用。请求采用相应模型的标准 Gemini API 令牌价格。所报告的成本降低来自处理更少的令牌,而非智能体视频模式的折扣费率。
66% 的最高成本降幅也低于 88% 的最高令牌降幅。这些数字不应被合并理解为某一项保证的工作负载表现:它们是基准测试中的最大值,而一次完整请求可能包含按需加载的媒体、推理令牌和输出令牌,并按所选模型的定价计费。
Google 的数据仍为供应商自行报告。公告介绍了视频分析基准测试结果,并展示了 Gemini 3.7 Flash 在长视频理解、快速动作计数和大海捞针式检索方面的表现,但并未证明每种生产工作负载都会获得同等幅度的改善。采用该模式的团队需要使用自己的视频、提示词、时延要求和评分标准进行匹配测试。
四、即时影响在于长视频应用的设计
这一变化减少了开发者在将长视频发送给 Gemini 前构建独立转录文本搜索和关键帧选择系统的需要。应用可以提供录制内容和问题,让模型决定要检索哪些证据,并检查返回的处理步骤,以确认是否使用了智能体式导航。
它也改变了成本估算方式。静态处理使输入大小与视频时长及所选采样配置的关联更直接。智能体式处理可以使针对性查询大幅降低成本,但其令牌用量取决于模型决定加载的内容。生产系统需要按查询类别衡量使用量,而不能仅依赖视频时长。
根据更新后的开发者指南,当前支持矩阵涵盖 Gemini 3.8 Flash、3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。静态模式仍为默认设置,因此现有集成不会自动切换处理行为。
该 API 发布是部署的第一阶段。Google 表示,智能体式视频理解随后将扩展至面向消费者 Gemini 应用中的 Flash 和 Flash-Lite 模型。该公司还计划在未来数月将其用于 YouTube 的“Ask YouTube”功能,使回答能更紧密地基于视频的视觉内容。Google 未为任何一项消费者集成提供确切的推出日期。
常见问题
什么是智能体式视频理解?
它是一种 Gemini 处理模式,可根据用户的问题动态选择视频片段、画面、音频和转录文本段落,而不是以固定帧率处理整段录制内容。
哪些 Gemini 模型支持它?
Google 当前文档列出了 Gemini 3.8 Flash、Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。最初于 9 月 1 日推出时涵盖后面三款模型。
它是否总能将令牌用量减少 88%?
不会。Google 表示“up to” 88%。实际消耗取决于视频、查询复杂度,以及模型对相关片段重新采样的程度。
启用智能体式处理是否更贵?
没有单独的功能费用。适用标准 Gemini API 令牌定价,但消耗的令牌数量因请求而异。
开发者是否应将其用于短视频?
不一定。Google 建议,对于时延敏感、时长不足五分钟的视频片段,以及需要对整段视频进行统一逐帧检查的任务,应使用静态处理。
参考来源
Share