AI News字数 2996阅读时长8 分钟

Google 推出 Gemini 3.5 Transcribe,支持智能听写和两种语音转文字 API

Gemini 3.5 Transcribe 增加了智能听写、85 种以上语言、实时流式处理、说话人标签、时间戳和付费 API 访问。

Google 于 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe,这是一款面向实时语音界面和录音的专用语音转文字模型。该公开预览版本支持超过 85 种语言,并新增可选的“智能”模式,可去除语气词、处理口头更正,并将非结构化语音格式化为易读文本。

开发者可通过两个独立的 Gemini API 端点使用该模型。gemini-3.5-transcribe-live 通过 Live API 处理实时音频,而 gemini-3.5-transcribe 则通过 Interactions API 处理上传的录音。Google 还已将底层转录技术部署到部分消费级产品中,包括 Gboard 中的 Rambler 和 macOS 版 Gemini 应用。

转录与更广泛的助手行为之间的区别很重要。Gemini 3.5 Transcribe 本身只生成文本;Google 的模型参考文档将函数调用、文件搜索、图像生成、代码执行和思考列为不支持的功能。当 macOS 应用使用听写指令来总结文件或生成图像时,语音被转录后,其他 Gemini 模型和产品级工具会执行这些工作。

一、两种模型服务于不同的音频工作流

实时模型通过双向 WebSocket 会话连接,并在音频仍在传入时输出增量文本。Google 将延迟描述为亚秒级,因此该端点适用于字幕、听写界面,以及需要在说话者完成较长段落前显示文本的语音应用。

实时会话接受原始 16 位 PCM 音频,Google 的实现指南规定使用 16 kHz 单声道音频,并建议每个音频块约为 100 毫秒。连续实时转录会话最长限制为 10 分钟。需要处理更长对话的应用必须在自身基础设施中管理会话切换。

非流式模型接受预先录制的音频文件,并且单次请求最多可处理一小时音频。启用词级时间戳或说话人分离时,该限制降至 30 分钟。与实时端点不同,它可以为单个词附加起止偏移量,并识别录音中的说话人。

Google 的发布公告称可为最多三名说话人标注归属。API 参考文档显示最多支持八名说话人,但将涉及三名或更多说话人的标注列为实验性功能。因此,处理大型会议的开发者应将八名说话人视为技术上限,而不是稳定标注质量的保证。

两个端点都会自动识别所支持的语言,并可在会话或句子中切换语言,无需开发者预先配置单一语言。如果已知语言,应用可提供 BCP-47 代码,以使识别结果更倾向于该语言。

自定义词汇提供了第二种引导方式。开发者可提供最多 1,000 个术语,用于姓名、缩写词、技术表达或其他不常见短语。Google 表示,术语列表不超过 100 个时结果通常最佳,这表明针对性的词汇表优于宽泛的词典。

二、智能转录改变的是输出,而不只是其呈现方式

Gemini 3.5 Transcribe 有两种输出模式。默认的 VERBATIM 模式会保留语气词、重复、起句停顿和口头自我更正。SMART 模式则尝试生成说话者原本想表达的文本。

在智能模式下,模型可以去除“um”和“uh”等表达,消除口吃,并添加标点和句首大写。它还会处理句内更正:如果说话者起初说的是星期二,随后将日期更正为星期三,转录文本中将只保留星期三。

格式化系统可以将口述内容转换为段落、项目符号列表或编号列表。它还会应用逆文本规范化,将口头数量转换为紧凑的书面形式——例如,将“twenty six million dollars”转换为“$26M”。

这种行为使智能模式适用于消息、笔记、提示词和初稿。不过,它并不等同于逐字记录。由于该模型会有意删除和改写话语中的部分内容,制作法律转录稿、研究数据、引文或合规记录的组织应使用逐字输出,并将结果与原始音频核对。

Google 还在清理后的输出与详细注释之间设定了技术限制。在录音 API 中,智能转录不能与词级时间戳或说话人分离结合使用。这些功能需要逐字模式。实时转录支持智能格式化,但不提供词级时间戳或说话人分离;它改为在话语级别输出时间戳。

三、独立测试将该模型列入最准确的托管系统之列

Google 称 Gemini 3.5 Transcribe 是其迄今最精确的语音转文字模型,并将其定位为 Chirp 3 的后继者。在多语言 FLEURS 基准测试中,Google 报告称,该模型在一组选定的主要语言和地区中,流式转录的词错误率为 5.50%,非流式处理的词错误率为 5.04%。

词错误率衡量相对于参考转录文本的替换、删除和插入,分数越低表示错误越少。这些数据针对特定基准,不应被理解为适用于每种口音、麦克风或声学环境的通用错误率。

Google 另称,Artificial Analysis 测得流式使用的平均错误率为 4.0%,非流式使用的平均错误率为 2.6%。它还报告称,与 Chirp 3 相比,生成最终转录文本所需时间减少了 70%。

Artificial Analysis 的公开非流式排行榜证实了 2.6% 的结果。截至发稿时,它将 Gemini 3.5 Transcribe 的准确性排在所列系统中的第五位,落后于结果介于 1.7% 至 2.4% 的模型。其测试结合了来自对话、议会和企业财报数据集的大约八小时音频,而非依赖单一的清晰语音语料库。

同一独立表格报告的处理速度系数约为 82.5,这意味着在该基准测试的条件下,该服务每秒处理约 82.5 秒音频。Artificial Analysis 估算其成本为每 1,000 分钟 5 美元,与 Google 估算的非流式 API 综合价格相符。

这些测量结果支持 Google 关于该模型具有竞争力的说法,但并不意味着它在所有情况下都是可用服务中最准确的。生产环境评估仍需要具有代表性的录音,尤其是在代码切换、专业词汇、说话人重叠或嘈杂信道决定转录文本是否可用的场景中。

四、录音每分钟定价约从半美分起

Google 的付费 Gemini Developer API 定价将非流式音频输入列为每百万 token 2 美元,估算为每分钟 0.003 美元。文本输出价格为每百万 token 12 美元,估算为每分钟另加 0.002 美元。因此,Google 给出的录音音频每分钟综合估算价格约为 0.005 美元。

实时转录成本更高。音频输入价格为每百万 token 3.50 美元,或约每分钟 0.005 美元,而输出文本价格为每百万 token 21 美元,估算为每分钟 0.004 美元。Google 计算出的实时转录每分钟有效综合价格约为 0.009 美元。

两种版本均提供免费的 API 层级。Google 的定价表还表示,免费层级内容可能被用于改进其产品,而付费层级内容不会根据所列条款用于该目的。处理机密录音的团队应在部署前评估适用的服务层级、区域可用性和数据治理条款。

两种转录模型均不支持批处理、弹性或优先级推理。Google Search grounding 也不可用。这是一项专用的音频转文字服务,而不是在通用 Gemini 模型中作为一种可通过提示调用能力加入的转录功能。

五、Google 正将转录嵌入听写和智能体界面

对于消费者,Gemini 3.5 Transcribe 已通过 macOS 版 Gemini 应用和 Android 上的 Rambler 在部分国家和语言中提供英语支持。Rambler 可以清理听写文本、纠正拼写错误、进行编辑,并通过语音指令改变写作风格。

在 Google Antigravity 中,转录可以使用获许可的屏幕上下文和聊天历史,以改善其对文件名、活动文档和智能体输出的处理。Google AI Studio 也在 Build 模式中提供该模型,使开发者能够在创建应用时使用听写。

Gemini macOS 应用将转录与屏幕上下文及其他 Gemini 模型结合。口头请求可触发涉及本地文件摘要、跨应用文本复用、搜索或图像生成的工作流。这些操作属于集成功能:专用转录模型将语音转换为文本,而周边应用则路由生成的命令。

Google 表示,对任意网页字段的语音输入支持即将加入 Chrome,但这并非当前可用版本的一部分。企业访问权限正通过 Gemini Enterprise Agent Platform 以公开预览方式提供,对 Gemini Enterprise for Customer Experience 的支持则另行计划。

因此,此次发布带来的变化不止于识别准确率。Google 现已在消费级听写、开发环境、企业音频处理和实时语音界面中提供统一的转录层。开发者可以选择清理后的输出或逐字输出,但也必须在实时端点的低延迟与录音端点的说话人标签和词级时间信息之间作出选择。

常见问题

Gemini 3.5 Transcribe 是否已正式全面推出?

否。Google 将开发者和企业服务列为公开预览。

该模型支持多少种语言?

它可自动检测和转录超过 85 种语言,包括在一次话语或会话中切换语言。

实时模型可以识别说话人吗?

不可以。说话人分离和词级时间戳仅适用于逐字模式下的预录音频。

智能转录会保留说话者的原话吗?

不会。它可以去除语气词、处理更正、重组文本并改变格式。需要精确措辞时,请使用逐字模式。

API 的费用是多少?

Google 估算,付费层级下非流式转录约为每分钟 0.005 美元,实时转录约为每分钟 0.009 美元。

参考来源

Share

分享这篇文章