OpenAI 重构 ChatGPT 语音技术栈,实现全双工 GPT-Live 对话
OpenAI 彻底重构了 ChatGPT 的语音架构,推出支持同时听说的 GPT-Live-1,从而实现更自然、响应更快速的 AI 对话。
OpenAI 推出了新一代语音模型 GPT-Live-1,通过支持同时听和说,彻底重构了 ChatGPT 的对话界面,从而有效地超越了传统的回合制交互。该公司宣布,自 2026 年 7 月 8 日起在全球范围内推出 GPT-Live-1,以取代此前的“高级语音模式”(Advanced Voice Mode)。这一重大的架构变革使 ChatGPT 能够保持连续的音频流,在不打断人类对话自然节奏的前提下,融入更深层次的推理和工具调用。
其核心创新在于历时六个月研发并完全重构的语音技术栈,它允许 AI 在处理输入音频的同时生成输出语音,即所谓的“全双工”(full-duplex)通信能力。这一改进旨在让用户与 ChatGPT Voice 的交互感觉更加即时、流畅且更像人类之间的交流。
一、利用全双工架构消除回合制交互
上一代 ChatGPT Voice 采用回合制系统运行,依赖“轮流检测器”(turn detectors)来判断用户何时结束说话,随后 AI 才会生成回复。这导致了固有折中:检测过早可能会打断用户,而检测过晚则会带来尴尬的停顿,导致对话显得不自然。
GPT-Live-1 通过将轮流检测器从音频路径中完全移除解决了这一问题,转而采用全双工语音模型,持续处理输入的语音并生成输出音频。这使得该模型能够每秒进行多次实时决策,以确定是说话、倾听、暂停甚至打断,从而模拟人类的对话动态。据 OpenAI 介绍,该架构现在可以处理诸如“嗯哼”(mhmm)或“知道了”(got it)等自然的对话信号,以表明其正在参与互动。
二、语音技术栈与任务委派的技术进步
GPT-Live 的根本性转变涉及对 OpenAI 语音技术栈的全面重构,从客户端设备一直延伸到底层模型。工程师 Justin Uberti 和 Zahan Malkani 领导了这项历时六个月的研发工作,并于 2026 年 8 月 3 日详细介绍了其技术概览。该系统的一个关键组成部分是使用 WebRTC(一种低延迟音频和视频的标准)作为其传输基础。
新架构建立了一条专用于实时语音的“快速通道”,确保音频流不间断。至关重要的一点是,当对话需要更密集的处理时——例如更深层次的推理、复杂的工具使用或网页搜索——GPT-Live 可以将这些任务异步委派给在后台运行的强大前沿模型(如 GPT-5.5)。这种并行处理确保了 AI 能够在不中断当前语音交流的情况下执行复杂操作,并将检索结果无缝融合回对话中。
此次技术重构还显著提升了系统响应性能。OpenAI 将语音会话的启动时间从六次网络往返(round trips)缩短至仅一次,进一步增强了交互的即时性。
三、增强的用户体验与更广泛的能力
向全双工、连续对话模型的转变从根本上改变了用户体验。现在,用户可以进行更流畅的交流,而不是“说话、等待、接收回答”的死板模式。用户可以随时打断 AI、停下来思考或在 AI 说话时重叠发声,而不会破坏交互。这使得与 ChatGPT 的语音交互感觉更加自然,不再像使用对讲机那样一问一答。
GPT-Live-1 在基准测试性能上表现出显著提升。在研究生水平的科学推理基准测试 GPQA 上,GPT-Live-1 达到了 84.2% 的准确率,相较其前身高级语音模式(Advanced Voice Mode)取得的 45.3% 几乎翻了一番。此外,在 BrowseComp 测试的基于智能体(agent-based)的网页搜索能力中,GPT-Live-1 得分为 75.2%,而高级语音模式仅为 0.7%,这体现了它在对话期间进行实时研究的能力。
除了对话的流畅性外,新架构还支撑着不断扩展的功能。它能在连续的交互循环中实现实时翻译,允许用户使用一种语言说话,并由 ChatGPT 以极低的延迟进行翻译。该架构还支持智能体协同,包括在 ChatGPT 桌面应用程序中通过语音控制电脑和协调多个智能体。
四、可用性与 API 接入
GPT-Live-1 目前已成为 ChatGPT Go、Plus 和 Pro 订阅用户的默认语音体验,而轻量版本 GPT-Live-1 mini 则面向免费层级用户开放。这种分层可用性表明,OpenAI 将更低的延迟和更强的响应能力视为其付费产品的重要差异化卖点。
针对开发者和企业客户,OpenAI 已宣布 GPT-Live 的 API 接入“即将推出”。有意向的用户可以通过 OpenAI 的官方表单进行注册,以便在服务可用时收到通知。此前,该公司曾于 2026 年 7 月 6 日在 API 中发布了 GPT-Realtime-2.1 语音模型,这表明其实时交互能力处于活跃的开发管线中。据 OpenAI 报告,每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能,这凸显了这些架构进步的规模和影响。
常见问题
什么是 GPT-Live?
GPT-Live 是 OpenAI 推出的新一代全双工语音模型系列,允许 ChatGPT 同时进行倾听和说话,从而实现更自然、连续且无中断的对话。
GPT-Live 与之前的 ChatGPT 语音模式有何不同?
与以往等待用户说完后才做出响应的回合制系统不同,GPT-Live 采用全双工架构,在生成输出语音的同时处理输入音频,使交互更加流畅、更像人类之间的交流。
哪些技术变革实现了这种连续对话?
OpenAI 彻底重构了从客户端到模型的整个语音技术栈,移除了“轮流检测器”,并实现了一个持续流式传输音频的系统。它还将深层推理和工具调用委派给后台模型(如 GPT-5.5),从而确保对话流程不受干扰。
谁可以体验 GPT-Live?
GPT-Live-1 目前对 ChatGPT Go、Plus 和 Pro 订阅用户开放,而 GPT-Live-1 mini 则提供给免费层级用户。针对开发者和企业的 API 接入预计将在未来推出。
GPT-Live 带来哪些实际的好处?
除了更自然的交互外,GPT-Live 还实现了实时翻译、更好地处理打断与停顿,以及让 AI 能够在后台执行网页搜索或工具调用等复杂任务,而不会破坏对话流。
参考来源
* OpenAI 推出 GPT-Live-1,一款可同时听说的全双工语音模型 - MLQ.ai * 我们如何用六个月时间构建起一个高响应性语音 AI 实时系统 | OpenAI * ChatGPT Live 与语音 AI 的新架构 - RisingStack 博客 * OpenAI 重构 ChatGPT 语音技术栈,使 GPT-Live 能够边听边说 - RuntimeWire * 随着 AI 语音技术取得重大突破,OpenAI 推出 GPT-Live | Next in AI | Astha La Vista * OpenAI 推出 GPT-Live 全双工语音模型 - SQ Magazine * OpenAI 发布关于 GPT-Live 语音架构的动态 - Digg * GPT-Live 与 ChatGPT Voice:全双工指南 - Flowith 博客 * ChatGPT 的新语音模型可以同时“听”和“说” - CNET * OpenAI 重构语音技术栈以在 ChatGPT 中实现连续对话 - Yellow.com * OpenAI 终于解决了 AI 语音通话的最大痛点:方法如下 - Android Headlines * 实时语音 AI 迎来重大升级:OpenAI 的同步语音模型已面世 | NameOcean * OpenAI 发布关于 GPT-Live 语音架构的动态 - Digg * 介绍 GPT-Live,用于自然人机交互的新一代语音模型。即日起在 ChatGPT 中推出。GPT-Live 让与 AI 对话感觉就像进行真实的交谈 | OpenAI - Facebook * [X 帖子] https://x.com/OpenAI/status/2084378415818579975
Share