AI News字數 2088閱讀時長6 分鐘

OpenAI 重構 ChatGPT 語音技術棧,實現全雙工 GPT-Live 對話

OpenAI 全面革新 ChatGPT 的語音架構,推出可同時收聽與說話的 GPT-Live-1,實現更自然且即時回應的 AI 對話。

OpenAI 推出新一代語音模型 GPT-Live-1,允許系統同時收聽與說話,徹底突破傳統的輪流對話限制,全面革新了 ChatGPT 的對話介面。官方宣佈由 2026 年 7 月 8 日起在全球逐步推出 GPT-Live-1,以取代原有的高級語音模式(Advanced Voice Mode)。這一重大的架構轉變使 ChatGPT 能夠保持連續的音訊流,在不中斷人類對話自然節奏的情況下,融入更深層次的推理與工具調用。

其核心創新在於歷時六個月研發、完全重構的語音技術棧(voice stack),使 AI 能夠在處理輸入音訊的同時生成輸出語音,即所謂的「全雙工」(full-duplex)通訊能力。這一升級旨在讓用戶與 ChatGPT 語音的互動感覺更即時、流暢且更具人性。

一、 透過全雙工架構消除輪流對話限制

前一代的 ChatGPT 語音功能採用輪流(turn-based)對話系統,依賴「話輪檢測器」(turn detectors)來判斷用戶何時說完話,然後 AI 才會生成回應。這造成了固有的權衡問題:檢測過早容易打斷用戶,而檢測過遲則會帶來尷尬的停頓,令對話顯得不自然。

GPT-Live-1 徹底從音訊路徑中移除了話輪檢測器,轉而採用全雙工語音模型,持續處理輸入的語音並同時生成輸出的音訊。這使模型能夠每秒多次做出實時決策,判斷此時該說話、聆聽、暫停還是進行插話,從而模擬人類的對話動態。根據 OpenAI 的說法,此架構目前已能處理如「嗯哼」或「明白」等自然的對話暗示,以示正在認真聆聽。

二、 語音技術棧與任務委派的技術突破

GPT-Live 的根本性轉變涉及對 OpenAI 語音技術棧的全面重構,從用戶端裝置一直延伸至底層模型。工程師 Justin Uberti 與 Zahan Malkani 帶領了這項為期六個月的研發工作,並於 2026 年 8 月 3 日詳細介紹了技術架構。該系統的一個關鍵組件是採用 WebRTC(一種低延遲影音標準)作為其傳輸基礎。

新架構建立了一條專門用於實時語音的「快速路徑」(fast path),以確保音訊流不被中斷。關鍵在於,當對話需要更密集的處理時(例如更深層次的推理、複雜的工具調用或網頁搜尋),GPT-Live 可以將這些任務非同步委派(delegate)給在後台運行的強大前沿模型(例如 GPT-5.5)。這種並行處理確保了 AI 能夠在不中斷當前語音交流的情況下執行複雜操作,並將搜尋或推理結果無縫融合回對話之中。

這次技術重構還顯著提升了系統響應的效能。OpenAI 將語音連線的啟動時間從六次網絡往返(round trips)減少至僅需一次,進一步增強了互動的即時性。

三、 提升用戶體驗與更廣泛的功能支援

轉向全雙工、連續對話模型的做法,從根本上改變了用戶體驗。用戶不再需要遵循「說話、等待、接收答案」的模式,現在可以進行更流暢的交流,包括隨時打斷 AI、停下來思考,或在 AI 說話時同時發言,而不會中斷整個互動。這使得與 ChatGPT 的語音互動感覺自然得多,不再像使用對講機通話。

GPT-Live-1 在基準測試表現上展現出顯著進步。在研究生水平的科學推理基準測試 GPQA 中, GPT-Live-1 達到了 84.2% 的準確率,幾乎是其前身高級語音模式(45.3%)的兩倍。此外,在 BrowseComp 測試的智能體(agent-based)網頁搜尋能力中,GPT-Live-1 獲得了 75.2% 的評分,而高級語音模式僅為 0.7%,反映出它在對話過程中進行實時資料搜集的能力。

除了流暢的對話外,新架構還支援不斷擴展的多項功能。它能在連續互動的閉環中實現即時翻譯,允許用戶使用一種語言說話,並由 ChatGPT 以極低的延遲進行翻譯。該架構還支持智能體之間的協調,包括在 ChatGPT 桌面應用程式中透過語音控制電腦和協調多個智能體。

四、 推出時間與 API 存取權限

GPT-Live-1 目前已成為 ChatGPT Go、Plus 和 Pro 訂閱用戶的預設語音體驗,而輕量版本 GPT-Live-1 mini 則開放給免費級別用戶使用。這種分級提供方式表明,OpenAI 將更低的延遲和更快的響應速度視為其付費服務的核心競爭優勢。

針對開發者和企業客戶,OpenAI 已宣佈 GPT-Live 的 API 存取權限「即將推出」。有意合作者可透過 OpenAI 的官方表格進行登記,以便在開放存取時獲得通知。該公司此前已於 2026 年 7 月 6 日在 API 中推出了 GPT-Realtime-2.1 語音模型,顯示出其實時互動功能研發進展迅速。OpenAI 指出,每星期有超過 1.5 億人使用 ChatGPT 的語音和聽寫功能,這彰顯了此次架構升級的規模與影響力。

常見問題

什麼是 GPT-Live?

GPT-Live 是 OpenAI 推出的全新全雙工語音模型系列,允許 ChatGPT 同時進行收聽與說話,從而實現更自然、連貫且無中斷的對話。

GPT-Live 與以往的 ChatGPT 語音模式有何不同?

與以往需要等待用戶說完話的輪流對話系統不同,GPT-Live 採用全雙工架構,在生成輸出語音的同時處理輸入音訊,使互動更加流暢,更像人與人之間的對話。

是哪些技術變革實現了這種連續對話?

OpenAI 徹底重構了從用戶端到模型的整個語音技術棧,移除了「話輪檢測器」,並實作了能持續串流音訊的系統。同時,它還能將深層推理和工具調用委派給 GPT-5.5 等後台模型,以確保對話流程不被打斷。

誰可以使用 GPT-Live?

ChatGPT Go、Plus 和 Pro 訂閱用戶可使用 GPT-Live-1,而免費級別用戶則可使用 GPT-Live-1 mini。針對開發者和企業的 API 存取權限預計將於未來推出。

GPT-Live 有哪些實際好處?

除了更自然的互動外,GPT-Live 還支援即時翻譯、更好地處理插話與停頓,並且能夠讓 AI 在後台執行網頁搜尋或工具調用等複雜任務,而不會破壞對話的流暢度。

參考來源

* OpenAI Launches GPT-Live-1, a Full-Duplex Voice Model That Listens and Speaks Simultaneously - MLQ.ai * How we built a realtime system for responsive voice AI in six months | OpenAI * ChatGPT Live and the New Architecture of Voice AI - RisingStack blog * OpenAI rebuilt ChatGPT's voice stack so GPT-Live can listen while speaking - RuntimeWire * OpenAI Launches GPT-Live as AI Voice Takes a Major Leap | Next in AI | Astha La Vista * OpenAI Launches GPT-Live Full-Duplex Voice Models - SQ Magazine * OpenAI Posts About GPT-Live Voice Architecture - Digg * GPT-Live and ChatGPT Voice: Full-Duplex Guide - Flowith Blog * ChatGPT's New Voice Models Can 'Listen' and 'Talk' at the Same Time - CNET * OpenAI Rebuilds Voice Stack To Enable Continuous Conversation In ChatGPT - Yellow.com * OpenAI Finally Fixed the Worst Thing About AI Voice Chats: Here's How - Android Headlines * Real-Time Voice AI Just Got a Major Upgrade: OpenAI's Simultaneous Speech Models Are Here | NameOcean * OpenAI Posts About GPT-Live Voice Architecture - Digg * Introducing GPT-Live, a new generation of voice models for natural human-AI interaction. Rolling out in ChatGPT starting today. GPT-Live makes talking with AI feel like having a real conver | OpenAI - Facebook * [X Post] https://x.com/OpenAI/status/2084378415818579975

Share

分享這篇文章