AI News字數 2963閱讀時長8 分鐘

Google 推出 Gemini 3.5 Transcribe,提供智能聽寫及兩個語音轉文字 API

Gemini 3.5 Transcribe 新增智能聽寫、85+ 種語言、即時串流、說話者標籤、時間戳記及付費 API 存取。

Google 於 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe,這是一款專為即時語音介面及錄音而設的語音轉文字模型。這個公開預覽版本支援超過 85 種語言,並新增可選的「智能」模式,可移除贅字、處理口頭更正,以及把非結構化語音整理成易讀文字。

開發者可透過兩個獨立的 Gemini API 端點使用此模型。gemini-3.5-transcribe-live 透過 Live API 處理即時音訊,而 gemini-3.5-transcribe 則透過 Interactions API 處理上載的錄音。Google 亦已將底層轉錄技術部署至部分消費者產品,包括 Gboard 的 Rambler,以及 macOS 版 Gemini 應用程式。

轉錄與較廣泛助理行為之間的分別十分重要。Gemini 3.5 Transcribe 本身只產生文字;Google 的模型參考資料列明,並不支援函式呼叫、檔案搜尋、圖像生成、程式碼執行及思考。當 macOS 應用程式使用口述指令來摘要檔案或生成圖像時,語音經轉錄後,會由其他 Gemini 模型及產品層面的工具執行相關工作。

一、兩個模型服務不同的音訊工作流程

即時模型透過雙向 WebSocket 工作階段連接,並會在音訊仍在傳入時輸出逐步生成的文字。Google 形容延遲低於一秒,令此端點適合字幕、聽寫介面,以及需要在說話者完成一段較長內容前顯示文字的語音應用程式。

即時工作階段接受原始 16-bit PCM 音訊,Google 的實作指南指定使用 16 kHz 單聲道音訊,並建議每個區塊約為 100 毫秒。持續的即時轉錄工作階段上限為 10 分鐘。需要處理更長對話的應用程式,必須在自身基礎設施中管理工作階段切換。

非串流模型接受預先錄製的音訊檔案,單次請求最多可處理一小時。啟用詞語層級時間戳記或說話者分離時,上限會降至 30 分鐘。與即時端點不同,它可為個別詞語附加開始及結束偏移量,並識別錄音中的說話者。

Google 的發布公告稱,可為最多三名說話者標註歸屬。API 參考資料則顯示最多可支援八名說話者,但把涉及三名或以上說話者的標註列為實驗性功能。因此,處理較大型會議的開發者應把八名說話者視為技術上限,而非穩定標註質素的保證。

兩個端點均可自動識別支援的語言,並可在工作階段或句子內切換語言,毋須開發者預先設定單一語言。如已知使用的語言,應用程式可提供 BCP-47 代碼,以引導辨識偏向該語言。

自訂詞彙提供另一種引導方式。開發者可提供最多 1,000 個術語,用於名稱、縮寫、技術用語或其他不常見詞句。Google 表示,術語清單通常不超過 100 個時效果最佳,反映針對性的詞彙表較廣泛字典更可取。

二、智能轉錄改變輸出內容,而不只是呈現方式

Gemini 3.5 Transcribe 有兩種輸出模式。預設的 VERBATIM 模式會保留贅字、重複、說話起步失誤及口頭自我更正。SMART 模式則嘗試產生說話者原本想表達的文字。

在智能模式下,模型可移除如「um」及「uh」等語氣詞、消除口吃,並加入標點及句首大小寫。它亦會處理句內更正:說話者起初說星期二,之後把日期改為星期三,轉錄稿只會保留星期三。

格式化系統可把口述內容轉換成段落、項目符號清單或編號清單。它亦會套用逆文字正規化,把口述數量轉為精簡的書面形式——例如把「twenty six million dollars」轉換為「$26M」。

這種行為令智能模式適合用於訊息、筆記、提示及初稿。然而,它並不等同逐字記錄。由於模型會刻意刪除及改寫發言的部分內容,製作法律轉錄稿、研究數據、引述或合規記錄的機構,應使用逐字輸出,並按原始音訊覆核結果。

Google 亦在清理後輸出與詳細標註之間設下技術分隔。在錄音 API 中,智能轉錄不能與詞語層級時間戳記或說話者分離同時使用。這些功能需要逐字模式。即時轉錄支援智能格式化,但不提供詞語層級時間戳記或說話者分離;它改為在發言層級輸出時間戳記。

三、獨立測試把模型列為最準確的託管系統之一

Google 稱 Gemini 3.5 Transcribe 是其至今最精確的語音轉文字模型,並將其定位為 Chirp 3 的後繼版本。在多語言 FLEURS 基準測試中,Google 報告指出,該模型在一系列主要語言及地區設定下,即時轉錄的詞錯誤率為 5.50%,非串流處理則為 5.04%。

詞錯誤率衡量相對於參考轉錄稿的替換、刪除及插入錯誤,分數越低代表錯誤越少。這些數字僅適用於相關基準測試,不應被理解為適用於每種口音、咪高峰或聲學環境的通用錯誤率。

Google 另稱,Artificial Analysis 測得即時使用的平均錯誤率為 4.0%,非串流使用則為 2.6%。它亦報告,相比 Chirp 3,產生最終轉錄稿所需時間減少了 70%。

Artificial Analysis 的公開非串流排行榜確認了 2.6% 的結果。截至發布時,該榜把 Gemini 3.5 Transcribe 的準確度列為所列系統中的第五位,落後於結果介乎 1.7% 至 2.4% 的模型。其測試綜合約八小時來自對話、議會及企業業績數據集的音訊,而非依賴單一的清晰語音語料庫。

同一獨立表格報告的處理速度因子約為 82.5,即在該基準的條件下,服務每秒處理約 82.5 秒音訊。Artificial Analysis 估計成本為每 1,000 分鐘 $5,與 Google 約略的非串流 API 綜合價格相符。

這些測量結果支持 Google 所稱該模型具競爭力,但不代表它在所有情況下都是最準確的服務。正式部署前仍需以具代表性的錄音進行評估,尤其在語碼轉換、專門詞彙、重疊說話者或嘈雜音訊渠道決定轉錄稿是否可用的情況下。

四、錄音每分鐘定價約由半美仙起

Google 的付費 Gemini Developer API 定價列出,非串流音訊輸入為每百萬 tokens $2,估計每分鐘 $0.003。文字輸出為每百萬 tokens $12,估計每分鐘另加 $0.002。因此,Google 給出的綜合估算為每分鐘錄音約 $0.005。

即時轉錄成本較高。音訊輸入定價為每百萬 tokens $3.50,即每分鐘約 $0.005,而輸出的文字定價為每百萬 tokens $21,估計每分鐘 $0.004。Google 計算出的實際合併價格為每個即時分鐘約 $0.009。

兩個版本均設有免費 API 級別。Google 的定價表亦指出,免費級別內容可用於改善其產品,而按所列條款,付費級別內容不會用於該目的。處理機密錄音的團隊,應在部署前評估適用服務級別、地區供應情況及數據管治條款。

兩個轉錄模型均不支援批次、彈性或優先推論。Google Search grounding 亦不可用。這是一項專門的音訊轉文字服務,而非加入轉錄作為其中一項可透過提示使用功能的通用 Gemini 模型。

五、Google 正把轉錄嵌入聽寫及代理介面

面向消費者方面,Gemini 3.5 Transcribe 已透過 macOS 版 Gemini 應用程式及 Android 上的 Rambler 提供英文服務,後者在指定國家及語言中可用。Rambler 可清理口述文字、修正串寫錯誤、作出編輯,並透過語音指示改變寫作風格。

在 Google Antigravity 中,轉錄可使用獲准的螢幕內容及聊天記錄,以改善處理檔案名稱、目前文件及代理輸出的能力。Google AI Studio 亦在 Build 模式中提供此模型,讓開發者可一邊建立應用程式一邊口述輸入。

Gemini macOS 應用程式把轉錄與螢幕內容及其他 Gemini 模型結合。口述要求可觸發涉及本機檔案摘要、跨應用程式重用文字、搜尋或圖像生成的工作流程。這些操作屬於整合功能:專用轉錄模型把語音轉為文字,周邊應用程式則路由其後生成的指令。

Google 表示,支援在任意網頁欄位以說話輸入文字的功能即將加入 Chrome,但並非目前可用版本的一部分。企業版可透過 Gemini Enterprise Agent Platform 公開預覽使用,而 Gemini Enterprise for Customer Experience 的支援則另有計劃。

因此,這次推出改變的不只是辨識準確度。Google 現在於消費者聽寫、開發環境、企業音訊處理及即時語音介面之間提供同一轉錄層。開發者可選擇清理後或逐字輸出,但亦必須在即時端點的低延遲與錄音端點的說話者標籤及詞語層級時間資訊之間作出選擇。

常見問題

Gemini 3.5 Transcribe 是否已全面推出?

否。Google 把開發者及企業服務列為公開預覽。

該模型支援多少種語言?

它可自動偵測及轉錄超過 85 種語言,包括在同一段發言或工作階段中切換語言。

即時模型可否識別說話者?

否。說話者分離及詞語層級時間戳記只適用於逐字模式下的預先錄製音訊。

智能轉錄會否保留說話者的原字原句?

否。它可移除贅字、處理更正、重組文字及改變格式。當精確措辭重要時,請使用逐字模式。

API 的費用是多少?

Google 估計,在付費級別中,非串流轉錄約為每分鐘 $0.005,即時轉錄則為每分鐘 $0.009。

參考來源

Share

分享這篇文章