AI News字數 2748閱讀時長7 分鐘

OpenAI 首批 Jalapeño 基準測試聲稱延遲更低、效率高於 Nvidia

OpenAI 表示,其 Jalapeño 推理晶片在早期 InferenceX 測試中,延遲及每瓦效能均勝過 Nvidia GB200 和 GB300 系統。

OpenAI 於 2026 年 8 月 25 日發布其自訂 AI 推理晶片 Jalapeño 的首批實測效能結果。公司表示,在三個公開語言模型上,Jalapeño 的峰值每瓦吞吐量較用作比較的 Nvidia 系統高出 1.5 至 1.9 倍,而端到端延遲則低 1.7 至 3.6 倍。

這些結果令 Jalapeño 超越 OpenAI 與 Broadcom 在 6 月 24 日公布處理器時所提出的預測。當時,工程樣品已在目標頻率及功耗下運作,但 OpenAI 尚未發布詳細效能數據。新測試涵蓋 GPT‑OSS 120B、DeepSeek R1 670B 及 Kimi K2.5 1T。

Jalapeño 仍屬量產前硬件,並非客戶可購買的產品。OpenAI 計劃在完成量產認證、改善軟件堆疊及驗證更多工作負載期間,於 2026 年底前在其自有基礎設施內開始部署有限數量的系統。

一、首批 Jalapeño 基準測試顯示甚麼

OpenAI 使用 SemiAnalysis 的公開語言模型服務系統測試套件 InferenceX 測試 Jalapeño。與單一理論運算數字不同,這些測試檢視吞吐量與每名用戶所感受到的延遲之間的關係。

已發布的比較採用名義工作負載:8,000 個輸入 token、1,000 個輸出 token,以及單 token 預測。OpenAI 依據各加速器公布的封裝功耗額定值標準化效能:Jalapeño 為 700 瓦、Nvidia GB200 為 1,200 瓦、GB300 為 1,400 瓦。OpenAI 表示,Jalapeño 在測試工作負載期間量得的持續功耗維持在 550 瓦或以下。

在 GPT‑OSS 120B 上,Jalapeño 與 GB200 比較。OpenAI 報告指,其峰值吞吐量約為每千瓦每秒 85,448 個混合 token,而 Nvidia 系統為 44,960 個,相當於高出 1.9 倍。端到端延遲為 1.03 秒,而非 1.80 秒;生成 token 之間的最短時間則為 0.69 毫秒,對比 1.87 毫秒。

DeepSeek R1 670B 的比較使用 GB300。Jalapeño 在峰值吞吐量下每千瓦每秒產生 19,641 個混合 token,對比 11,781 個,約為 1.7 倍。其報告的端到端延遲為 1.65 秒,對比 5.99 秒;token 之間的最短時間為 1.43 毫秒,而非 5.90 毫秒。

至於同樣以 GB300 作比較的 Kimi K2.5 1T,Jalapeño 達到每千瓦每秒 18,195 個混合 token,對比 11,862 個。端到端延遲為 1.56 秒,而非 5.31 秒;token 之間的最短時間則由 5.48 毫秒降至 1.44 毫秒。

OpenAI 亦展示了在每個系統均受限於上一代競爭者最佳 token 間隔時間點時的大幅吞吐量增益。這些數字在 GPT‑OSS 達 53.7 倍、DeepSeek R1 達 104.3 倍,以及 Kimi K2.5 達 56.1 倍。這些是在特定運作點上匹配互動性的量度,並非聲稱每個 Jalapeño 工作負載都快數十倍。

在較廣泛的測試範圍內,OpenAI 概括指 Jalapeño 在高度互動工作負載上的優勢為 2.1 至 4.1 倍。該晶片在全部三個模型上均處於每千瓦吞吐量的 Pareto 前沿,意即沒有任何被比較的配置能同時提供更高吞吐量及更低延遲。

二、結果令人鼓舞,但尚非完整量產驗證

SemiAnalysis 開發了 InferenceX,並在 OpenAI 公司的實驗室內與 OpenAI 工程師一同觀察 Jalapeño 的運行。它確認接受基準測試的模型產生了與在 Nvidia 硬件上所得相若的 GSM8K 評估結果,降低了速度可能是透過暗中犧牲模型輸出而取得的風險。

不過,SemiAnalysis 強調,「all numbers are provided to us by OpenAI。」其分析師見證了運行過程,但沒有獨立執行整個 InferenceX 測試套件。他們亦尚未看過 Jalapeño 在 AgentX 上的結果;AgentX 是一個較新的基準測試,圍繞長上下文、多輪智能代理工作負載而設計。

這項分別相當重要,因為已發布的 8K 輸入、1K 輸出測試,未有完全涵蓋請求路由器、前綴快取、快取管理系統及卸載基礎設施等量產組件。在經過審慎最佳化的單輪工作負載上的效能,未必能直接轉化為處理可變提示、持續流量及多步智能代理的實時服務效能。

比較的世代亦需要放在脈絡中理解。GPT‑OSS 是與 GB200 比較,而較大的 DeepSeek 及 Kimi 模型則與 GB300 比較。SemiAnalysis 認為,Nvidia 較新的 Vera Rubin 平台是更具相關性的競爭參考,因為 Rubin 與 Jalapeño 均採用 HBM4 級記憶體技術,並且都處於軟件開發的相對早期階段。

因此,這些測試證實可運作的 Jalapeño 工程樣品能夠高效率地運行數個大型非專有模型系列。但它們尚未證實整個機群層面的可靠性、總擁有成本,或在 ChatGPT 及 API 量產流量下的效能。

三、Jalapeño 如何同時針對延遲與吞吐量

Jalapeño 是僅用於推理的加速器,並非用來訓練新基礎模型的晶片。OpenAI 與 Broadcom 一同設計它,針對語言模型服務的不同階段而打造。

在預填充期間,系統處理用戶的提示,因此運算容量是核心限制。在解碼期間,系統逐個 token 生成答案,對記憶體頻寬造成更大壓力。在處理器之間移動模型狀態亦可能增加另一項瓶頸,尤其當一個請求跨越多枚晶片時。

OpenAI 表示,Jalapeño 會在可行情況下把模型狀態——包括生成時使用的鍵值快取——保留在本地,從而減少這類移動。運算、記憶體及網絡會在一個大型互連域內協調,讓同一組加速器資源池能同時處理預填充及解碼,而非將這些階段永久分配至不同硬件。

這個設計旨在於工作負載比例改變時保持效率。以批次為導向的服務可能優先考慮總吞吐量,而互動式智能代理則可能需要快速生成 token,因為延遲會在連續工具呼叫及推理步驟中累積。

Broadcom 提供了矽晶實作、互連及網絡專業知識,包括其 Tomahawk 技術。Celestica 正在參與電路板、機架及系統整合。OpenAI 仍負責架構,以及由其 ChatGPT、Codex 及 API 工作負載所啟發的軟硬件決策。

公司尚未公布出售 Jalapeño 晶片或系統的計劃。OpenAI 硬件主管 Richard Ho 向 Axios 表示,內部需求已經過於龐大,公司無法設想向外部買家供應。開發者因此將透過 OpenAI 服務間接接觸 Jalapeño,而非作為可購買的加速器。

四、AI 同時參與晶片設計與軟件啟動

OpenAI 表示,AI 工具直接參與了 Jalapeño 的開發。由初步設計至製造流片,公司在九個月內完成晶片設計階段。SemiAnalysis 將較廣泛的時間線——由最初招聘團隊至流片——定為約 16 個月,因此兩個數字描述的是不同起點,而非必然互相矛盾的時程。

模型被用於探索實作方式、縮短設計及驗證迴圈,以及最佳化算術電路。OpenAI 亦把處理器設計為可預測的程式設計目標,圍繞本地張量、明確通訊及同步而建立,讓 AI 系統協助在硬件上安排及排程工作。

工程團隊使用配合 GPT‑Astra 的 Codex,在兩個月內令 GPT‑OSS、DeepSeek R1 及 Kimi K2.5——它們均不在 Jalapeño 原有的量產計劃內——達至高效能。對於指定的 GPT‑OSS 注意力及混合專家區塊,AI 生成的實作比人類專家編寫的既有程式碼快 1.5 至 1.8 倍。OpenAI 明確將這項結果限於該等區塊;這並非整個模型的加速幅度。

OpenAI 預計於 2026 年底前有限度部署 Jalapeño,並於 2027 年提供更廣泛的容量。第二代設計已進入後期開發,而第三代的工作亦已展開。

公司並非要取代其外部供應商。它表示,Nvidia 及其他夥伴將繼續為訓練和推理提供加速器,因為單靠 Jalapeño 無法滿足其運算需求。眼前的營運測試是,OpenAI 能否在完成量產認證後,於混合客戶流量下跨越完整機架部署時,重現實驗室中的效率增益。

常見問題

OpenAI Jalapeño 是甚麼?

Jalapeño 是 OpenAI 首款自訂 AI 加速器。它由 OpenAI 與 Broadcom 共同開發,專為語言模型推理而非模型訓練設計。

Jalapeño 比 Nvidia 的晶片快嗎?

在 OpenAI 已發布的 InferenceX 測試中,Jalapeño 的峰值每千瓦吞吐量較所比較的 GB200 及 GB300 配置高,延遲亦較低。結果來自工程樣品,尚非完整的量產基準測試。

測試了哪些模型?

OpenAI 使用名義 8,000 個輸入 token 及 1,000 個輸出 token 的工作負載,測試了 GPT‑OSS 120B、DeepSeek R1 670B 及 Kimi K2.5 1T。

開發者可以購買或租用 Jalapeño 硬件嗎?

不可以。OpenAI 表示,由於需要把可用容量留給自家基礎設施,因此沒有出售該晶片的計劃。開發者最終或可透過 OpenAI 託管的產品及 API 受惠。

Jalapeño 何時投入服務?

OpenAI 計劃於 2026 年底前開始有限度內部部署。量產認證、軟件開發及在更多模型上的測試仍在進行中。

參考來源

Share

分享這篇文章