Groq 將與 Dell 部署 NVIDIA Groq 3 LPX 及 Vera Rubin NVL72
Groq 計劃透過與 Dell 的部署合作夥伴關係,將 NVIDIA Groq 3 LPX 及 Vera Rubin NVL72 容量加入 GroqCloud。
一、Groq 承諾採用 NVIDIA 全新推論平台
Groq 計劃在 GroqCloud 部署 NVIDIA Groq 3 LPX,並與 NVIDIA Vera Rubin NVL72 一同運行,讓這家獨立推論服務供應商可透過現有雲端平台提供 NVIDIA 最新的低延遲架構。Dell Technologies 將提供部署基礎設施,並支援系統大規模推出。
該公告於 2026 年 8 月 24 日發布,同日 NVIDIA 表示 Groq 3 LPX 已進入全面量產。Groq 自稱為「最早採用者之一」,而非首家採用者:NVIDIA 指出 Nebius 是首個計劃將該平台投入生產的 AI 雲端服務商,Groq 則是另一家早期供應商。
這項分別相當重要,因為兩家公司均未表示 Groq 的 LPX 容量已可供客戶使用。Groq 未披露啟用日期、部署地區、機架數量、支援模型清單、API 配置、預留流程或 token 定價。其公告一貫以將來式描述客戶存取安排。
待該容量上線後,Groq 擬透過現時用於生產推論的基礎設施提供服務。該公司表示,GroqCloud 為超過六百萬名開發者及數千家 AI 原生公司提供服務,每星期處理數萬億個 token,並在北美、歐洲、中東及亞太地區營運數據中心。這些營運數據屬公司披露資料,並非經獨立審核的量度結果。
Dell 所述的角色,是利用其運算、網絡、整合及供應鏈能力,協助將 NVIDIA 的機架架構轉化為可部署的基礎設施。各方未有指明所涉及的 Dell 具體系統,亦未公布該安排的商業條款。
二、Groq 3 LPX 為 Vera Rubin 帶來甚麼
NVIDIA Groq 3 LPX 是一款機架級推論加速器,核心由 256 枚 Groq 3 LPU 晶片組成。它並非 Vera Rubin NVL72 的獨立替代品,而是設計為與 GPU 機架並行運作,專門處理對延遲敏感的 token 生成。
完整的 LPX 機架包括 32 個液冷式 1U 運算托盤,每個托盤配備八枚 LPU。NVIDIA 列出的每個機架規格包括 315 FP8 petaflops 推論運算能力、128 GB 合計片上 SRAM、每秒 40 petabytes 的 SRAM 頻寬,以及每秒 640 terabytes 的 scale-up 頻寬。每枚 LPU 提供 500 MB SRAM、每秒 150 TB 的 SRAM 頻寬,以及每秒 2.5 TB 的 scale-up 頻寬。
SRAM 的使用是此設計的核心。與現代數據中心 GPU 所配備的 HBM 相比,SRAM 容量低得多,但提供極高頻寬及可預測的存取時間。Groq 的編譯器排程架構亦會預先規劃運算、記憶體移動及晶片間通訊,目標是減少互動式生成期間變得明顯的延遲波動。
Vera Rubin NVL72 則提供系統中較通用、較依賴記憶體的一面。NVIDIA 描述了機架可如何分配推論工作的三種方式。
在傳統的預填充與解碼分拆方式中,Vera Rubin 處理提示詞並建立鍵值快取,然後將該快取傳送至 LPX 進行 token 生成。在注意力與前饋分拆方式中,Rubin GPU 保留快取並執行注意力運算,而 LPX 則執行前饋或混合專家層。LPX 亦可運行較小的草稿模型進行推測式解碼,同時由 Vera Rubin 上較大的模型驗證建議的 token。
這些配置旨在將大型上下文處理,以及具彈性、高吞吐量的工作負載分配予 GPU,同時將可預測、對延遲敏感的生成工作導向 LPU。這種分工尤其適用於程式編寫代理及其他會反覆檢視上下文、生成回應、呼叫工具、觀察結果,然後開始另一輪推論的系統。
三、已公布的效能證據
最具體的效能結果,是 Artificial Analysis 在 NVIDIA 營運的 Groq 3 LPX 系統上進行的一項測試。使用擁有 310 億個參數、並配備 100,000 個輸入 token 的 Gemma 4 模型時,該系統的輸出中位數為每秒 3,431 個 token。
NVIDIA 在其公告中將該結果四捨五入為每秒 3,400 個 token,並稱約為比較中最快公開端點每秒 870 個 token 結果的四倍。在較短的 10,000-token 上下文下,LPX 系統錄得每秒 3,382 個輸出 token 的中位數;而該圖表中納入的最快公開端點為 1,402 個。
Artificial Analysis 及 NVIDIA 亦表示,在該基準測試配置下,測試輸出並未損失模型精度或品質。然而,LPX 量度結果來自運行於 NVIDIA 自家數據中心的系統,而非一般可用的 GroqCloud 端點。因此,這些數據證明的是硬件配置的潛在速度,而非客戶將從 Groq 獲得的價格、容量、擠塞行為或端到端延遲。
NVIDIA 另行在同一模型上運行開源 SPEED-Bench 程式編寫工作負載。它報告的生成速率中位數為每秒 4,767 個輸出 token,而 P80 結果為每秒 5,520 個 token。這項程式編寫結果由供應商自行運行,與 Artificial Analysis 的量度不同,應據此理解。
輸出 token 速度亦只量度系統開始返回 token 後的生成階段。應用程式的總回應時間仍包括提示詞處理、排隊、網絡延遲、工具執行、模型推理,以及 Rubin 與 LPX 機架之間的任何傳輸。當生成是瓶頸時,更快的解碼可以大幅縮短代理迴圈,但不會令代理式任務的每一步都按比例加快。
四、為何這項部署改變 GroqCloud
這項計劃中的推出,加深了始於 2025 年 12 月 Groq 與 NVIDIA 簽訂非獨家推論技術授權協議的關係。根據該協議,Groq 創辦人 Jonathan Ross、時任總裁 Sunny Madra 及其他團隊成員加入 NVIDIA,以推進獲授權技術。Groq 仍是一家獨立公司,而 GroqCloud 亦持續營運。
NVIDIA 隨後將該技術納入 NVIDIA 品牌的 Groq 3 LPU 及 LPX 平台。Groq 於 2026 年 8 月 12 日加入 NVIDIA Cloud Partner 計劃,獲認證可按照 NVIDIA 參考架構及營運標準設計和營運 NVIDIA 加速運算基礎設施。
新公告將雙方關係由技術授權及認證,推向已確認的生產部署。Groq 原本以自家 LPU 基礎設施建立其雲端定位,現時則計劃營運 NVIDIA 對獲授權 Groq 技術的商業化實作,並與 Vera Rubin GPU 一同使用。
對開發者而言,實際改變在於有望透過 Groq 現有雲端存取這種異構硬件,而毋須購買及營運完整的機架級系統。Groq 早前表示,客戶將可在毋須更改應用程式程式碼的情況下取得日後的 NVIDIA 容量,但尚未說明 LPX 會否使用現有模型識別碼及 API 端點,或需要獨立服務層級。
這項決定亦令 GroqCloud 擴展至單一硬件系譜以外。它讓 Groq 結合其運行 LPU 推論的經驗,以及 NVIDIA 的 GPU、網絡、編排及機架級生態系統,同時由 Dell 處理部分實體部署流程。
尚未確認的事項在商業上相當重要。Groq 尚未公布開發者何時可向 LPX 發送生產請求、哪些模型將獲支援、存取方式會否一般開放或採用預留制,亦未說明其價格及服務級別保證將如何與現有 GroqCloud 產品比較。NVIDIA 宣布 LPX 已進入全面量產,表示該平台已達到製造規模;這並不代表 Groq 的服務已經上線。
常見問題
Groq 是首家部署 NVIDIA Groq 3 LPX 的雲端服務供應商嗎?
不是。NVIDIA 指出 Nebius 是首個將該平台投入生產的 AI 雲端服務商。Groq 表示自己將是最早採用者之一。
Groq 3 LPX 何時會在 GroqCloud 上推出?
Groq 尚未公布推出日期,亦未披露初始地區、容量、支援模型或存取要求。
Dell Technologies 提供甚麼?
Dell 正協助 Groq 大規模部署 LPX 及 Vera Rubin NVL72 基礎設施,包括整合運算、網絡及供應鏈支援。具體系統配置未有公布。
Groq 3 LPX 是 Vera Rubin NVL72 的替代品嗎?
不是。LPX 的設計是與 Vera Rubin NVL72 並行運作,在 Rubin GPU 處理互補推論工作時,加速對延遲敏感的 token 生成。
每秒 3,431 個 token 的基準測試代表 GroqCloud 效能嗎?
不是。Artificial Analysis 量度的是 NVIDIA 營運的 LPX 系統。Groq 尚未公布其計劃部署的生產端點效能或定價。
參考來源
Share