Groq 将与戴尔部署 NVIDIA Groq 3 LPX 和 Vera Rubin NVL72
Groq 计划通过与戴尔的部署合作伙伴关系,将 NVIDIA Groq 3 LPX 和 Vera Rubin NVL72 容量引入 GroqCloud。
一、Groq 承诺采用 NVIDIA 的新推理平台
Groq 计划在 GroqCloud 中部署 NVIDIA Groq 3 LPX 和 NVIDIA Vera Rubin NVL72,使这家独立推理服务提供商能够通过其现有云平台提供 NVIDIA 最新的低延迟架构。戴尔科技将提供部署基础设施,并支持这些系统的大规模落地。
该公告发布于 2026 年 8 月 24 日,同一天 NVIDIA 宣布 Groq 3 LPX 已进入全面量产。Groq 称自己是“首批采用者之一”,而非首家采用者:NVIDIA 指定 Nebius 为首个计划将该平台投入生产的 AI 云服务商,Groq 则是另一家早期提供商。
这一差异很重要,因为两家公司都没有表示 Groq 的 LPX 容量已向客户开放。Groq 没有披露启用日期、部署区域、机架数量、支持的模型列表、API 配置、预留流程或每个 token 的价格。其公告始终以将来时描述客户访问该服务。
容量上线后,Groq 打算通过已用于生产推理的基础设施提供该服务。该公司表示,GroqCloud 服务超过 600 万名开发者和数千家 AI 原生公司,每周处理数万亿个 token,并在北美、欧洲、中东和亚太地区运营数据中心。这些运营数据为公司披露,并非独立审计的测量结果。
戴尔所述的角色,是利用其计算、网络、集成和供应链能力,将 NVIDIA 的机架架构转化为可部署的基础设施。各方没有明确涉及哪些具体的戴尔系统,也没有公布该安排的商业条款。
二、Groq 3 LPX 为 Vera Rubin 增添了什么
NVIDIA Groq 3 LPX 是一款机架级推理加速器,围绕 256 颗 Groq 3 LPU 芯片构建。它并非 Vera Rubin NVL72 的独立替代品,而是被设计为与 GPU 机架协同工作,专门处理对延迟敏感的 token 生成。
一套完整的 LPX 机架包含 32 个液冷 1U 计算托盘,每个托盘配备八个 LPU。NVIDIA 列出的每机架指标包括 315 FP8 petaflops 推理算力、128 GB 聚合片上 SRAM、每秒 40 petabytes 的 SRAM 带宽,以及每秒 640 terabytes 的纵向扩展带宽。每个 LPU 提供 500 MB SRAM、每秒 150 TB 的 SRAM 带宽,以及每秒 2.5 TB 的纵向扩展带宽。
SRAM 的使用是该设计的核心。与连接在现代数据中心 GPU 上的 HBM 相比,SRAM 容量小得多,但能提供极高带宽和可预测的访问时间。Groq 的编译器调度架构还会预先规划计算、内存移动和芯片间通信,旨在减少交互式生成过程中变得明显的延迟波动。
Vera Rubin NVL72 提供系统中更通用、内存需求更高的一侧。NVIDIA 描述了机架可划分推理工作的三种方式。
在传统的预填充与解码分离方案中,Vera Rubin 处理提示词并创建键值缓存,然后将该缓存传输至 LPX 以生成 token。在注意力与前馈分离方案中,Rubin GPU 保留缓存并运行注意力机制,而 LPX 执行前馈层或混合专家层。LPX 还可以为推测解码运行较小的草稿模型,同时由 Vera Rubin 上的较大模型验证所提议的 token。
这些配置旨在将大上下文处理以及灵活的高吞吐量工作负载分配给 GPU,同时将可预测、对延迟敏感的生成任务交给 LPU。这种分工尤其适用于编程智能体和其他系统:它们反复检查上下文、生成响应、调用工具、观察结果,然后开始下一轮推理。
三、已公布的性能证据
最具体的性能结果来自 Artificial Analysis 在 NVIDIA 运营的 Groq 3 LPX 系统上进行的一项测试。使用拥有 310 亿参数、输入为 100,000 个 token 的 Gemma 4 模型时,该系统的输出速度中位数达到每秒 3,431 个 token。
NVIDIA 在其公告中将该结果四舍五入为每秒 3,400 个 token,并称其约为对比中最快公开端点每秒 870 个 token 结果的四倍。在较短的 10,000-token 上下文下,LPX 系统的输出速度中位数为每秒 3,382 个 token,而该图表中纳入的最快公开端点为每秒 1,402 个 token。
Artificial Analysis 和 NVIDIA 还报告称,在该基准配置下,测试输出没有损失模型精度或质量。不过,LPX 测量来自运行在 NVIDIA 自有数据中心的系统,而不是一个普遍可用的 GroqCloud 端点。因此,这些结果证明的是该硬件配置的潜在速度,而非客户将从 Groq 获得的价格、容量、拥堵行为或端到端延迟。
NVIDIA 还在同一模型上单独运行了开源 SPEED-Bench 编程工作负载。其报告的生成速度中位数为每秒 4,767 个输出 token,P80 结果为每秒 5,520 个 token。与 Artificial Analysis 的测量不同,这一编程结果由厂商运行,应据此看待。
输出 token 速度也只衡量系统开始返回 token 后的生成阶段。应用程序的总响应时间仍包括提示词处理、排队、网络延迟、工具执行、模型推理,以及 Rubin 和 LPX 机架之间的任何传输。当生成是瓶颈时,更快的解码可以显著缩短智能体循环,但并不会让智能体任务的每一步都按比例加快。
四、为何此次部署会改变 GroqCloud
此次计划中的部署深化了始于 2025 年 12 月 Groq 与 NVIDIA 达成的非独家推理技术许可协议的合作关系。根据该协议,Groq 创始人 Jonathan Ross、时任总裁 Sunny Madra 及其他团队成员加入 NVIDIA,以推进获授权技术的发展。Groq 仍是一家独立公司,GroqCloud 继续运营。
NVIDIA 随后将该技术纳入 NVIDIA 品牌的 Groq 3 LPU 和 LPX 平台。Groq 于 2026 年 8 月 12 日加入 NVIDIA Cloud Partner 计划,获得认证,可按照 NVIDIA 参考架构和运营标准设计及运营 NVIDIA 加速计算基础设施。
这项新公告使双方关系从技术许可和认证迈向已明确的生产部署。围绕自有 LPU 基础设施建立云服务身份的 Groq,如今计划与 Vera Rubin GPU 一起运营 NVIDIA 对获授权 Groq 技术的商业化实现。
对开发者而言,实际变化在于有望通过 Groq 的现有云服务访问这种异构硬件,而无需购买和运营完整的机架级系统。Groq 此前表示,客户将无需修改应用程序代码即可获得未来的 NVIDIA 容量,但尚未说明 LPX 是否会使用现有模型标识符和 API 端点,还是需要独立的服务层级。
这一决定也使 GroqCloud 不再局限于单一硬件谱系。它让 Groq 能够结合其运营 LPU 推理的经验,以及 NVIDIA 的 GPU、网络、编排和机架级生态系统,同时由戴尔负责部分实体部署路径。
尚未确认的事项在商业上很重要。Groq 尚未公布开发者何时可以向 LPX 发送生产请求、将支持哪些模型、访问是否普遍开放或需要预留,或其价格和服务级别保证将如何与现有 GroqCloud 服务相比。NVIDIA 宣布 LPX 已进入全面量产,意味着该平台已达到制造规模;这并不表示 Groq 的服务已经上线。
常见问题
Groq 是首家部署 NVIDIA Groq 3 LPX 的云服务商吗?
不是。NVIDIA 将 Nebius 列为首个将该平台投入生产的 AI 云服务商。Groq 表示它将是最早采用者之一。
Groq 3 LPX 何时会在 GroqCloud 上开放?
Groq 尚未公布上线日期。它也尚未披露首批区域、容量、支持模型或访问要求。
戴尔科技提供什么?
戴尔正帮助 Groq 大规模部署 LPX 和 Vera Rubin NVL72 基础设施,包括集成的计算、网络和供应链支持。具体系统配置尚未公布。
Groq 3 LPX 是 Vera Rubin NVL72 的替代品吗?
不是。LPX 被设计为与 Vera Rubin NVL72 协同运行,在 Rubin GPU 处理互补推理任务时加速对延迟敏感的 token 生成。
每秒 3,431 个 token 的基准测试代表 GroqCloud 性能吗?
不是。Artificial Analysis 测量的是 NVIDIA 运营的 LPX 系统。Groq 尚未公布其计划部署的生产端点性能或定价。
参考来源
Share