AI News字数 2826阅读时长8 分钟

OpenAI 首批 Jalapeño 基准测试称其延迟更低、效率高于英伟达

OpenAI 表示,在早期 InferenceX 测试中,其 Jalapeño 推理芯片在延迟和每瓦性能方面优于英伟达 GB200 和 GB300 系统。

OpenAI 于 2026 年 8 月 25 日公布了其定制 AI 推理芯片 Jalapeño 的首批实测性能结果。在三种公开语言模型上,该公司称,与用于对比的英伟达系统相比,Jalapeño 的峰值每瓦吞吐量高出 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。

这些结果使 Jalapeño 超越了 OpenAI 和博通在 6 月 24 日发布该处理器时提出的预期。当时,工程样片已达到目标频率和功耗,但 OpenAI 尚未公布详细性能数据。新测试涵盖 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

Jalapeño 仍属于量产前硬件,而非面向客户销售的产品。OpenAI 计划在完成量产认证、改进软件栈并验证更多工作负载的同时,于 2026 年底前在自身基础设施中部署数量有限的系统。

一、首批 Jalapeño 基准测试显示了什么

OpenAI 使用 SemiAnalysis 的公开语言模型服务系统测评套件 InferenceX 测试 Jalapeño。不同于单一的理论算力指标,这些测试考察吞吐量与每位用户实际体验到的延迟之间的关系。

公布的对比采用名义工作负载:8,000 个输入 token、1,000 个输出 token,并进行单 token 预测。OpenAI 按各加速器公布的封装功耗额定值对性能进行了标准化:Jalapeño 为 700 瓦,英伟达 GB200 为 1,200 瓦,GB300 为 1,400 瓦。OpenAI 表示,在测试工作负载期间,Jalapeño 测得的持续功耗保持在或低于 550 瓦。

在 GPT‑OSS 120B 上,Jalapeño 的对比对象是 GB200。OpenAI 报告称,在峰值吞吐量下,Jalapeño 每千瓦每秒约可处理 85,448 个混合 token,而英伟达系统为 44,960 个——优势为 1.9 倍。端到端延迟为 1.03 秒,而非 1.80 秒;生成 token 之间的最短间隔为 0.69 毫秒,而非 1.87 毫秒。

DeepSeek R1 670B 的对比采用 GB300。Jalapeño 在峰值吞吐量下每千瓦每秒可处理 19,641 个混合 token,而对方为 11,781 个,约为其 1.7 倍。其报告的端到端延迟为 1.65 秒,而对方为 5.99 秒;token 之间的最短间隔为 1.43 毫秒,而非 5.90 毫秒。

对于同样以 GB300 为对比对象的 Kimi K2.5 1T,Jalapeño 达到每千瓦每秒 18,195 个混合 token,而对方为 11,862 个。端到端延迟为 1.56 秒,而非 5.31 秒;token 之间的最短间隔则从 5.48 毫秒降至 1.44 毫秒。

OpenAI 还展示了在将每个系统限制于此前竞争对手最佳 token 间隔点时的大幅吞吐量提升。这些数字在 GPT‑OSS 上达到 53.7 倍,在 DeepSeek R1 上达到 104.3 倍,在 Kimi K2.5 上达到 56.1 倍。这些是在特定工作点测得的交互性匹配结果,并不意味着每项 Jalapeño 工作负载都快几十倍。

在更广泛的测试范围内,OpenAI 将 Jalapeño 在高交互性工作负载上的优势概括为 2.1 至 4.1 倍。该芯片在全部三种模型上均位于每千瓦吞吐量的帕累托前沿,这意味着没有任何被比较的配置能同时提供更高吞吐量和更低延迟。

二、结果颇具前景,但尚非完整的量产验证

SemiAnalysis 开发了 InferenceX,并在 OpenAI 实验室中与该公司工程师一同观察了 Jalapeño 的运行。它确认,基准测试中的模型在 GSM8K 评测中取得了与英伟达硬件上相当的结果,从而降低了通过暗中牺牲模型输出质量来换取速度的风险。

不过,SemiAnalysis 强调,“所有数字均由 OpenAI 提供给我们”。其分析师见证了测试运行,但并未独立执行完整的 InferenceX 套件。他们也尚未看到 Jalapeño 在 AgentX 上的结果;AgentX 是一项围绕长上下文、多轮智能体工作负载设计的较新基准测试。

这一差异很重要,因为公布的 8K 输入、1K 输出测试并未完整覆盖请求路由器、前缀缓存、缓存管理系统和卸载基础设施等生产组件。在经过精心优化的单轮工作负载上的性能,未必能直接转化为面对可变提示、持续流量和多步骤智能体的在线服务表现。

对比所采用的代际也需要结合背景看待。GPT‑OSS 对比的是 GB200,而规模更大的 DeepSeek 和 Kimi 模型则与 GB300 对比。SemiAnalysis 认为,英伟达更新的 Vera Rubin 平台是更具相关性的竞争参照,因为 Rubin 和 Jalapeño 都采用 HBM4 级内存技术,且软件开发都处于相对早期阶段。

因此,这些测试表明,可运行的 Jalapeño 工程样片能够高效地运行多个大型非专有模型系列。但它们尚未证明其在 ChatGPT 和 API 生产流量下的集群级可靠性、总体拥有成本或性能表现。

三、Jalapeño 如何同时瞄准延迟与吞吐量

Jalapeño 是一款仅用于推理的加速器,而不是用于训练新基础模型的芯片。OpenAI 与博通围绕语言模型服务的不同阶段设计了它。

在预填充阶段,系统处理用户提示词,因此算力容量是核心限制因素。在解码阶段,系统逐 token 生成答案,对内存带宽施加更大压力。在处理器之间移动模型状态也可能带来另一项瓶颈,尤其是当一个请求跨越多个芯片时。

OpenAI 表示,Jalapeño 会尽可能将模型状态——包括生成期间使用的键值缓存——保留在本地,从而减少这种移动。算力、内存和网络在一个大型互连域内协同,使同一加速器池能够同时处理预填充和解码,而无需将这些阶段永久分配给不同硬件。

该设计旨在随着工作负载比例变化而保持效率。面向批处理的服务可能优先考虑总吞吐量,而交互式智能体可能需要快速生成 token,因为延迟会在连续的工具调用和推理步骤中累积。

博通提供了芯片实现、连接和网络方面的专业能力,包括其 Tomahawk 技术。Celestica 正在参与电路板、机架和系统集成。OpenAI 仍负责架构,以及由其 ChatGPT、Codex 和 API 工作负载所驱动的软件与硬件决策。

该公司尚未宣布销售 Jalapeño 芯片或系统的计划。OpenAI 硬件主管 Richard Ho 告诉 Axios,内部需求已经大到该公司无法设想向外部买家供货。因此,开发者将通过 OpenAI 服务间接接触 Jalapeño,而不是将其作为可购买的加速器。

四、AI 同时参与了芯片设计和软件适配

OpenAI 表示,AI 工具直接参与了 Jalapeño 的开发。从初始设计到制造流片,该公司在九个月内完成了芯片设计阶段。SemiAnalysis 将更广泛的时间线——从最初招聘团队到流片——估计为约 16 个月,因此这两个数字描述的是不同的起点,并不一定代表相互冲突的时间安排。

模型被用于探索实现方案、缩短设计和验证循环,以及优化算术电路。OpenAI 还将该处理器构建为一个可预测的编程目标,围绕本地张量、显式通信和同步机制设计,使 AI 系统能够协助在硬件上放置和调度工作。

工程团队使用搭载 GPT‑Astra 的 Codex,在两个月内使 GPT‑OSS、DeepSeek R1 和 Kimi K2.5——这些模型均未列入 Jalapeño 最初的量产计划——实现了高性能。对于部分 GPT‑OSS 注意力和混合专家模块,AI 生成的实现比人类专家编写的现有代码快 1.5 至 1.8 倍。OpenAI 明确将该结果限定于这些模块;它并非全模型加速结果。

OpenAI 预计将在 2026 年底前有限部署 Jalapeño,并在 2027 年扩大产能。第二代设计已进入高级开发阶段,第三代的工作也已开始。

该公司并未取代其外部供应商。它表示,由于 Jalapeño 本身无法满足其算力需求,英伟达和其他合作伙伴将继续为训练和推理提供加速器。眼下的运营考验在于:OpenAI 能否在完成量产认证后,将实验室中的效率增益复制到完整机架部署中,并经受混合客户流量的检验。

常见问题

什么是 OpenAI Jalapeño?

Jalapeño 是 OpenAI 首款定制 AI 加速器。它与博通共同开发,专门用于语言模型推理,而非模型训练。

Jalapeño 比英伟达芯片更快吗?

在 OpenAI 公布的 InferenceX 测试中,Jalapeño 的峰值每千瓦吞吐量更高,延迟也低于所比较的 GB200 和 GB300 配置。这些结果来自工程样片,尚非完整的量产基准测试。

测试了哪些模型?

OpenAI 使用名义上的 8,000 个输入 token 和 1,000 个输出 token 工作负载,测试了 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

开发者可以购买或租用 Jalapeño 硬件吗?

不能。OpenAI 表示,它没有出售该芯片的计划,因为可用产能需要用于自身基础设施。开发者最终可能通过 OpenAI 托管的产品和 API 从中受益。

Jalapeño 何时投入服务?

OpenAI 计划在 2026 年底前开始有限的内部部署。量产认证、软件开发以及在更多模型上的测试仍在进行中。

参考来源

Share

分享这篇文章