OpenAI公布了其首款自研AI加速器Jalapeño的最新推理测试结果。公司称,在GPT‑OSS 120B、DeepSeek R1和Kimi K2.5 1T等模型上,Jalapeño实现了更高的每瓦AI工作量、更低的端到端延迟,以及更快的面向单个用户的交互式令牌生成速度。34
不过,这一结论需要加上限定语:这些是OpenAI基于特定InferenceX配置公布的早期结果,并不是对所有生产环境AI负载、也不是对英伟达当前及未来全部平台的独立、普适比较。47
Jalapeño的测试成绩
在三个测试模型上,OpenAI称Jalapeño在峰值吞吐下实现了1.5至1.9倍的每瓦AI工作量,端到端延迟则降低了1.7至3.6倍。对于强调实时响应的工作负载,OpenAI报告的性能提升幅度为2.1至4.1倍。3
具体到各模型,结果如下:
GPT‑OSS 120B对比英伟达GB200: Jalapeño报告的峰值混合吞吐效率为每千瓦85,448个单位,GB200为44,960个单位。端到端延迟分别为1.03秒和1.80秒。在最低令牌间隔下,Jalapeño的时间间隔为0.69毫秒,相当于约1,459 tokens/s/用户;GB200约为535 tokens/s/用户。4
DeepSeek R1 MXFP4对比英伟达GB300: Jalapeño报告的峰值混合吞吐效率为每千瓦19,641个单位,GB300为11,781个单位。端到端延迟分别为1.65秒和5.99秒。在最低令牌间隔下,Jalapeño约达到700 tokens/s/用户,GB300约为169 tokens/s/用户。46
Kimi K2.5 MXFP4对比英伟达GB300: OpenAI称,Jalapeño的峰值每瓦吞吐量高出1.5倍,端到端延迟降低3.4倍;在最低令牌间隔下,单用户生成速度约为694 tokens/s,GB300约为182 tokens/s。4
“tokens/s/用户”主要衡量交互体验,表示单个请求接收模型输出令牌的速度,而不是机架在高并发条件下总共生成多少令牌。对于聊天、编程和智能体应用而言,这一指标往往直接影响用户对“响应快不快”的感受。
为什么专用推理芯片可能更快
Jalapeño是一款专门面向大语言模型推理的加速器,而不是在同时服务训练和推理任务的通用GPU基础上进行适配的产品。OpenAI负责架构设计,博通负责芯片实现与网络部分,Celestica则参与电路板、机架和系统集成。1732
其机架级设计采用大规模互联网络域,目标是尽可能让工作负载留在同一套系统内。OpenAI表示,模型状态(包括KV缓存)会尽量在本地放置和保留,以减少芯片之间的数据搬运,以及生成过程中可能出现的通信停顿。46
Jalapeño也没有把推理中的prefill和decode阶段划分到两个固定资源池中。OpenAI称,计算、内存和网络资源可以在两个阶段之间灵活使用。Prefill负责处理输入提示词,通常更依赖计算能力;decode则逐个生成输出令牌,更容易受到内存移动和带宽的限制。46
目前公开的技术细节仍不完整。一份技术描述提到,相关系统由128颗芯片组成,拥有约1.7 exaFLOPS算力和27 TB HBM显存,但OpenAI的测试公告没有提供完整的机架物料清单,也不足以让外部研究者逐项复现所有结果。4
OpenAI称AI参与了芯片设计
OpenAI表示,Jalapeño从最初设计到制造流片(tape-out)只用了9个月,这对先进定制加速器而言是一个非常紧凑的开发周期。1721
公司还称,其模型参与了设计探索、实现、测量、验证、算术电路优化和编程等环节。OpenAI报告称,搭载GPT‑Astra的Codex在两个月内帮助三个原本未计划支持的开放权重模型达到较高性能。在部分GPT‑OSS注意力模块和混合专家模块上,AI生成的实现方案比原有人工编写方案快1.5至1.8倍。需要注意的是,这些数字只适用于特定模块,并不代表完整模型服务结果。4
这次测试有哪些局限
Jalapeño的 headline 优势需要放回测试条件中理解。
它是推理加速器,不是训练GPU
Jalapeño的目标是运行已经训练完成的模型,而不是训练模型。因此,OpenAI预计仍会使用英伟达、AMD及其他公司的加速器进行训练,并承担部分推理任务。46
换句话说,Jalapeño更像是OpenAI基础设施中的专用补充,而不是能够全面替代公司现有GPU系统的通用方案。
测试采用了相对有限的服务场景
对比使用了SemiAnalysis公开的InferenceX基准,采用名义上单轮、输入8,000个令牌、输出1,000个令牌的请求。该测试衡量完整请求服务过程,在用户体验条件相匹配的情况下比较系统,并根据公布的芯片功耗额定值对结果进行归一化处理。47
SemiAnalysis表示,其人员在OpenAI实验室见证了测试运行,但没有亲自执行完整基准套件。该机构还提醒,这一设置并未覆盖更长上下文、多轮智能体工作负载、路由、前缀缓存、缓存管理或数据卸载行为,而这些软件和服务策略可能显著改变生产环境中的实际性能。6
功耗统计方式会影响每瓦结果
OpenAI将Jalapeño的封装功耗列为700瓦,并称在测试工作负载下,持续实测功耗不超过550瓦。作为对照,GB200和GB300采用的建模功耗分别为1,200瓦和1,400瓦。因此,Jalapeño的每瓦优势部分取决于具体工作负载、测量位置以及功耗核算方法。4
与英伟达的比较具有时间限制
这次测试比较的是当时可获得的GB200或GB300最佳结果。等到Jalapeño开始大规模部署时,英伟达更新一代的系统可能会成为更有意义的对手。英伟达还使用不同的离线测试方法公布了GB300运行DeepSeek R1的结果,这些数据不能直接与Jalapeño的交互式tokens/s/用户结果相比较。124
部署计划与竞争策略
OpenAI计划在2026年底前将少量Jalapeño系统部署到自有计算基础设施中,并预计在2027年扩大容量。公司称,第二代芯片已经进入深入开发阶段,第三代也开始成形。46
目前,Jalapeño仍是OpenAI的内部平台,外部公司无法直接购买或租用。OpenAI硬件负责人Richard Ho表示,由于内部需求过高,公司尚未考虑对外销售。6
因此,Jalapeño当前的战略是补充而非立即取代英伟达和AMD。OpenAI仍需要通用加速器进行模型训练,未来基础设施也很可能继续采用异构架构。谷歌已经同时开发用于训练和推理的TPU,亚马逊和微软也拥有自研AI芯片,Anthropic则公开介绍过开发定制芯片的努力。6
对行业意味着什么
Jalapeño的早期结果说明,针对特定工作负载设计的加速器,有机会在交互式大语言模型服务最关注的几个指标上超过通用系统:能效、端到端响应时间,以及单个用户实际获得输出令牌的速度。
但现有证据支持的结论,比“OpenAI已经击败英伟达”更窄。报告中的领先优势只适用于指定模型、特定InferenceX工作负载,以及与GB200和GB300配置的比较。Jalapeño在更广泛的生产流量、更长上下文的智能体任务、不同软件栈、训练相关工作负载,以及OpenAI扩大部署时英伟达可提供的系统上的表现,仍有待观察。