OpenAI公布的Jalapeño首批测试结果,传递的是一个有边界的信号,而不是“英伟达被全面取代”:在部分大语言模型服务任务中,这款定制推理芯片的每瓦性能和响应延迟优于英伟达GB200与GB300系统。对于电力、散热和供电能力日益成为AI基础设施瓶颈的行业而言,这是一项值得关注的进展。但Jalapeño从设计之初就只针对推理,并不是能够覆盖所有AI工作负载的通用GPU替代品。57
Jalapeño到底是什么?
Jalapeño是OpenAI与博通共同开发的专用集成电路(ASIC),面向大语言模型推理。所谓推理,是指模型训练完成后,根据用户请求生成回答;训练则是构建模型本身的过程。专用芯片牺牲一部分灵活性,换取在稳定、规模化任务上的效率优势。619
这一区别决定了应该如何解读测试结果。英伟达GPU需要支持训练、微调、推理以及不断变化的模型架构,适用范围更广;Jalapeño则围绕OpenAI的模型服务需求及其软硬件系统进行优化。56
公布的性能和功耗数据
OpenAI使用SemiAnalysis公开的InferenceX基准,对Jalapeño与基于英伟达GB200、GB300的系统进行了测试,覆盖三款公开模型:GPT-OSS 120B、DeepSeek R1 670B,以及Moonshot AI的Kimi K2.5 1T。公司称,在这些对比中,Jalapeño峰值吞吐每瓦完成的AI工作量高出1.5至1.9倍,端到端延迟则降低1.7至3.6倍。5713
几个模型的具体结果显示了这一优势的范围:
- 在GPT-OSS 120B上,Jalapeño达到每千瓦每秒85,448个混合令牌,GB200系统为44,960,约为后者的1.9倍;端到端延迟分别为1.03秒和1.80秒。7
- 在DeepSeek R1 670B上,Jalapeño达到每千瓦每秒19,641个混合令牌,GB300为11,781,单位功耗完成的工作量约高出1.7倍;延迟分别为1.65秒和5.99秒。7
- 在Kimi K2.5 1T上,Jalapeño达到每千瓦每秒18,195个混合令牌,GB300为11,862,约高出1.5倍。7
如果把运行点从“追求最高总吞吐”调整为“优先快速响应”,OpenAI称Jalapeño在高度交互式负载中的性能优势扩大到2.1至4.1倍。413
功耗数据解释了这款芯片的吸引力:Jalapeño额定功耗为700瓦,作为对比,GB200和GB300加速器的额定功耗分别为1,200瓦和1,400瓦。OpenAI称,在测试负载中,Jalapeño的实测持续功耗保持在550瓦或以下。61213
不过,更低的加速器功耗并不等于数据中心总成本会按同样比例下降。芯片、服务器、网络、存储、制冷和电力基础设施共同决定最终成本。更高的单位能效仍可能降低电费、散热和配电系统的压力,而这正是OpenAI在未来大规模部署中采用定制推理芯片的主要经济逻辑。5
这场对比有多可靠?
此次测试使用SemiAnalysis公开的InferenceX基准,测量的是多款模型在不同运行点上的端到端服务表现,而不只是芯片规格表中的理论性能。因此,它比单纯比较峰值算力更接近实际推理运营场景。7
但目前这些数字仍应被视为OpenAI公布的测试结果,而不是已经由独立机构重复验证的、完全中立的行业结论。45
最重要的限制之一是硬件代际差异。Jalapeño采用HBM4内存,而此次测试中的GB200和GB300系统并未使用HBM4。SemiAnalysis因此认为,这一比较并不完整,也不能算完全公平。5
对大模型服务来说,内存容量和带宽至关重要。英伟达的Rubin平台同样采用HBM4,因此相比不具备这一内存技术的Blackwell系统,Rubin可能是更具可比性的下一代对手。Jalapeño领先GB200和GB300,并不能证明它也会击败Rubin。517
此外,比较双方的产品定位本身也不同。Jalapeño是只做推理的芯片,而英伟达GPU还要承担训练、微调、推理和不断变化的模型架构。对于足够稳定、规模足够大的目标任务,ASIC可以凭借专用设计取胜;但对于变化迅速的研究和开发任务,通用GPU的灵活性更有价值。520
何时部署?后续还会怎么发展?
OpenAI计划在2026年年底前以“非常小的规模”将Jalapeño部署到自有计算基础设施中,随后在2027年明显扩大部署规模。1133
这不是一次性的芯片项目。OpenAI表示,第二代和第三代芯片已经在开发;博通则称,该路线图面向与微软及其他数据中心合作伙伴共同建设的千兆瓦级部署,并将持续推进多个芯片世代。31130
其更大的目标是“垂直协同设计”:让模型、推理软件、内存、网络、服务器系统和芯片围绕同一类工作负载协同开发。这样做有望进一步压低延迟和推理成本,但代价是硬件的通用性和可复用性较弱。3633
从设计到流片只用了很短时间,确实相当引人注目。但快速完成流片,并不等于已经实现成熟的量产。制造良率、系统集成、软件成熟度、供应能力,以及芯片能否适应未来模型,最终都会决定测试优势能否转化为长期基础设施优势。现有报道确认了部署计划,但尚不能证明最终量产规模。3033
为什么它不会立刻取代英伟达?
OpenAI已经表示,未来仍将依靠英伟达进行模型训练,并继续把英伟达作为计算合作伙伴。411
这种分工并不矛盾。训练前沿模型需要高度灵活的计算系统,以适应不断变化的模型结构、算法和实验流程。英伟达GPU还拥有CUDA软件生态,以及涵盖网络和完整数据中心系统的软硬件栈。5
因此,Jalapeño更适合被理解为一种针对特定工作负载的替代策略:对于模型和服务流程相对稳定、请求量巨大、且OpenAI能够控制软硬件环境的推理任务,它可以逐步承担更多工作;而在训练、研究、模型迭代及重视灵活性的场景中,英伟达仍然不可或缺。45
这也解释了英伟达CEO黄仁勋为何可以淡化这类定制芯片带来的直接威胁。英伟达销售的不只是某一颗推理芯片,而是一套可以训练、微调和部署模型的通用计算平台,背后还有CUDA、网络设备和数据中心系统。对同时运行多种任务、且模型与软件经常变化的客户来说,这种整体价值不能简单用一次推理基准来衡量。5
对英伟达和AI芯片市场意味着什么?
分析人士认为,Jalapeño说明超大规模云服务商设计的ASIC,已经有可能在部分推理效率指标上匹敌甚至超过Blackwell级GPU。这可能对英伟达在推理市场的议价能力和利润率形成压力,尤其是大型AI运营商希望降低服务成本、减少对单一供应商依赖之际。1732
OpenAI也不是唯一一家押注定制芯片的公司。谷歌、亚马逊云科技(AWS)和Meta都被列为正在开发自有AI芯片的大型科技公司,行业正在从“购买通用加速器”转向“根据工作负载定制基础设施”。5
更可能出现的并不是GPU市场突然崩塌,而是进一步分层:
- 定制ASIC可能更适合由大型平台控制的稳定、高频、大规模推理任务。
- 英伟达GPU仍可能凭借训练能力、快速模型实验、异构工作负载、开发工具和软件生态保持优势。520
- 拥有自研芯片的平台公司可以把可预测的推理需求转移到自有硬件上,从而在未来采购GPU时获得更强的谈判筹码。
真正需要观察的是:Jalapeño的优势能否在更公平的代际比较、不断变化的模型以及量产部署中持续存在。就目前证据而言,最稳妥的结论是:OpenAI已经证明,定制芯片在部分大模型推理任务上能够与Blackwell展开有竞争力的较量;但这并没有终结OpenAI对英伟达的依赖,也没有让通用GPU失去价值。