OpenAI 表示,Jalapeño 在三個大型語言模型測試中,峰值吞吐量的每瓦 AI 工作量比 Nvidia GB200 與 GB300 系統高出 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。 Jalapeño 是 OpenAI 與 Broadcom 共同開發、專為推論設計的 ASIC,額定功耗 700 瓦;在公布的測試工作負載中,持續功耗維持在 550 瓦或以下。OpenAI 計畫於 2026 年底小量部署,並在 2027 年擴大部署。
研究答案

Create a landscape editorial hero image for this Studio Global article: What are the reported performance results, power and cost-efficiency benefits, testing details and caveats, deployment timeline, development. Article summary: OpenAI reports that Jalapeño—a Broadcom co-developed, inference-focused ASIC—beats Nvidia’s Blackwell GB200/GB300 systems on the tested LLM-serving workloads for work per watt and latency. It is a meaningful proof point . Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI 首次公布 Jalapeño 的測試結果,提出的是一項有明確範圍的主張,而不是「全面擊敗 Nvidia」:在部分大型語言模型服務測試中,這款自研推論 ASIC 的每瓦工作量與回應延遲優於 Nvidia GB200、GB300 系統。對高度依賴模型服務的 AI 基礎設施而言,這是重要訊號,因為電力與散熱正逐漸成為推論成本的核心因素。不過,Jalapeño 是為推論而設計,並非可在所有工作負載取代 Nvidia GPU 的通用處理器;這次比較也存在明顯限制。57
Jalapeño 是 OpenAI 與 Broadcom 共同開發、專門用於大型語言模型推論的應用特殊積體電路(ASIC)。所謂推論,是指已訓練完成的模型產生回答的階段,與打造模型本身的訓練流程不同。針對規律且大量的工作負載,專用晶片可以犧牲部分彈性,換取更高的能源效率。619
這種專業化正是解讀測試結果的關鍵。Nvidia GPU 系統能支援更廣泛的工作,包括訓練、微調、推論及不同模型架構;Jalapeño 則是圍繞 OpenAI 的模型服務需求,以及其軟硬體整合平台進行最佳化。56
OpenAI 表示,測試使用三個公開模型,分別是 GPT-OSS 120B、DeepSeek R1 670B,以及 Moonshot AI 的 Kimi K2.5 1T,並將 Jalapeño 與 Nvidia GB200、GB300 系統比較。公司公布的結果顯示,在峰值吞吐量下,Jalapeño 的每瓦 AI 工作量高出 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。5713
各模型的數據呈現出不同幅度的優勢:
對於更重視即時互動、而不是追求最大總吞吐量的工作點,OpenAI 表示優勢進一步擴大,效能高出 2.1 至 4.1 倍。413
功耗數字也說明了這項設計的吸引力。Jalapeño 額定功耗為 700 瓦;相比之下,受比較的 GB200 與 GB300 加速器額定功耗分別為 1,200 瓦與 1,400 瓦。OpenAI 表示,在測試工作負載下,Jalapeño 的實測持續功耗維持在 550 瓦或以下。61213
但較低的加速器功耗,不代表資料中心總成本會按相同比例下降。更少的電力若能處理更多模型工作,確實有助於降低電力、冷卻與配電系統的壓力;對 OpenAI 預期的部署規模而言,這正是打造專用推論晶片的主要經濟理由。5
測試採用 SemiAnalysis 公開的 InferenceX 基準,評估的是多個模型與不同運作點下的端到端服務表現,而不只是晶片規格表上的理論數字。因此,結果比單純比較峰值運算能力更接近實際推論營運。7
不過,這些仍是 OpenAI 公布的測試結果,並非經獨立機構重現、完全中立的業界裁決。45
更重要的限制在於硬體世代並不完全相同。Jalapeño 使用 HBM4 記憶體,而受測的 GB200 與 GB300 系統並未使用 HBM4。SemiAnalysis 因此認為,這項比較並不完整,也不能算是完全公平的對照。5
對大型模型服務而言,記憶體容量與頻寬都相當重要。Nvidia 的 Rubin 平台同樣採用 HBM4,從世代與記憶體技術來看,可能是比缺少 HBM4 的 Blackwell 系統更合適的比較對象。因此,Jalapeño 擊敗 GB200、GB300 的結果,不能直接證明它也會勝過 Rubin。517
另一項限制是,雙方本來就不是為同一種任務打造。Nvidia GPU 可用於訓練、微調、推論及快速變動的模型架構;Jalapeño 的價值則集中在目標工作負載足夠穩定、值得用專用硬體換取效率的情況。520
OpenAI 計畫在 2026 年底前,以「非常小的規模」將 Jalapeño 部署到自有運算基礎設施,並在 2027 年進一步擴大部署。1133
這項計畫並非只做一代晶片。OpenAI 表示,第二代與第三代晶片已在開發中;Broadcom 則描述了一條多世代路線圖,目標是與 Microsoft 及其他資料中心合作夥伴,推動吉瓦級部署。31130
更大的策略是「垂直協同設計」:讓模型、推論軟體、記憶體、網路、系統與晶片共同演進,而不是把加速器視為獨立零件。這種做法有望更精準地控制延遲與服務成本,但代價是硬體的通用性通常不如 Nvidia GPU。3633
從設計到流片的速度固然引人注目,但快速完成流片不等於已經證明能大規模量產。製造良率、系統整合、軟體成熟度、供應能力,以及晶片能否支援未來模型,才會決定基準測試的優勢能否變成長期的基礎設施優勢。目前公開報導確認了部署計畫,但尚未證明最終量產規模。3033
OpenAI 已表示,未來仍會依賴 Nvidia 進行模型訓練,並繼續把 Nvidia 視為運算合作夥伴。411
這種分工其實合理。前沿模型訓練需要高度彈性的系統,以應對不斷改變的架構、演算法與實驗需求。Nvidia GPU 也受惠於 CUDA 軟體生態系,以及涵蓋網路與完整資料中心系統的整套平台。5
因此,Jalapeño 更適合被理解為一項針對特定工作負載的替代策略:OpenAI 可將反覆、可預測且由自己掌控模型與服務軟體的推論工作,逐步轉移到自有晶片;Nvidia 則仍會在訓練、研究、模型迭代,以及重視彈性的工作中扮演重要角色。45
Nvidia 執行長黃仁勳淡化自研 ASIC 威脅的核心理由,並不是否認專用晶片能在特定推論基準中勝過 GPU,而是強調兩者服務的客戶需求不同。Nvidia 銷售的是具備完整軟硬體堆疊的彈性運算平台,而不只是推論晶片:GPU 可以訓練、微調與執行推論,並隨模型與演算法變化而調整;CUDA、網路設備及整套資料中心系統也讓比較不應只停留在晶片吞吐量。5
部署規模同樣限制了 Jalapeño 的短期衝擊。Jalapeño 初期主要服務 OpenAI 自己的基礎設施,並不是市場上任何客戶都能直接購買、部署的通用替代方案。14
換句話說,這項消息目前更快改變的是推論市場的議價格局,而非整個 AI 運算市場。OpenAI 證明了部分工作負載存在可行的替代方案,但還沒有終結對 Nvidia 的依賴。
分析師認為,Jalapeño 顯示由大型雲端平台自行設計的 ASIC,已能在部分推論效率指標上媲美甚至超越 Blackwell 系統。隨著大型 AI 業者尋求降低模型服務成本、減少對單一供應商的依賴,這可能對 Nvidia 在推論市場的地位與利潤率形成壓力。1732
OpenAI 也不是唯一投入自研晶片的科技公司。Google、AWS 與 Meta 同樣被視為正在開發自有 AI 晶片,反映 AI 基礎設施正逐漸走向依工作負載量身打造的方向。5
更可能出現的結果不是 GPU 立刻崩盤,而是市場進一步分化:
真正關鍵的問題,是 Jalapeño 的優勢能否經得起更公平的比較、持續變化的模型,以及量產規模部署。目前證據支持的較穩妥結論是:OpenAI 已展示專用晶片在特定推論工作負載上具備與 Blackwell 競爭、甚至超越 Blackwell 的效率,但 Nvidia 仍深度嵌入 AI 運算堆疊的其他重要環節。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 表示,Jalapeño 在三個大型語言模型測試中,峰值吞吐量的每瓦 AI 工作量比 Nvidia GB200 與 GB300 系統高出 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。
OpenAI 表示,Jalapeño 在三個大型語言模型測試中,峰值吞吐量的每瓦 AI 工作量比 Nvidia GB200 與 GB300 系統高出 1.5 至 1.9 倍,端到端延遲則低 1.7 至 3.6 倍。 Jalapeño 是 OpenAI 與 Broadcom 共同開發、專為推論設計的 ASIC,額定功耗 700 瓦;在公布的測試工作負載中,持續功耗維持在 550 瓦或以下。OpenAI 計畫於 2026 年底小量部署,並在 2027 年擴大部署。
這並非完全公平的世代比較:Jalapeño 使用 HBM4 記憶體,而受測的 Blackwell 系統不具備相同記憶體技術;Nvidia Rubin 因此可能是更合適的比較對象。