OpenAI 表示,Jalapeño 在 InferenceX 測試中,較對照的 Nvidia GB200、GB300 系統多提供 1.5–1.9 倍 AI 工作量/瓦,端到端延遲則降低 1.7–3.6 倍。 在 DeepSeek R1 測試中,Jalapeño 於最低 token 間隔下達到每位使用者約 700 tokens/秒,GB300 則為 169 tokens/秒。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip, co-developed with Broadcom, demonstrate in its latest benchmarks against Nvidia’s GB200 an. Article summary: OpenAI says Jalapeño, its first Broadcom co-developed custom accelerator, beats the compared Nvidia GB200/GB300 rack systems on the tested inference workloads in both energy efficiency and response speed. These are early. Topic tags: general, documentation, general web, education, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
OpenAI 首款自研 AI 加速器 Jalapeño,近日公布了與 Nvidia GB200、GB300 系統比較的初步推理測試結果。公司表示,這款晶片在每瓦 AI 工作量、端到端延遲,以及互動式回應速度等指標上都取得明顯優勢,測試涵蓋 GPT‑OSS 120B、DeepSeek R1 與 Kimi K2.5 1T。 34
不過,這些數據是 OpenAI 針對特定 InferenceX 設定公布的早期結果,並非涵蓋所有生產環境工作負載、也不是對 Nvidia 現有與未來平台的全面獨立比較。 47
在三個模型的測試中,OpenAI 表示 Jalapeño 在峰值吞吐量下,每瓦可處理的 AI 工作量高出 1.5–1.9 倍,端到端延遲則低 1.7–3.6 倍。針對高度互動的工作負載,效能提升幅度為 2.1–4.1 倍。 3
較具代表性的模型對比包括:
GPT‑OSS 120B 對 Nvidia GB200: Jalapeño 的峰值混合吞吐量為每千瓦 85,448 個單位,GB200 為 44,960。OpenAI 同時測得 1.03 秒的端到端延遲,GB200 則為 1.80 秒。在最低 token 間隔下,Jalapeño 約可達到每位使用者 1,459 tokens/秒,GB200 為 535 tokens/秒。 4
DeepSeek R1 MXFP4 對 Nvidia GB300: Jalapeño 的峰值混合吞吐量為每千瓦 19,641 個單位,GB300 為 11,781。端到端延遲分別為 1.65 秒與 5.99 秒。在最低 token 間隔下,OpenAI 回報 Jalapeño 約可提供每位使用者 700 tokens/秒,GB300 則為 169 tokens/秒。 46
Kimi K2.5 MXFP4 對 Nvidia GB300: OpenAI 表示,Jalapeño 的峰值每瓦吞吐量高出 1.5 倍,端到端延遲降低 3.4 倍;每位使用者的生成速度約為 694 tokens/秒,GB300 則為 182 tokens/秒。 4
「每位使用者 tokens/秒」主要反映互動體驗:也就是單一請求收到模型生成內容的速度,而不只是整個機櫃在大量並行請求下能產生多少 token。對聊天、寫程式與 AI 代理等應用而言,這項指標往往直接影響使用者感受到的回應是否即時。
Jalapeño 是針對大型語言模型推理設計的加速器,而不是在同時支援訓練與推理的通用 GPU 上進行調整。OpenAI 負責架構設計,Broadcom 負責晶片實作與網路,Celestica 則參與電路板、機櫃與系統整合。 1732
其機櫃級設計採用大規模互連網路,目標是讓工作負載盡可能留在同一套系統內。OpenAI 表示,系統會盡量把模型狀態——包括 KV cache——放在本地,藉此減少晶片之間的資料搬移,以及生成過程中可能造成延遲的通訊停頓。 46
Jalapeño 也沒有把 prefill 與 decode 固定分割到兩組獨立資源池。OpenAI 描述的設計,是讓運算、記憶體與網路資源可以在兩個階段之間彈性調度:prefill 負責處理提示詞,通常較受運算能力影響;decode 則逐一生成回答 token,往往更受記憶體搬移與頻寬限制。 46
目前公開的技術細節仍不完整。一份技術說明提到,相關系統由 128 顆晶片組成,約具備 1.7 exaFLOPS 運算能力與 27 TB HBM;但 OpenAI 的測試公告並未提供完整機櫃物料清單,也不足以讓外界獨立重現每一項結果。 4
OpenAI 表示,Jalapeño 從初步設計到製造投片(tape-out)只用了 9 個月,對先進客製化加速器而言是相當壓縮的開發週期。 1721
公司還表示,其模型曾協助設計探索、實作、效能量測、驗證、算術電路最佳化與程式設計。OpenAI 指出,搭配 GPT‑Astra 的 Codex 在兩個月內,協助讓三個原本未列入規畫的開放權重模型達到高效能。在部分 GPT‑OSS 注意力機制與混合專家(mixture-of-experts)區塊上,AI 產生的實作版本比既有人工撰寫版本快 1.5–1.8 倍。但這些數字只適用於特定模型區塊,不能直接視為完整模型服務效能。 4
Jalapeño 的亮眼數字仍需放回測試條件中解讀。
Jalapeño 的目標是服務已完成訓練的模型,並未設計用於模型訓練。因此,OpenAI 預期仍會使用 Nvidia、AMD 與其他加速器進行訓練,也會讓部分推理工作繼續運行在這些平台上。 46
換句話說,Jalapeño 比較像是 OpenAI 基礎設施中的專用補充,而不是能全面取代公司現有 GPU 系統的單一平台。
比較使用 SemiAnalysis 公開的 InferenceX 基準測試,設定為名義上的單輪請求,包括 8,000 個輸入 token 與 1,000 個輸出 token。測試量度完整請求服務流程,並以相近的使用者體驗比較系統,再按照公開的晶片功耗額定值進行正規化。 47
SemiAnalysis 表示,團隊曾在 OpenAI 實驗室見證測試執行,但沒有自行跑完整基準測試套件。該機構也提醒,這套測試並未涵蓋更長上下文、多輪 AI 代理工作負載、路由、前綴快取、快取管理或資料卸載等情境。這些軟體與服務架構選擇,都可能大幅改變實際生產環境的效能。 6
OpenAI 將 Jalapeño 的封裝功耗列為 700 瓦,並表示在測試工作負載下,持續實測功耗為 550 瓦或以下。對照系統則採用 GB200 1,200 瓦、GB300 1,400 瓦的模型估算值。因此,Jalapeño 所宣稱的每瓦優勢,部分取決於工作負載、功耗測量位置,以及採用何種功耗計算方式。 4
這次測試比較的是當時可取得的 GB200 或 GB300 最佳結果;但等到 Jalapeño 大規模部署時,Nvidia 的更新平台可能已成為更合適的比較對象。Nvidia 也以 MLPerf 不同的離線測試方法公布 GB300 執行 DeepSeek R1 的結果,這些數據不能直接與 Jalapeño 的互動式「每位使用者 tokens/秒」結果相提並論。 124
OpenAI 計畫在 2026 年底前,於自家運算基礎設施中有限部署 Jalapeño,並預期在 2027 年擴大容量。公司表示,第二代晶片已進入深度開發階段,第三代也開始成形。 46
目前 Jalapeño 是 OpenAI 內部使用的平台,並非外部企業可以購買或租用的晶片。OpenAI 硬體主管 Richard Ho 表示,內部需求已高到目前無法設想對外銷售。 6
因此,OpenAI 現階段的策略是補充,而非立即取代 Nvidia 與 AMD。由於訓練工作仍需要通用型加速器,未來基礎設施預計仍會採用多種硬體。Google 已自行開發可用於訓練與推理的 TPU;Amazon 與 Microsoft 也打造了自家 AI 晶片;Anthropic 同樣曾說明正在推進客製化晶片計畫。 6
Jalapeño 的早期結果顯示,針對特定工作負載打造的加速器,確實可能在互動式大型語言模型服務最重視的幾項指標上勝過通用系統,包括能源效率、端到端回應時間,以及每位使用者實際收到 token 的速度。
但目前證據支持的結論,比「OpenAI 已擊敗 Nvidia」更有限:這項領先只出現在指定模型、特定 InferenceX 工作負載,以及與 GB200、GB300 配置的比較中。Jalapeño 未來在更廣泛的生產流量、長上下文代理、不同軟體堆疊、接近訓練的工作負載,以及 OpenAI 擴大部署時 Nvidia 可提供的新系統上,能否維持優勢,仍有待觀察。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 表示,Jalapeño 在 InferenceX 測試中,較對照的 Nvidia GB200、GB300 系統多提供 1.5–1.9 倍 AI 工作量/瓦,端到端延遲則降低 1.7–3.6 倍。
OpenAI 表示,Jalapeño 在 InferenceX 測試中,較對照的 Nvidia GB200、GB300 系統多提供 1.5–1.9 倍 AI 工作量/瓦,端到端延遲則降低 1.7–3.6 倍。 在 DeepSeek R1 測試中,Jalapeño 於最低 token 間隔下達到每位使用者約 700 tokens/秒,GB300 則為 169 tokens/秒。
Jalapeño 是專為模型推理打造的加速器,並非訓練用 GPU;OpenAI 計畫在 2026 年底前於自家運算基礎設施進行有限部署,暫不對外銷售。