OpenAI表示,Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T的指定推理測試中,較對比的Nvidia GB200及GB300系統更慳電、回應更快。[4][7] 三款模型整體而言,Jalapeño的峰值吞吐量每瓦高1.5至1.9倍,端到端延遲低1.7至3.6倍。[4] 以DeepSeek R1 MXFP4為例,OpenAI報稱Jalapeño可達約700 tokens/秒/用戶,而GB300約169 tokens/秒/用戶。[4]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip, co developed with Broadcom, demonstrate in its latest benchmarks against Nvidia’s GB200 an. Article summary: OpenAI says Jalapeño, its first Broadcom co developed custom accelerator, beats the compared Nvidia GB200/GB300 rack systems on the tested inference workloads in both energy efficiency and response speed.. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
OpenAI公布了首批Jalapeño實測數據,聲稱這款與Broadcom共同開發的自研AI加速器,在指定大型語言模型推理工作負載中,無論能源效益還是回應速度,都勝過對比的Nvidia GB200及GB300機櫃系統。47
不過要留意,這些是OpenAI公布的早期、廠商報告式結果,並不等同於涵蓋所有生產環境AI工作負載的獨立「蘋果對蘋果」測試。
OpenAI以GPT‑OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T作測試。在三款模型上,Jalapeño聲稱可在峰值吞吐量下做到每瓦多處理1.5至1.9倍AI工作,端到端延遲則低1.7至3.6倍。4
幾組較具體的數字如下:
「每位用戶每秒token數」較貼近互動式AI的體感速度;至於「每千瓦吞吐量」則反映系統在耗電限制下能處理幾多工作。兩者同時提升,正是OpenAI強調Jalapeño的地方。
Jalapeño並非以通用GPU為基礎,再透過軟件調校來處理LLM推理,而是從零開始針對推理工作負載設計的專用加速器。OpenAI負責加速器架構,Broadcom負責矽實作及網絡部分,Celestica則負責電路板、機櫃及整套系統整合。1
公開披露的機櫃級設計採用大型互聯網絡域,讓工作負載盡量留在同一套系統內;模型狀態,包括KV cache,亦會按設計在本地放置及保留,以減少晶片之間搬運數據,以及因通訊造成的停頓。4
另一個重點是,Jalapeño沒有把prefill(處理提示詞)和decode(逐個生成token)分拆到兩組獨立資源。OpenAI的設計是由同一批可靈活調配的運算、記憶體及網絡資源處理兩個階段。前者較偏重運算,後者則較受記憶體頻寬影響,因此如何平衡兩者,會直接影響互動式回應速度。4
至於完整硬件規格,目前公開資料仍有限。一份技術報告形容系統由128枚晶片組成,約有1.7 exaFLOPS運算力及27TB HBM;但OpenAI公布的測試文章本身,沒有列出完整的機櫃物料清單。4
OpenAI表示,Jalapeño由最初設計到送廠流片只用了9個月,並形容這是高性能ASIC非常快的開發周期。1
公司亦稱,旗下模型曾協助設計、實作方案探索、量度、驗證、算術電路優化及編程。OpenAI表示,結合Codex與GPT‑Astra後,團隊在兩個月內,令三款原本未有計劃支援的開放權重模型達到高性能;在部分GPT‑OSS注意力及混合專家(MoE)模組中,由AI生成的實作比原有人工編寫版本快1.5至1.8倍。4
但要分清楚:這些是個別模組的結果,並不是整個模型都提升1.5至1.8倍。4
Jalapeño的結果來自SemiAnalysis公開的InferenceX基準測試。測試採用名義上單輪、8k token輸入及1k token輸出的工作負載,量度完整請求服務流程;系統則按相近的用戶體驗比較,並以公開的晶片功耗額定值作標準化處理。47
功耗計算方式尤其值得留意。OpenAI列出的Jalapeño封裝功耗為700W,但表示在這些工作負載下,持續實測功耗為550W或以下;GB200及GB300則分別按1,200W及1,400W建模。因此,每瓦優勢會受到工作負載及功耗計算口徑影響。4
SemiAnalysis表示曾在OpenAI實驗室見證測試,但沒有自行跑完整套基準。該機構亦提醒,單輪8k/1k的InferenceX設定沒有涵蓋較長上下文、多輪代理式工作負載、路由、前綴快取、快取管理或數據卸載等情況;這些因素在實際生產環境可能大幅改變表現。4
另外,這是一場有時間限制的比較。GB200及GB300屬商用Blackwell世代系統,未來更新一代的Nvidia平台或許會是更合適的對手。Nvidia亦曾按MLPerf另一套離線測試方法公布GB300執行DeepSeek R1的吞吐量,因此不能直接拿那些數字,與Jalapeño的互動式每位用戶token數比較。24
OpenAI計劃在2026年年底前,先把少量Jalapeño系統部署到自己的運算基礎設施,2027年再增加容量。公司表示第二代產品已進入深入開發階段,第三代亦開始成形。46
現階段OpenAI沒有計劃對外出售Jalapeño。硬件副總裁Richard Ho表示,公司內部需求太高,難以想像會向外部客戶供貨。6
這並不是OpenAI要全面取代Nvidia或AMD,而是想補充現有加速器供應。由於Jalapeño主要針對推理,並不處理訓練,OpenAI仍會繼續大規模採用Nvidia、AMD及其他合作夥伴的加速器,亦會用它們應付部分推理需求。46
Google早已以TPU同時支援訓練及推理,Amazon和Microsoft亦有自家AI晶片,Anthropic則表示正建立內部晶片設計團隊。Jalapeño令OpenAI加入這場垂直整合競賽,但目前所謂優勢,仍應準確理解為:在已披露的基準設定下,針對LLM推理的表現主張,而不是對所有AI運算場景的全面勝出。6
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
OpenAI表示,Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T的指定推理測試中,較對比的Nvidia GB200及GB300系統更慳電、回應更快。[4][7]
OpenAI表示,Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T的指定推理測試中,較對比的Nvidia GB200及GB300系統更慳電、回應更快。[4][7] 三款模型整體而言,Jalapeño的峰值吞吐量每瓦高1.5至1.9倍,端到端延遲低1.7至3.6倍。[4]
以DeepSeek R1 MXFP4為例,OpenAI報稱Jalapeño可達約700 tokens/秒/用戶,而GB300約169 tokens/秒/用戶。[4]