OpenAI uppger att Jalapeño levererade 1,5–1,9 gånger mer AI arbete per watt och 1,7–3,6 gånger lägre total fördröjning än de testade Nvidia systemen GB200 och GB300 i augusti 2026. Testerna använde GPT OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T i SemiAnalysis benchmark InferenceX.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI:s första detaljerade resultat för Jalapeño gör ett avgränsat påstående: det egenutvecklade chippet kan köra stora språkmodeller med lägre energiförbrukning och kortare svarstid än de specifika Nvidia-system som användes som jämförelse. I SemiAnalysis offentliga benchmark InferenceX uppgav OpenAI 1,5–1,9 gånger mer AI-arbete per watt och 1,7–3,6 gånger lägre total fördröjning för tre öppna modeller.
Det är betydelsefullt för ett företag som hanterar AI-förfrågningar i mycket stor skala. Men det är inte samma sak som att Jalapeño har bevisats vara en snabbare eller billigare ersättare för GPU:er i alla sammanhang. Testerna var begränsade, chippet är byggt enbart för inferens och resultaten togs i huvudsak fram av OpenAI på tekniska provexemplar. 14
OpenAI jämförde Jalapeño med Nvidia GB200- och GB300-system i InferenceX, ett test som försöker mäta hela processen från en AI-förfrågan till ett färdigt svar. Effektivitetssiffrorna normaliserades med hjälp av acceleratorernas publicerade effektklasser.
I de redovisade testerna uppnådde Jalapeño:
Den största redovisade skillnaden i svarstid gällde DeepSeek R1 670B. Där slutförde Jalapeño en förfrågan på 1,65 sekunder, jämfört med 5,99 sekunder för det GB300-baserade systemet. 1112
Det handlar om relativa benchmarkresultat – inte om ett löfte om att ChatGPT alltid kommer att svara lika mycket snabbare eller att API-priserna kommer att sänkas i motsvarande grad. Den faktiska prestandan påverkas bland annat av modell, servermjukvara, batchning, nätverk, kontextlängd, svarslängd och om målet är låg fördröjning eller hög genomströmning.
Benchmarken omfattade tre offentligt tillgängliga modeller med öppna vikter:
| Modell | Nvidia-jämförelse | Redovisat resultat för Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Cirka 1,9 gånger mer arbete per watt; 1,03 sekunder jämfört med 1,80 sekunder i total svarstid |
| DeepSeek R1 670B | GB300 | Cirka 1,7 gånger mer arbete per watt; 1,65 sekunder jämfört med 5,99 sekunder |
| Kimi K2.5 1T | GB300 | Cirka 1,5 gånger mer arbete per watt; 1,56 sekunder jämfört med 5,31 sekunder |
Siffrorna ovan kommer från redovisade benchmarksammanfattningar, inte från ett fullständigt och oberoende återtest av hela testsviten. 61112
Arbetslasten var nominellt enkelriktad, med 8 000 indatatoken och 1 000 utdatatoken. Det ger en kontrollerad jämförelse, men speglar inte all AI-trafik i produktion. Testet lämnar viktiga frågor obesvarade om flerturnssamtal, verktygsanrop, agentarbetsflöden, svar med varierande längd, batchning och mycket långa kontexter. 813
Benchmarken mätte dessutom bestämda kombinationer av hårdvara och mjukvara. Förändringar i kompilatorer, kärnor, kvantisering, schemaläggning, modellarkitektur eller Nvidias programvarustack kan påverka hur stort avståndet mellan systemen blir.
Jalapeño är en ASIC, alltså en applikationsspecifik integrerad krets, som OpenAI har utvecklat tillsammans med Broadcom för inferens i stora språkmodeller. Till skillnad från en generell GPU är den optimerad för att köra redan tränade modeller och generera svar. 15
De rapporterade specifikationerna på systemnivå omfattar:
Den rapporterade B0-versionen använder en beräkningskrets i retikelstorlek, tillverkad hos TSMC med N3P-processen, och är specificerad till 13,4 PFLOPS MXFP4-beräkningar. 18
Arkitekturen bygger på ett helhetsperspektiv snarare än på ett fristående acceleratorchip. Minne, sammankoppling, nätverk och kommunikation mellan rack är centrala delar av systemet, eftersom mycket stora modeller ofta måste fördelas över många chip. 1819
OpenAI och Broadcom ska enligt rapporter ha gått från koncept till så kallad tape-out – steget när chipdesignen skickas till tillverkning – på ungefär nio månader. Det är en ovanligt kort tidsram för ett högpresterande specialchip. 720
AI-baserade verktyg användes som en del av konstruktionsprocessen. Det betyder däremot inte att en AI-modell självständigt designade och tillverkade processorn. Den rapporterade utvecklingen krävde fortfarande mänskliga arkitekt- och ingenjörsteam, Broadcoms arbete med halvledarimplementation, tillverkningspartner och systemintegration. 713
Den mer försiktiga slutsatsen är att OpenAI använde sin kunskap om språkmodellernas arbetslaster – tillsammans med AI-verktyg i ingenjörsarbetet – för att samutveckla hårdvara och mjukvara kring ett smalt användningsområde. En sådan specialisering kan ge högre effektivitet, men minskar också flexibiliteten jämfört med en programmerbar GPU.
Jalapeño är byggt för att köra färdigtränade modeller, inte för att träna nya banbrytande modeller. OpenAI kommer därför även fortsättningsvis att behöva programmerbara acceleratorer, särskilt GPU:er, för modellträning, forskning, experiment och arbetslaster som inte passar ett mer låst inferenschip. 813
Det begränsar också betydelsen av formuleringen att Jalapeño skulle ”slå Nvidia”. Chippet kan prestera bättre än de testade Nvidia-konfigurationerna i vissa inferensmått, samtidigt som Nvidia-hårdvara fortfarande är viktig på andra delar av OpenAI:s beräkningsplattform. Ett specialiserat ASIC kan vara mycket bra på ett förutsägbart jobb i stor skala utan att ersätta den bredare plattform som krävs för träning och snabba modellförändringar.
Resultaten bör läsas som ”bättre i de här redovisade testerna”, inte som ”världens bästa AI-system i alla avseenden”. Flera reservationer är viktiga:
Det finns inte heller stöd i dessa resultat för att hävda en generell kostnadsminskning på 50 procent, ett garanterat lägre API-pris eller att Nvidia omedelbart kommer att trängas undan. Underlaget stöder prestanda- och effektivitetsanspråk under angivna förhållanden – inte bredare kommersiella slutsatser.
OpenAI planerar att börja använda Jalapeño i sin egen infrastruktur i slutet av 2026. Volymproduktion och en bredare utrullning väntas under 2027. På längre sikt talar bolaget om datacenter i gigawattskala tillsammans med Microsoft och andra infrastrukturpartner, över flera chipgenerationer. 16
Chippet är främst avsett för OpenAI:s interna efterfrågan och ska inte säljas som en generell processor på marknaden. Andra företag bör därför inte räkna med att kunna köpa Jalapeño-hårdvara eller hyra en offentlig molninstans med Jalapeño utifrån dessa besked. 16
Genom att behålla hårdvaran internt kan OpenAI optimera den för sina egna modeller, kärnor och system för modellservering. Bolaget slipper också de krav på mjukvarustöd, kundrelationer, försäljning och ekosystem som följer med att bli en traditionell chiptillverkare. Det senare är en strategisk tolkning; det bekräftade är att planen gäller intern användning och inte extern chipförsäljning. 16
Jalapeño bör ses som en del av OpenAI:s bredare beräkningsstrategi. Företaget kombinerar kapacitet från Microsoft och andra molnpartner, Nvidia-klassade GPU:er för flexibla och träningsintensiva arbetslaster samt egenutvecklad hårdvara för stabila inferensarbetslaster där specialisering kan löna sig. OpenAI beskriver själv sin beräkningsportfölj som omfattande Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy och SoftBank.
Strategin speglar en större förändring i branschen. Google utvecklar TPU:er, Amazon erbjuder Trainium och Inferentia, Microsoft har Maia och AMD konkurrerar med generella AI-GPU:er. Nvidia fortsätter samtidigt att leverera brett programmerbara system. Anthropic satsar också på allt mer anpassad infrastruktur genom sina molnrelationer, även om det tillgängliga benchmarkunderlaget inte ger någon direkt prestandajämförelse med Anthropics system.
Den kortsiktiga strategiska effekten är därför mer nyanserad än en berättelse om att GPU:er ersätts. Jalapeño kan ge OpenAI större kontroll över kostnader, svarstider, leveranser och den egna hårdvarukartan. Nvidia förblir viktigt för träning och flexibilitet, medan OpenAI:s specialchip ger ett alternativ för de förutsägbara och högvolymbaserade inferensarbetslaster som dominerar företagets egen infrastruktur. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI uppger att Jalapeño levererade 1,5–1,9 gånger mer AI arbete per watt och 1,7–3,6 gånger lägre total fördröjning än de testade Nvidia systemen GB200 och GB300 i augusti 2026.
OpenAI uppger att Jalapeño levererade 1,5–1,9 gånger mer AI arbete per watt och 1,7–3,6 gånger lägre total fördröjning än de testade Nvidia systemen GB200 och GB300 i augusti 2026. Testerna använde GPT OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T i SemiAnalysis benchmark InferenceX.
Jalapeño är ett 700 watts ASIC chip för enbart inferens, utvecklat tillsammans med Broadcom.