OpenAI rapporterte at Jalapeño leverte 1,5–1,9 ganger mer AI arbeid per watt og 1,7–3,6 ganger lavere ende til ende forsinkelse enn de testede Nvidia GB200 og GB300 systemene i august 2026. Testene brukte GPT OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T på SemiAnalysis’ InferenceX benchmark.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAIs første detaljerte resultater for Jalapeño gir et tydelig, men avgrenset bilde: Den spesialbygde brikken kan være mer energieffektiv og gi raskere svar enn de konkrete Nvidia GB200- og GB300-systemene som ble brukt i sammenligningen.
På SemiAnalysis’ offentlige InferenceX-benchmark rapporterte OpenAI 1,5–1,9 ganger mer AI-arbeid per watt og 1,7–3,6 ganger lavere ende-til-ende-forsinkelse på tvers av tre åpne modeller.
Det er oppsiktsvekkende for et selskap som håndterer enorme mengder AI-forespørsler. Men det er ikke det samme som å ha bevist at Jalapeño er en raskere eller billigere erstatning for GPU-er i alle situasjoner. Testene var begrensede, brikken er laget utelukkende for inferens, og tallene ble i hovedsak generert av OpenAI på tekniske prøvebrikker. 14
OpenAI sammenlignet Jalapeño med Nvidia-systemer basert på GB200 og GB300 i InferenceX, en test som skal måle hele prosessen fra en forespørsel sendes inn til svaret er ferdig. Effektivitetstallene ble normalisert ved hjelp av de publiserte effektverdiene for akseleratorene.
OpenAI rapporterte følgende resultater:
Den største rapporterte forskjellen i de oppgitte resultatene kom i testen med DeepSeek R1 670B. Jalapeño fullførte en forespørsel på 1,65 sekunder, mot 5,99 sekunder for GB300-systemet. 1112
Dette er relative benchmark-resultater – ikke et løfte om at ChatGPT alltid vil svare tilsvarende raskere, eller at API-prisene vil falle i samme takt. Ytelsen i praksis avhenger blant annet av modell, programvare, batching, nettverk, kontekstlengde, svarlengde og om man prioriterer lav ventetid eller høy samlet kapasitet.
Testen omfattet tre offentlig tilgjengelige modeller med åpne vekter:
| Modell | Nvidia-sammenligning | Rapportert resultat for Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Omtrent 1,9 ganger mer arbeid per watt; 1,03 sekunder mot 1,80 sekunder i ende-til-ende-forsinkelse |
| DeepSeek R1 670B | GB300 | Omtrent 1,7 ganger mer arbeid per watt; 1,65 sekunder mot 5,99 sekunder i forsinkelse |
| Kimi K2.5 1T | GB300 | Omtrent 1,5 ganger mer arbeid per watt; 1,56 sekunder mot 5,31 sekunder i forsinkelse |
Tallene over kommer fra publiserte sammendrag av testene, ikke fra en fullstendig, uavhengig reproduksjon av hele testpakken. 61112
Arbeidslasten var nominelt én enkelt tur, med 8 000 input-tokens og 1 000 output-tokens. Det gir et kontrollert sammenligningsgrunnlag, men dekker ikke hele bredden av trafikk i en faktisk AI-tjeneste. Resultatene sier blant annet lite om flertrinnssamtaler, verktøykall, agentarbeidsflyter, svar med varierende lengde, batching eller forespørsler med svært lang kontekst. 813
Testen må også forstås som en måling av bestemte kombinasjoner av maskinvare og programvare. Nye kompilatorer, kjerner, kvantisering, planlegging, modellarkitekturer eller oppdateringer i Nvidias programvarestakk kan endre forskjellen mellom systemene.
Jalapeño er en ASIC – en applikasjonsspesifikk integrert krets – som OpenAI har utviklet sammen med Broadcom for inferens i store språkmodeller. I motsetning til en generell GPU er den optimalisert for å kjøre ferdigtrente modeller og generere svar. 15
De rapporterte spesifikasjonene på systemnivå omfatter:
På brikkenivå bruker den rapporterte B0-versjonen en beregningsbrikke i retikkelstørrelse, produsert hos TSMC med N3P-prosess. Den er oppgitt til 13,4 PFLOPS MXFP4-beregninger. 18
Utformingen handler derfor om mer enn selve prosessoren. Minne, sammenkobling, nettverk og kommunikasjon mellom brikkene er sentrale deler av rack-plattformen. Store språkmodeller må ofte fordeles over mange brikker, og da kan dataflyten mellom dem bli like viktig som rå beregningskraft. 1819
OpenAI og Broadcom skal ha gått fra idé til «tape-out» – tidspunktet da et ferdig brikkedesign sendes til produksjon – på omtrent ni måneder. Det er svært kort tid for en avansert spesialbrikke. 720
Kunstig intelligens skal ha vært en del av utviklingsprosessen. Det betyr likevel ikke at en AI-modell alene designet og produserte prosessoren. Den rapporterte utviklingen involverte fortsatt menneskelige arkitekt- og ingeniørteam, Broadcoms arbeid med halvlederimplementering, produksjonspartnere og integrasjon av hele systemet. 713
Den mest nøkterne tolkningen er at OpenAI brukte sin kunnskap om språkmodellers arbeidslaster – sammen med AI-verktøy i ingeniørarbeidet – til å utvikle maskinvare og programvare mot et smalt og forutsigbart mål. Slik spesialisering kan gi bedre effektivitet, men innebærer også mindre fleksibilitet enn en programmerbar GPU.
Jalapeño er laget for å kjøre ferdigtrente modeller, ikke for å trene nye frontmodeller. OpenAI vil derfor fortsatt trenge programmerbare akseleratorer, særlig GPU-er, til modelltrening, forskning, eksperimentering og arbeidslaster som ikke passer godt til en fast spesialisert inferensbrikke. 813
Det begrenser også betydningen av påstanden om at Jalapeño «slår Nvidia». Brikken kan ha bedre resultater enn de testede Nvidia-konfigurasjonene på enkelte inferensmål, samtidig som Nvidia-maskinvare fortsatt er avgjørende andre steder i OpenAIs databehandlingsstakk.
En spesialisert ASIC kan være svært god på én forutsigbar oppgave i stort volum uten å erstatte den bredere plattformen som trengs for trening, raske modellendringer og forskning.
Resultatene bør leses som «bedre i disse rapporterte testene», ikke som «verdens beste AI-system totalt». Flere forbehold er viktige:
Det finnes heller ikke grunnlag i disse resultatene for å hevde en universell kostnadsreduksjon på 50 prosent, en garantert lavere API-pris eller at Nvidia umiddelbart vil bli skjøvet ut. Dokumentasjonen støtter ytelses- og effektivitetspåstander under bestemte betingelser – ikke bredere kommersielle konklusjoner.
OpenAI planlegger å begynne å ta Jalapeño i bruk i sin egen infrastruktur innen utgangen av 2026. Masseproduksjon og en bredere utrulling er ventet i 2027. På lengre sikt ser selskapet for seg datasentre i gigawatt-skala sammen med Microsoft og andre infrastrukturpartnere, over flere generasjoner med brikker. 16
Brikken er først og fremst ment for OpenAIs interne behov, ikke for salg som en standardprosessor. Andre selskaper bør derfor ikke regne med å kunne kjøpe Jalapeño-maskinvare eller leie en offentlig Jalapeño-skyinstans på bakgrunn av disse kunngjøringene. 16
Intern bruk gjør det mulig for OpenAI å optimalisere brikken mot egne modeller, kjerner og systemer. Det sparer også selskapet for kravene som følger med å bli en vanlig halvlederleverandør – som programvarestøtte, salg, kundekonkurranse og et bredt økosystem. Dette er en strategisk tolkning av modellen; det som er bekreftet, er at planen gjelder intern bruk fremfor eksternt brikkesalg. 16
Jalapeño bør forstås som én del av OpenAIs samlede strategi for datakraft. Selskapet kombinerer kapasitet fra Microsoft og andre skyleverandører, Nvidia-klasse-GPU-er til fleksible og treningsintensive oppgaver og egenutviklede brikker til stabile inferensarbeidslaster der spesialisering kan lønne seg. OpenAIs egen beskrivelse av porteføljen omfatter Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy og SoftBank.
Strategien speiler en bredere utvikling i bransjen. Google utvikler TPU-er, Amazon tilbyr Trainium og Inferentia, Microsoft har Maia, AMD konkurrerer med generelle AI-GPU-er, og Nvidia leverer fortsatt de mest allsidige, programmerbare systemene. Anthropic satser også på stadig mer tilpasset infrastruktur gjennom skypartnerne sine, selv om materialet her ikke gir grunnlag for en direkte ytelsessammenligning med Anthropics systemer.
Den kortsiktige betydningen er derfor mer nyansert enn en historie om at GPU-er blir erstattet. Jalapeño kan gi OpenAI større kontroll over kostnadene og svartidene for inferens, forsyningen og den videre maskinvareplanen. Nvidia forblir samtidig viktig for trening og fleksibel forskning, mens OpenAIs egen brikke gir selskapet et spesialisert alternativ for de forutsigbare og svært volumtunge tjenesteoppgavene som utgjør en stor del av infrastrukturen. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI rapporterte at Jalapeño leverte 1,5–1,9 ganger mer AI arbeid per watt og 1,7–3,6 ganger lavere ende til ende forsinkelse enn de testede Nvidia GB200 og GB300 systemene i august 2026.
OpenAI rapporterte at Jalapeño leverte 1,5–1,9 ganger mer AI arbeid per watt og 1,7–3,6 ganger lavere ende til ende forsinkelse enn de testede Nvidia GB200 og GB300 systemene i august 2026. Testene brukte GPT OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T på SemiAnalysis’ InferenceX benchmark.
Jalapeño er en 700 watts ASIC brikke for inferens, utviklet sammen med Broadcom.