De specifieke software-optimalisatie die OpenAI heeft ontwikkeld om de inferentiekosten met meer dan de helft te verlagen, is multi-model routing. Deze techniek stuurt eenvoudige queries automatisch door naar kleinere, goedkopere modellen, terwijl de krachtigste (en duurste) modellen worden gereserveerd voor complexe verzoeken .
Volgens branchegidsen levert de hybride aanpak een kostenreductie van 30-75% op de modellaag op door gebruik te maken van kwantisatie, distillatie en het selecteren van de juiste modelgrootte, gecombineerd met runtime-optimalisaties zoals batching, speculatieve decodering en KV-cache-beheer die 40-80% doorvoerwinst kunnen opleveren . OpenAI heeft dit verder geoperationaliseerd door 50% prijsverlagingen voor uitgestelde inferentie aan te bieden via zijn Batch API – mits klanten bereid zijn tot 24 uur te wachten op resultaten
.
Naast routing hebben ingenieurs van OpenAI aan The Information verteld dat de technieken zo krachtig zijn dat ze op een gegeven moment ChatGPT voor uitgelogde bezoekers draaiende hielden op slechts een paar honderd Nvidia GPU's .
Op 24 juni 2026 onthulden OpenAI en Broadcom Jalapeño, OpenAI's eerste op maat gemaakte inferentiechip . Belangrijke details:
OpenAI omschrijft de chip als "het eerste bouwblok in een meerjarige custom silicon-roadmap" om een eigen rekenstack op te bouwen en de prijsmacht van Nvidia te doorbreken . De chip is verticaal geïntegreerd – OpenAI gebruikt hem uitsluitend voor zijn eigen inferentieworkloads en verkoopt hem niet aan externe klanten
.
Belangrijke cijfers uit de aandeelhoudersdocumenten over Q1 2026:
De operationele marge van het bedrijf was ruwweg -122%, wat betekent dat het ongeveer $1,22 verloor voor elke verdiende dollar . Over heel 2025 boekte OpenAI ongeveer $38,5 miljard aan verliezen op $34 miljard aan uitgaven
.
OpenAI's kostenbesparende maatregelen passen in een bredere branchebrede prijzenoorlog die de economie van AI opnieuw vormgeeft:
De combinatie van software- en hardware-optimalisaties stelt OpenAI in staat zijn inferentiekosten mogelijk te halvereren, zelfs terwijl het schaalt. Maar het bedrijf opereert niet in een vacuüm. De bredere ineenstorting van de inferentieprijzen – gedreven door concurrenten, open-source alternatieven en gespecialiseerde hardware – betekent dat de prijsmacht in de hele industrie afbrokkelt .
Voor bedrijven is dit goed nieuws: de effectieve kosten van het draaien van AI-workloads dalen sneller dan de mogelijkheden groeien. OpenAI's Batch API biedt al 50% korting voor uitgestelde workloads, terwijl multi-model routing de kosten met 40-60% kan verlagen zonder kwaliteitsverlies . De vraag is of één enkele aanbieder een hogere prijs kan handhaven in een markt waar Chinese open-source modellen state-of-the-art mogelijkheden bieden voor een fractie van de kosten
.