Tarkka kustannuksia leikkaava ohjelmisto-optimointi, jonka OpenAI on kehittänyt vähentääkseen päättelykustannuksia yli puolella, on multimallireititys. Tämä tekniikka ohjaa yksinkertaiset kyselyt automaattisesti pienempiin ja halvempiin malleihin, kun taas tehokkaimmat (ja kalleimmat) mallit varataan vain monimutkaisiin pyyntöihin .
Alan oppaiden mukaan hybridi lähestymistapa tuottaa 30–75 prosentin kustannussäästöt mallitasolla kvantisoinnin, tislauksen ja oikean kokoamisen avulla yhdistettynä suoritusaikaisiin optimointeihin, kuten eräajoihin, spekulatiiviseen dekoodaukseen ja KV-välimuistin hallintaan, mikä voi tuottaa 40–80 prosentin läpimenon parannuksia . OpenAI on myös ottanut tämän käyttöön tarjoamalla 50 prosentin hinnanalennuksia viivästetystä päättelystä Batch API -rajapintansa kautta – jos asiakkaat suostuvat odottamaan enintään 24 tuntia tuloksia
.
Reitityksen lisäksi OpenAI:n insinöörit ovat kertoneet The Informationille, että tekniikat ovat niin tehokkaita, että he palvelivat ChatGPT:tä uloskirjautuneille vierailijoilla vain parillasadalla Nvidian grafiikkaprosessorilla .
OpenAI kuvailee piiriä "ensimmäiseksi rakennuspalikaksi monivuotisessa räätälöidyssä piisuunnitelmassa" rakentaakseen oman laskentapinonsa ja vastatakseen Nvidian hinnoitteluvoimaan . Piiri on vertikaalisesti integroitu – OpenAI käyttää sitä yksinomaan omiin päättelytyökuormiinsa, eikä sitä myydä ulkoisille asiakkaille
.
Keskeisiä lukuja Q1 2026:n osakkeenomistaja-asiakirjoista:
Yhtiön liikevoittomarginaali oli noin -122 %, mikä tarkoittaa, että se menetti noin 1,22 dollaria jokaista ansaittua dollaria kohden . Vuonna 2025 kokonaisuudessaan OpenAI teki noin 38,5 miljardia dollaria tappiota 34 miljardin dollarin kuluilla
.
OpenAI:n kustannusleikkaukset sopivat laajempaan teollisuudenlaajuiseen hintasotaan, joka muokkaa tekoälyn taloutta:
Ohjelmisto- ja laitteisto-optimointien yhdistelmä antaa OpenAI:lle mahdollisuuden puolittaa päättelykustannuksensa samalla kun se skaalautuu. Mutta yhtiö ei toimi tyhjiössä. Päättelyhinnoittelun laajempi romahdus – kilpailijoiden, avoimen lähdekoodin vaihtoehtojen ja erikoistuneen laitteiston ajamana – tarkoittaa, että hinnoitteluvoima heikkenee koko toimialalla .
Yrityksille tämä on hyvä uutinen: tekoälytyökuormien tehokkaat kustannukset laskevat nopeammin kuin kyvyt kasvavat. OpenAI:n Batch API tarjoaa jo 50 prosentin alennuksia viivästetyistä työkuormista, kun taas multimallireititys voi leikata kustannuksia 40–60 prosenttia laadun kärsimättä . Kysymys kuuluu, voiko yksikään toimittaja ylläpitää premium-hinnoittelua markkinoilla, joilla kiinalaiset avoimen lähdekoodin mallit tarjoavat huipputason kyvykkyyden murto-osalla kustannuksista
.