| GPT-5.6 Terra — gebalanceerde optie | $2,00 | $12,00 | 20% lager, voorheen $2,50 en $15 |
| GPT-5.6 Sol — vlaggenschip | $5,00 | $30,00 | Ongewijzigd, met nieuwe Fast-modus |
Een token is een klein tekstonderdeel waarmee AI-gebruik wordt afgerekend. Bij Luna komt de som van invoer en uitvoer uit op $1,40 per miljoen tokens, waarmee het model tot de goedkoopste modellen in de frontierklasse behoort . Terra komt uit op $14 per miljoen tokens.
De nieuwe Fast-modus van Sol verwerkt verzoeken tot 2,5 keer sneller dan de standaardmodus. Daar staat wel een tarief van twee keer de standaardprijs tegenover; volgens OpenAI gaat de extra snelheid niet ten koste van de intelligentie van het model .
Het opvallendste onderdeel van de aankondiging is niet alleen de prijsdaling, maar de manier waarop OpenAI zegt die mogelijk te hebben gemaakt. Op 29 juli maakte het bedrijf bekend dat GPT-5.6 Sol zelfstandig productie-GPU-kernels had herschreven en geoptimaliseerd . Dat zijn stukken low-level software die bepalen hoe de modellen op GPU-hardware draaien.
Via de ontwikkelomgeving Codex kon Sol verbinding maken met de interne infrastructuur van OpenAI. Het model ontwierp en draaide honderden experimenten, startte implementaties, hield die in de gaten en verbeterde de resultaten stap voor stap . Daarbij leerde het werken met Triton en Gluon, programmeertalen die in de kernelstack van OpenAI worden gebruikt .
OpenAI rapporteert de volgende resultaten :
Bij speculative decoding voorspelt een kleiner zogenoemd draftmodel alvast mogelijke volgende tokens. Het grotere model hoeft daardoor minder berekeningen volledig opnieuw uit te voeren, wat de verwerking kan versnellen.
De verbeteringen gingen volgens rapporten verder dan alleen de GPU-code. OpenAI zou ook de load balancing hebben aangepast, zodat verzoeken dynamisch worden verdeeld op basis van onder meer geografische locatie, type accelerator en beschikbare cache . Daarnaast kan prompt caching — het tijdelijk bewaren van herhaalde invoer — de kosten van gecachte input met 90 procent verlagen. De cache blijft ongeveer 30 minuten beschikbaar .
De markt voor geavanceerde AI-modellen is in enkele weken tijd een stuk prijsgevoeliger geworden.
Moonshot AI bracht op 17 juli Kimi K3 uit, een open-weight model met 2,8 biljoen parameters. Het Chinese model wist op bepaalde benchmarks voor front-endprogrammeren GPT-5.6 Sol en Anthropic Fable 5 te evenaren of te verslaan . Op de Frontend Code-ranglijst van Arena behaalde Kimi K3 1.679 punten, meer dan GPT-5.6 Sol en Fable 5 .
Een onafhankelijke test van Startrise AI Labs, gepubliceerd op 30 juli, zette Kimi K3 bovendien op gelijke hoogte met Claude Opus 5 bij een test voor front-endengineering. Het volledige testpakket kostte volgens die studie $7,17 om met Kimi K3 uit te voeren, tegenover $21,17 met Opus 5 .
Kimi K3 werd daarmee het grootste open-weight AI-model ter wereld. Microsoft zou hebben overwogen om het model in Copilot te testen. Dat zou Microsoft volgens berichtgeving tot $600 miljoen kunnen besparen, oftewel 60 procent per token .
Anthropic lanceerde op 24 juli Claude Opus 5 voor $5 per miljoen invoertokens — de helft van de prijs van Fable 5. Het model presteert op verschillende benchmarks beter dan Fable 5 . Daarmee nam de druk vooral toe in het premiumsegment waarin GPT-5.6 Sol actief is.
Ook Google en Microsoft brachten in juli meerdere goedkopere modellen uit, waardoor vooral de midden- en budgetsegmenten onder druk kwamen te staan .
OpenAI lijkt Luna daarom bewust te gebruiken als een lokmodel voor toepassingen met grote volumes en een sterke focus op prijs. Sol blijft ondertussen de premiumoptie voor complexere redeneertaken .
De prijsverlagingen staan niet los van een bredere verandering bij zakelijke klanten. Bedrijven behandelen AI-uitgaven steeds meer zoals cloudkosten: met aparte budgetten, limieten en goedkeuring door het management . De vraag is niet meer alleen wat een model kan, maar ook wat elke taak kost en of de opbrengst dat rechtvaardigt.
OpenAI introduceerde op 22 juli harde maandelijkse bestedingslimieten voor zijn API-platform . Beheerders kunnen een limiet instellen voor een organisatie of afzonderlijk project. Zodra het maandbudget is opgebruikt, mislukken nieuwe API-verzoeken met een HTTP 429-fout totdat de volgende factureringscyclus begint .
Dat verschilt van een waarschuwing of dashboardmelding: een harde limiet stopt de verzoeken daadwerkelijk. Zo krijgen bedrijven een vangnet tegen onverwacht hoge kosten, bijvoorbeeld wanneer autonome AI-agents veel meer taken uitvoeren dan gepland.
Amazon en andere grote ondernemingen zouden eveneens interne of klantgerichte limieten voor AI-uitgaven invoeren terwijl ze de return on investment kritischer bekijken . De boodschap voor de markt is duidelijk: de periode waarin bedrijven zonder veel vragen steeds meer geld aan AI uitgaven, loopt ten einde.
Voor ontwikkelaars en bedrijven zijn de gevolgen op korte termijn gunstig:
De grotere ontwikkeling is de versnelling van de AI-prijsoorlog. Prijzen dalen niet alleen doordat concurrenten elkaar onderbieden, maar ook doordat de onderliggende infrastructuur efficiënter wordt. Dat een model helpt om de productiecode waarop het zelf draait te optimaliseren, maakt die ontwikkeling extra opvallend.
Voor zakelijke afnemers betekent dit waarschijnlijk dat de prijs per token verder zal dalen, maar ook dat kostenbeheer belangrijker wordt. Goedkopere modellen maken grootschalig gebruik mogelijk — harde budgetlimieten bepalen vervolgens hoe ver bedrijven daadwerkelijk gaan.