| GPT-5.6 Terra | 2 dollar | 12 dollar | 20 procent lavere end 2,50/15 dollar |
| GPT-5.6 Sol | 5 dollar | 30 dollar | Uændret, men med ny Fast-tilstand |
Luna koster dermed samlet 1,40 dollar pr. million input- og outputtokens og placerer sig blandt de billigste frontier-modeller på markedet . Terra ender på en samlet pris på 14 dollar pr. million tokens.
Sol beholder sin standardpris. Med den nye Fast-tilstand kan modellen ifølge OpenAI levere op til 2,5 gange højere hastighed end standardbehandling til det dobbelte af standardprisen – uden ændringer i modellens intelligens .
Den mest opsigtsvækkende del af historien handler ikke kun om prislisten, men om hvordan OpenAI siger, at besparelserne blev skabt.
Den 29. juli oplyste OpenAI, at GPT-5.6 Sol autonomt havde omskrevet og optimeret virksomhedens produktions-GPU-kerner – den lavtliggende softwarekode, der rent faktisk får modellerne til at køre på grafikkortene .
Arbejdet blev udført gennem udviklingsmiljøet Codex. Her kunne modellen forbinde sig til OpenAIs interne infrastruktur, designe og køre hundredvis af arkitektureksperimenter, sætte udrulninger i gang, overvåge resultaterne og gentage processen . Den lærte også syntaks i Triton og Gluon, som indgår i OpenAIs kernel-stak .
OpenAI fremhæver især to målbare resultater :
Spekulativ dekodning er en teknik, hvor en mindre såkaldt klademodel først forudsiger de næste tokens. Den større model kan derefter kontrollere forudsigelserne hurtigere end ved at beregne hvert token fra bunden.
Effektiviseringerne omfattede ifølge rapporter også ændringer i resten af systemet. OpenAI forbedrede blandt andet belastningsbalanceringen, så forespørgsler kan fordeles efter geografi, accelerator-type og tilgængelig cache .
Prompt-caching spiller også en rolle. Cachelagret input er omkring 90 procent billigere end nyt input, og cachen har en levetid på cirka 30 minutter . Det kan især gøre en forskel for udviklere, der gentagne gange arbejder med den samme kodebase eller kontekst.
OpenAIs hurtige og markante prisreduktion skal ses i lyset af et AI-marked, hvor forskellen mellem dyrere proprietære modeller og billigere alternativer er blevet mindre.
Den kinesiske startup Moonshot AI lancerede 17. juli Kimi K3, en open-weight-model med 2,8 billioner parametre . Modellen matchede eller overgik GPT-5.6 Sol og Anthropics Fable 5 i flere tests af frontend-programmering .
På Arenas rangliste for frontend-kode opnåede Kimi K3 1.679 point og placerede sig foran både GPT-5.6 Sol og Fable 5 . En uafhængig test offentliggjort 30. juli af Startrise AI Labs fandt desuden, at Kimi K3 lå på niveau med Anthropics Claude Opus 5 i en frontend-test – men kostede 7,17 dollar at køre mod 21,17 dollar for Opus 5 .
Microsoft skulle samtidig have overvejet at teste Kimi K3 i Copilot. En integration kunne ifølge rapporterne potentielt spare Microsoft op til 600 millioner dollar, svarende til 60 procent pr. token .
Anthropic lancerede Claude Opus 5 den 24. juli til 5 dollar pr. million inputtokens – halvdelen af prisen på Fable 5. Modellen klarer sig bedre end Fable 5 i flere benchmarks . Det lægger pres på netop det premium-segment, hvor GPT-5.6 Sol konkurrerer.
Google og Microsoft lancerede desuden flere omkostningseffektive modeller i juli, hvilket øger presset på både mellemklassen og de billigste modeller .
I den nye prisstruktur fungerer Luna derfor som en slags tabsleder til opgaver med stor volumen og høj prisfølsomhed, mens Sol skal fastholde sin position som den avancerede premium-model .
Prispresset kommer samtidig med en bredere ændring i virksomhedernes måde at købe AI på. Mange virksomheder kræver nu faste budgetter og klare loft over forbruget – på samme måde som de allerede styrer cloud-udgifter.
Den 22. juli 2026 indførte OpenAI håndhævelige månedlige forbrugsgrænser i API-platformen . Det er noget andet end de tidligere bløde grænser i ChatGPT Enterprise, som primært gav administratorer indsigt i forbruget.
Med en hård grænse kan organisationer eller projekter sætte et maksimumbudget. Når grænsen er nået, fejler nye API-forespørgsler med en HTTP 429-fejl, indtil næste faktureringsperiode begynder . Funktionen fungerer dermed som en reel sikkerhedsventil mod uforudsete udgifter fra AI-agenter og automatiserede arbejdsgange.
Amazon og andre store virksomheder skulle også have indført interne eller kundevendte begrænsninger på AI-forbrug, mens de undersøger, om investeringerne giver et tilstrækkeligt afkast . Reuters beskriver udviklingen som et skifte, hvor virksomheder i stigende grad behandler AI på samme måde som cloud: med særskilte budgetter, forbrugslofter og godkendelse fra it-ledelsen ved større udrulninger .
Budskabet er tydeligt: Virksomheder vil ikke længere bare betale en ukontrolleret regning for at komme med på AI-bølgen. De vil have lavere enhedspriser og mulighed for at stoppe forbruget, før budgettet løber løbsk.
For udviklere og virksomheder, der bruger OpenAIs API, er konsekvenserne umiddelbart positive:
Den større pointe er, at AI-priskrigen ikke længere kun handler om, hvem der bygger den mest intelligente model. Den handler også om, hvem der kan køre modellerne billigst og tilbyde virksomhederne den bedste kontrol over deres forbrug.
OpenAIs prisreduktion viser, at udvikling af mere effektive modeller og infrastrukturer kan blive lige så afgørende som nye modelgenerationer. Hvis open-weight-modeller fortsætter med at nærme sig de proprietære alternativer, og hvis virksomhederne holder fast i stramme budgetter, må AI-købere forvente yderligere prispresset i hele branchen.