| GPT-5.6 Terra – balanserad | 2 dollar | 12 dollar | 20 procent lägre, från 2,50 respektive 15 dollar |
| GPT-5.6 Sol – flaggskeppsmodell | 5 dollar | 30 dollar | Oförändrat, men får Fast-läge |
Lunas sammanlagda pris för indata och utdata är nu 1,40 dollar per miljon tokens, vilket placerar modellen bland de billigaste avancerade modellerna på marknaden . För Terra blir motsvarande summa 14 dollar per miljon tokens.
Sol får samtidigt ett Fast-läge som enligt OpenAI kan ge upp till 2,5 gånger högre hastighet än standardläget. Fast-läget kostar dubbelt så mycket som standardbearbetning och ska inte innebära någon försämring av modellens intelligens .
Den mest uppseendeväckande delen av beskedet är inte bara prissänkningen, utan hur OpenAI säger att den blev möjlig. Den 29 juli uppgav företaget att GPT-5.6 Sol autonomt hade skrivit om och optimerat produktionskoden för de GPU-kärnor som kör modellerna .
Via utvecklingsmiljön Codex kopplade modellen upp sig mot OpenAI:s interna infrastruktur, utformade och körde hundratals arkitekturexperiment, startade och övervakade driftsättningar och itererade utifrån resultaten . Den lärde sig dessutom syntaxen i Triton och Gluon, programmeringsspråk som används i OpenAI:s kärnprogramvara .
OpenAI uppger följande resultat :
Spekulativ avkodning är en teknik där en mindre så kallad utkastmodell förutsäger kommande tokens i förväg. Den större modellen kan då arbeta snabbare genom att godkänna eller korrigera dessa förslag.
Vinsterna kom enligt rapporterna från flera delar av AI-stacken. OpenAI ska bland annat ha förbättrat lastbalanseringen, så att förfrågningar fördelas efter geografisk placering, acceleratorer och tillgång till cache .
Även promptcache spelar en roll. Cachelagrad indata kan vara 90 procent billigare än ny indata, och cacheminnet har en livslängd på omkring 30 minuter . För utvecklare som återanvänder samma kodbas eller kontext kan det därför löna sig att hålla en session aktiv i stället för att börja om från början varje gång.
OpenAI:s beslut att sänka Luna-priset så kraftigt direkt efter lanseringen kommer inte ur ett vakuum. På bara några veckor har flera konkurrenter förändrat kalkylen för vad avancerad AI bör kosta.
Kinesiska Moonshot AI släppte den 17 juli modellen Kimi K3, som beskrivs som en modell med öppna vikter och 2,8 biljoner parametrar . I vissa tester av frontend-programmering matchade eller överträffade den GPT-5.6 Sol och Anthropics Fable 5 .
På Arenas topplista för frontendkodning fick Kimi K3 1 679 poäng och placerade sig före GPT-5.6 Sol och Fable 5 . En oberoende studie från Startrise AI Labs den 30 juli fann samtidigt att Kimi K3 låg nära Claude Opus 5 i ett test av frontendutveckling, men till en betydligt lägre kostnad: 7,17 dollar för hela testsviten jämfört med 21,17 dollar för Opus 5 .
Microsoft uppges dessutom ha övervägt att testa Kimi K3 i Copilot. Om modellen kan ersätta dyrare alternativ i vissa arbetsflöden skulle det enligt rapporter kunna spara Microsoft upp till 600 miljoner dollar, eller 60 procent per token .
Anthropic lanserade Claude Opus 5 den 24 juli för 5 dollar per miljon indatatokens – hälften av priset för Fable 5 – och modellen uppges slå Fable 5 i flera tester . Det ökar pressen på just det premiumsegment där GPT-5.6 Sol konkurrerar.
Google och Microsoft lanserade också flera mer kostnadseffektiva modeller under juli, vilket pressar priserna i både mellan- och budgetsegmenten . För OpenAI blir resultatet en marknad där kunderna lättare kan byta modell beroende på uppgift, kostnad och krav på prestanda.
OpenAI tycks därför positionera Luna som ett prisledande alternativ för stora volymer och enklare arbetsuppgifter, medan Sol ska motivera sitt högre pris med avancerad problemlösning och premiumhastighet .
Samtidigt som modellpriserna sjunker ökar kraven på kontroll över den totala AI-förbrukningen. Särskilt AI-agenter, som kan utföra långa kedjor av uppgifter på egen hand, har gjort det viktigare för företag att kunna sätta tydliga gränser.
Den 22 juli 2026 införde OpenAI hårda månatliga utgiftstak för sitt API . Administratörer kan sätta gränser på organisations- eller projektnivå. När taket nås stoppas nya API-anrop och returnerar ett HTTP 429-fel, i stället för att bara skapa en varning . Gränsen återställs när nästa faktureringsperiod börjar .
Det skiljer sig från tidigare mjuka gränser och kontrollpaneler, som främst visade hur mycket organisationen hade förbrukat. Med ett hårt tak kan företaget faktiskt förhindra att kostnaden fortsätter att växa.
Amazon och andra stora företag uppges också införa interna eller kundrelaterade begränsningar för AI-utgifter när de granskar avkastningen på investeringarna . Reuters beskriver hur inköpsavdelningar i allt högre grad behandlar AI på samma sätt som molntjänster: med separata budgetar, begränsade tilldelningar och godkännanden på CIO-nivå för större utrullningar .
För utvecklare och företag som använder OpenAI:s API är effekten på kort sikt tydlig:
Den större slutsatsen är att AI-priskriget har gått in i en ny fas. Kostnaderna pressas inte bara av nya modeller och billigare konkurrenter, utan också av effektivare infrastruktur – i det här fallet delvis genom att en AI-modell själv optimerade koden som kör AI-modeller.
För företag innebär det sannolikt lägre priser, men också hårdare krav på uppföljning. Att välja rätt modell för rätt uppgift, återanvända cachelagrad kontext och sätta ett faktiskt utgiftstak blir allt viktigare när AI går från experiment till löpande drift.