Deze benchmark test planning, toolgebruik en 'agentic'-mogelijkheden op de commandoregel. Het is een 'meedogenloze test' van het vermogen van een model om autonoom te opereren in een terminalomgeving Y. Gerapporteerde scores:
| Model | Terminal-Bench 2.1-score |
|---|---|
| GPT-5.6 Sol Ultra | 91,9% BI |
| GPT-5.6 Sol | 88,8% B |
| Claude Mythos 5 | 88,0% I |
| GPT-5.5 | 83,4% BI |
Sol Ultra's 91,9% is een aanzienlijke sprong — ruwweg 4 procentpunten vooruit op Anthropics beste model en meer dan 8 punten vooruit op GPT-5.5 BI.
OpenAI classificeert alle drie de GPT-5.6-modellen als 'Hoog' voor zowel cybersecurity- als biologisch risico, maar geen enkele overschrijdt de 'Kritieke' drempel A.
| Model | Invoer ($/1M tokens) | Uitvoer ($/1M tokens) | Rol |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $30,00 | Vlaggenschip: complex redeneren, programmeren, cybersecurity, langdurig 'agentic' werk |
| GPT-5.6 Terra | $2,50 | $15,00 | Gebalanceerd: evenaart GPT-5.5-prestaties tegen de helft van de kosten |
| GPT-5.6 Luna | $1,00 | $6,00 | Volume: snelste en meest kostenefficiënte voor classificatie, extractie, routering |
OpenAI heeft ook prompt-caching geïntroduceerd voor GPT-5.6. Cache-schrijfbewerkingen worden gefactureerd tegen 1,25x het ongecachte invoertarief van het model, terwijl cache-leesbewerkingen 90% korting krijgen op de gecachte invoertokens. GPT-5.6 ondersteunt expliciete cache-breekpunten en een minimale cache-levensduur van 30 minuten H.
Belangrijkste reden: directe interventie van de Amerikaanse overheid. De Trump-regering verzocht OpenAI uitdrukkelijk om de toegang voor de release te beperken, met een beroep op nationale veiligheid TAK. Functionarissen van het Witte Huis keurden de ongeveer twintig goedgekeurde partnerorganisaties één voor één goed AI.
De regering beschouwde GPT-5.6 als 'Mythos-achtig' — verwijzend naar Anthropics Claude Mythos, wiens voorganger (Claude Fable 5) op 12 juni 2026 wereldwijd werd opgeschort door het Amerikaanse Ministerie van Handel op grond van exportcontroleregels A. De GPT-5.6-beperking komt voort uit hetzelfde beleidskader.
OpenAI verklaarde publiekelijk dat dit soort overheidscontrole 'de beste tools onthoudt aan gebruikers, ontwikkelaars, bedrijven, cyberverdedigers en wereldwijde partners die ze nodig hebben' A.
OpenAI zegt dat het 'van plan is de beschikbaarheid zo snel mogelijk uit te breiden', maar heeft geen datum voor algemene beschikbaarheid aangekondigd H. Sam Altman heeft verklaard dat hij bredere toegang 'binnen enkele weken' verwacht A. De systeemkaart van het bedrijf vermeldt: 'Wij geloven in brede toegang en we zijn van plan GPT-5.6 Sol, Terra en Luna in de komende weken algemeen beschikbaar te maken' D.
Voorlopig is het krachtigste AI-model dat ooit door OpenAI is uitgebracht, alleen beschikbaar voor wie Washington goedkeurt.