Questo benchmark valuta la pianificazione, l'uso di strumenti e la capacità agentica da riga di comando, una 'prova brutale' della capacità di un modello di operare in modo autonomo in un ambiente terminale Y. Punteggi riportati:
| Modello | Punteggio Terminal-Bench 2.1 |
|---|---|
| GPT-5.6 Sol Ultra | 91,9% BI |
| GPT-5.6 Sol | 88,8% B |
| Claude Mythos 5 | 88,0% I |
| GPT-5.5 | 83,4% BI |
Il 91,9% di Sol Ultra rappresenta un balzo significativo: circa 4 punti percentuali avanti al miglior modello di Anthropic e più di 8 punti avanti a GPT-5.5 BI.
OpenAI valuta tutti e tre i modelli GPT-5.6 come 'Alto' sia per il rischio informatico che per quello biologico, ma nessuno supera la soglia 'Critico' A.
| Modello | Input ($/1M token) | Output ($/1M token) | Ruolo |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $30,00 | Ammiraglia: ragionamento complesso, coding, cybersecurity, lavoro agentico a lungo termine |
| GPT-5.6 Terra | $2,50 | $15,00 | Bilanciato: eguaglia le prestazioni di GPT-5.5 a metà prezzo |
| GPT-5.6 Luna | $1,00 | $6,00 | Volume: il più veloce ed economico per classificazione, estrazione, instradamento |
OpenAI ha anche introdotto il prompt caching per GPT-5.6. Le scritture in cache vengono fatturate a 1,25x la tariffa di input non cached del modello, mentre le letture dalla cache ricevono uno sconto del 90% sui token di input cached. GPT-5.6 supporta punti di interruzione espliciti della cache e una durata minima della cache di 30 minuti H.
Motivo principale: l'intervento diretto del governo USA. L'amministrazione Trump ha esplicitamente chiesto a OpenAI di limitare l'accesso prima del rilascio, citando preoccupazioni per la sicurezza nazionale TAK. I funzionari della Casa Bianca hanno autorizzato personalmente, uno per uno, le circa 20 organizzazioni partner approvate AI.
L'amministrazione considerava GPT-5.6 come dotato di capacità 'simili a Mythos' – riferendosi a Claude Mythos di Anthropic, il cui predecessore (Claude Fable 5) era stato sospeso forzatamente in tutto il mondo dal Dipartimento del Commercio il 12 giugno 2026, nell'ambito delle norme sul controllo delle esportazioni A. La restrizione di GPT-5.6 deriva dallo stesso quadro normativo.
OpenAI ha dichiarato pubblicamente che questo tipo di controllo governativo 'tiene gli strumenti migliori lontani da utenti, sviluppatori, imprese, difensori informatici e partner globali che ne hanno bisogno' A.
OpenAI afferma di 'prevedere di espandere la disponibilità il prima possibile' ma non ha annunciato una data di disponibilità generale H. Sam Altman ha dichiarato di aspettarsi un accesso più ampio 'entro settimane' A. La scheda tecnica del sistema dell'azienda nota: 'Crediamo in un accesso ampio e prevediamo di rendere GPT-5.6 Sol, Terra e Luna generalmente disponibili nelle prossime settimane' D.
Per ora, il modello AI più potente mai rilasciato da OpenAI è disponibile solo per coloro che Washington approva.