Este benchmark testa planejamento, uso de ferramentas e capacidade de agente em linha de comando — um "teste brutal" da habilidade de um modelo operar autonomamente em um terminal Y. Pontuações relatadas:
| Modelo | Pontuação no Terminal-Bench 2.1 |
|---|---|
| GPT-5.6 Sol Ultra | 91,9% BI |
| GPT-5.6 Sol | 88,8% B |
| Claude Mythos 5 | 88,0% I |
| GPT-5.5 | 83,4% BI |
O Sol Ultra com 91,9% representa um salto significativo — aproximadamente 4 pontos percentuais à frente do melhor modelo da Anthropic e mais de 8 pontos à frente do GPT-5.5 BI.
A OpenAI classifica todos os três modelos GPT-5.6 como "Alto" tanto em risco de segurança cibernética quanto biológico, mas nenhum ultrapassa o limite "Crítico" A.
| Modelo | Entrada (US$/1M tokens) | Saída (US$/1M tokens) | Função |
|---|---|---|---|
| GPT-5.6 Sol | US$ 5,00 | US$ 30,00 | Principal — raciocínio complexo, programação, segurança cibernética, trabalho agente de longo horizonte |
| GPT-5.6 Terra | US$ 2,50 | US$ 15,00 | Equilibrado — iguala o desempenho do GPT-5.5 pela metade do custo |
| GPT-5.6 Luna | US$ 1,00 | US$ 6,00 | Volume — mais rápido e econômico para classificação, extração, roteamento |
A OpenAI também introduziu cache de prompt para o GPT-5.6. Gravações em cache são cobradas a 1,25x a taxa de entrada não armazenada em cache do modelo, enquanto as leituras em cache recebem um desconto de 90% nos tokens de entrada em cache. O GPT-5.6 suporta pontos de interrupção de cache explícitos e uma vida útil mínima de cache de 30 minutos H.
Motivo principal: Intervenção direta do governo dos EUA. O governo Trump pediu explicitamente que a OpenAI restringisse o acesso antes do lançamento, citando preocupações de segurança nacional TAK. Funcionários da Casa Branca aprovaram pessoalmente, uma a uma, as aproximadamente 20 organizações parceiras AI.
O governo considerou que o GPT-5.6 tinha capacidade "semelhante ao Mythos" — referindo-se ao Claude Mythos da Anthropic, cujo predecessor (Claude Fable 5) foi suspenso forçosamente em todo o mundo pelo Departamento de Comércio em 12 de junho de 2026, sob regras de controle de exportação A. A restrição do GPT-5.6 decorre da mesma estrutura política.
A OpenAI declarou publicamente que esse tipo de controle governamental "impede que as melhores ferramentas cheguem a usuários, desenvolvedores, empresas, defensores cibernéticos e parceiros globais que precisam delas" A.
A OpenAI afirma que "pretende expandir a disponibilidade o mais rápido possível", mas não anunciou uma data de disponibilidade geral H. Sam Altman disse que espera um acesso mais amplo "em algumas semanas" A. O system card da empresa observa: "Acreditamos no acesso amplo e planejamos disponibilizar o GPT-5.6 Sol, Terra e Luna geralmente nas próximas semanas" D.
Por enquanto, o modelo de IA mais poderoso já lançado pela OpenAI está disponível apenas para quem Washington aprovar.