Este benchmark evalúa la planificación, el uso de herramientas y la capacidad de agente autónomo en la línea de comandos, una "prueba brutal" de la capacidad de un modelo para operar de forma autónoma en un entorno de terminal Y. Puntajes reportados:
| Modelo | Puntaje en Terminal-Bench 2.1 |
|---|---|
| GPT-5.6 Sol Ultra | 91.9 % BI |
| GPT-5.6 Sol | 88.8 % B |
| Claude Mythos 5 | 88.0 % I |
| GPT-5.5 | 83.4 % BI |
El 91.9 % de Sol Ultra representa un salto significativo: aproximadamente 4 puntos porcentuales por delante del mejor modelo de Anthropic y más de 8 puntos por delante de GPT-5.5 BI.
OpenAI clasifica los tres modelos GPT-5.6 como de riesgo "Alto" tanto en ciberseguridad como en riesgo biológico, pero ninguno supera el umbral "Crítico" A.
| Modelo | Entrada ($/1M tokens) | Salida ($/1M tokens) | Función |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | Insignia: razonamiento complejo, codificación, ciberseguridad, trabajo de agente de largo horizonte |
| GPT-5.6 Terra | $2.50 | $15.00 | Equilibrado: iguala el rendimiento de GPT-5.5 a la mitad del costo |
| GPT-5.6 Luna | $1.00 | $6.00 | Volumen: el más rápido y rentable para clasificación, extracción y enrutamiento |
OpenAI también introdujo el almacenamiento en caché de indicaciones para GPT-5.6. Las escrituras en caché se facturan a 1.25 veces la tarifa de entrada sin caché del modelo, mientras que las lecturas de caché reciben un 90 % de descuento en los tokens de entrada en caché. GPT-5.6 admite puntos de interrupción de caché explícitos y una vida útil mínima de caché de 30 minutos H.
Razón principal: intervención directa del gobierno de EE. UU. La administración Trump solicitó explícitamente a OpenAI que restringiera el acceso antes del lanzamiento, citando preocupaciones de seguridad nacional TAK. Los funcionarios de la Casa Blanca autorizaron personalmente, una por una, a las aproximadamente 20 organizaciones socias aprobadas AI.
La administración consideró que GPT-5.6 tenía una capacidad "similar a Mythos", en referencia a Claude Mythos de Anthropic, cuyo predecesor (Claude Fable 5) fue suspendido forzosamente en todo el mundo por el Departamento de Comercio el 12 de junio de 2026, bajo las normas de control de exportaciones A. La restricción de GPT-5.6 se deriva del mismo marco regulatorio.
OpenAI declaró públicamente que este tipo de control gubernamental "aleja las mejores herramientas de los usuarios, desarrolladores, empresas, defensores cibernéticos y socios globales que las necesitan" A.
OpenAI dice que "planea expandir la disponibilidad tan pronto como sea posible", pero no ha anunciado una fecha de disponibilidad general H. Sam Altman ha declarado que espera un acceso más amplio "en cuestión de semanas" A. La tarjeta de sistema de la compañía señala: "Creemos en el acceso amplio, y planeamos poner GPT-5.6 Sol, Terra y Luna a disposición general en las próximas semanas" D.
Por ahora, el modelo de IA más potente jamás lanzado por OpenAI solo está disponible para aquellos que Washington aprueba.