OpenAI a positionné GPT-5.6 Sol comme une nouvelle frontière dans trois domaines clés : le codage, la biologie et la cybersécurité .
Terminal-Bench 2.1 teste les workflows en ligne de commande qui nécessitent une planification en plusieurs étapes, une coordination d'outils et des itérations . Le benchmark comprend 89 tâches de programmation complexes
. Les résultats incluent :
| Modèle | Score |
|---|---|
| GPT-5.6 Sol Ultra | 91,9% |
| GPT-5.6 Sol (max) | 88,8% |
| Claude Mythos 5 | 88,0% |
| GPT-5.6 Terra | 84,3% |
| Claude Fable 5 | 84,3% |
| GPT-5.5 | 83,4% |
| GPT-5.6 Luna | 82,5% |
GPT-5.6 Sol Ultra a établi un nouvel état de l'art à 91,9% . Le score standard de Sol, 88,8%, devance d'un point complet le modèle restreint d'Anthropic, Claude Mythos 5 (88,0%)
.
Sur GeneBench v1, un benchmark évaluant les analyses de génomique et de biologie quantitative à long terme, OpenAI rapporte que Sol a obtenu de meilleurs résultats que GPT-5.5 tout en utilisant moins de tokens de sortie . Cela représente une amélioration significative de l'efficacité pour les workflows de recherche scientifique.
Sur ExploitBench, un benchmark de recherche en cybersécurité, GPT-5.6 Sol a presque égalé les performances de Mythos Preview d'Anthropic tout en utilisant environ un tiers des tokens de sortie .
Sur ExploitGym, un benchmark développé par des chercheurs de l'UC Berkeley en collaboration avec OpenAI et d'autres laboratoires d'IA de pointe, les trois modèles GPT-5.6 ont montré des capacités de cybersécurité améliorées à mesure que le raisonnement augmentait .
Point important : OpenAI indique que GPT-5.6 Sol ne franchit pas le seuil critique en cybersécurité selon son cadre de préparation (Preparedness Framework) . Lors des évaluations impliquant Chromium et Firefox, le modèle a identifié des bugs et des primitives d'exploitation — les briques de base d'une exploitation — mais n'a pas produit de manière autonome une chaîne d'exploitation fonctionnelle complète dans les conditions testées
. La série complète GPT-5.6 a été évaluée en interne comme présentant un risque « Élevé » (pour les capacités en cybersécurité et en bioweapons) mais pas le niveau « Critique » le plus élevé
.
OpenAI déclare que GPT-5.6 Sol est lancé avec sa « pile de sécurité la plus robuste à ce jour » . L'approche de sécurité comprend :
Pendant l'aperçu, certaines requêtes peuvent être ralenties ou bloquées pour un examen supplémentaire pendant qu'OpenAI ajuste les taux de faux positifs et de faux négatifs .
Le déploiement de GPT-5.6 est sans précédent pour OpenAI. À la demande du gouvernement américain, OpenAI limite initialement l'accès à un petit groupe de partenaires et d'organisations de confiance — Axios rapporte que l'aperçu comprend environ 20 entreprises approuvées — pendant que le modèle subit des examens de sécurité nationale supplémentaires .
L'aperçu n'est pas un programme en libre-service. Pendant cette période, GPT-5.6 Sol, Terra et Luna sont disponibles uniquement via l'API OpenAI et Codex pour ce groupe restreint . Les modèles ne sont pas disponibles dans ChatGPT pendant l'aperçu
. OpenAI prévoit une disponibilité plus large dans ChatGPT, Codex et l'API « dans les semaines à venir »
.
OpenAI a clairement indiqué qu'elle considère cette approche contrôlée par le gouvernement comme une mesure temporaire : « Nous croyons en un accès large, et ce processus ne doit pas devenir la norme à long terme » . Dans une note interne, le PDG Sam Altman a informé le personnel que le gouvernement « approuverait l'accès client par client pendant cette période d'aperçu », avec un espoir de lancement plus large dans quelques semaines
.
Ces restrictions découlent de discussions avec l'Office of the National Cyber Director et l'Office of Science and Technology Policy , reflétant un nouveau cadre pour les modèles de pointe testé par l'administration Trump
.
| Modèle | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|
| GPT-5.6 Sol | 5,00 $ | 30,00 $ |
| GPT-5.6 Terra | 2,50 $ | 15,00 $ |
| GPT-5.6 Luna | 1,00 $ | 6,00 $ |
Le prix de Sol correspond à celui de GPT-5.5, tandis que Terra est environ 2 fois moins cher que GPT-5.5 . Pour référence, Sol est proposé à un prix plus proche de Claude Opus 4.8 (5$/25$) que de Mythos 5 d'Anthropic (10$/50$)
.
OpenAI a également annoncé que GPT-5.6 Sol sera déployé sur du matériel Cerebras en juillet , avec des vitesses d'inférence allant jusqu'à 750 tokens par seconde
.
La famille GPT-5.6 marque un changement significatif par rapport aux précédents lancements d'OpenAI. Le packaging à trois niveaux (Sol, Terra, Luna) introduit une marque durable qui dissocie la série de modèles des niveaux de capacité. Les résultats des benchmarks — en particulier le score de pointe de Sol en codage sur Terminal-Bench 2.1 et ses gains d'efficacité sur ExploitBench — démontrent des avancées significatives, notamment en cybersécurité et en biologie. Mais l'élément le plus marquant de ce lancement est peut-être les restrictions d'accès imposées par le gouvernement, qui représentent un nouveau paradigme pour le déploiement de l'IA de pointe.