Il faut toutefois lire ces chiffres avec prudence. Artificial Analysis compare GPT-5.5 en condition xhigh à Claude Opus 4.7 en condition Non-reasoning, High Effort, ce qui n’est pas un duel parfaitement symétrique . LLM Stats résume bien le problème : les chiffres ne choisissent pas un vainqueur, ils choisissent une charge de travail .
| Domaine | Benchmark | Claude Opus 4.7 | GPT-5.5 | Lecture rapide |
|---|---|---|---|---|
| Code | SWE-bench Pro | 64,3 % | 58,6 % | Avantage Claude sur la résolution de tickets GitHub réels . |
| Terminal et CLI | Terminal-Bench 2.0 | 69,4 % | 82,7 % | Avantage net GPT-5.5 pour les workflows en ligne de commande . |
| Usage d’ordinateur | OSWorld-Verified | 78,0 % | 78,7 % | Quasi-égalité, avec un léger avantage GPT-5.5 dans les chiffres publiés . |
| Recherche et navigation | BrowseComp | 79,3 % | 84,4 % | GPT-5.5 mène ; GPT-5.5 Pro est donné à 90,1 % . |
| Appels d’outils | MCP Atlas | 79,1 % | 75,3 % | Tous les tests d’outils ne favorisent pas GPT-5.5 : ici, Claude est devant . |
| Science | GPQA Diamond | 94,2 à 94,3 % | 93,6 % | Avantage Claude, mais l’écart reste faible . |
| Maths difficiles | FrontierMath T1-3 / T4 | 43,8 % / 22,9 % | 51,7 % / 35,4 % | GPT-5.5 est nettement devant sur ce terrain . |
| Raisonnement général | HLE, sans outils | 31,2 % ou 46,9 % | 40,6 % ou 41,4 % | Les sources divergent, donc impossible d’en faire un arbitre fiable . |
| Raisonnement avec outils | HLE, avec outils | 54,7 % | 52,2 % | Claude est donné légèrement devant dans cette condition . |
Sur le code, la réponse dépend fortement du type de travail. SWE-bench Pro donne Claude Opus 4.7 à 64,3 %, contre 58,6 % pour GPT-5.5 . Vellum interprète cet écart comme un avantage de Claude sur des tâches proches de vrais tickets GitHub . Si votre priorité est de corriger des bugs, comprendre des dépendances entre fichiers ou proposer des changements cohérents dans une base de code, Claude Opus 4.7 mérite donc d’être testé en premier.
Mais Terminal-Bench 2.0 raconte une autre histoire. Ce benchmark mesure des workflows CLI réels : manipulation de fichiers, exécution de scripts, enchaînement de commandes et résolution de tâches en plusieurs étapes . Sur ce terrain, GPT-5.5 atteint 82,7 %, contre 69,4 % pour Claude Opus 4.7 . Pour de l’automatisation en terminal, des agents qui explorent un projet via le shell ou des tâches de développement où l’exécution compte autant que le raisonnement, GPT-5.5 part avec un net avantage.
Les observations qualitatives vont dans le même sens. Mindstudio estime que GPT-5.5 est légèrement plus solide lorsque la tâche demande une utilisation précise d’outils et une navigation dans les fichiers, tandis que Claude Opus 4.7 paraît meilleur pour raisonner sur l’architecture d’un grand codebase . Autrement dit : Claude pour comprendre et restructurer, GPT-5.5 pour manipuler et exécuter.
Un point reste à manier avec des pincettes : SWE-bench Verified. APIYI et LLM Stats donnent Claude Opus 4.7 à 87,6 %, mais les éléments fournis ne permettent pas d’établir un chiffre GPT-5.5 strictement comparable dans les mêmes conditions . Même lorsqu’un benchmark porte le même nom, le mode du modèle, le harnais de test, les politiques de relance et les outils disponibles peuvent modifier la comparaison .
Pour les agents, GPT-5.5 affiche plusieurs résultats forts. OpenAI donne GPT-5.5 à 78,7 % sur OSWorld-Verified, contre 78,0 % pour Claude Opus 4.7 . L’écart est faible, mais dans les chiffres publiés, GPT-5.5 est légèrement devant pour l’usage d’ordinateur.
La différence est plus visible sur BrowseComp, un test orienté recherche et navigation. OpenAI indique 84,4 % pour GPT-5.5, 90,1 % pour GPT-5.5 Pro et 79,3 % pour Claude Opus 4.7 . Pour un produit qui repose sur la recherche web, la collecte d’informations ou des agents de navigation, la famille GPT-5.5 doit donc figurer très haut dans la liste des candidats.
Mais il serait trop simple de conclure que GPT-5.5 gagne tout ce qui touche aux outils. Sur MCP Atlas, Claude Opus 4.7 est donné à 79,1 %, contre 75,3 % pour GPT-5.5 . La bonne méthode consiste donc à séparer les cas d’usage : recherche web, usage d’interface graphique, appels d’outils de type MCP, terminal, scripts et workflows longs. Un seul score agent ne suffit pas.
Sur GPQA Diamond, un benchmark de questions scientifiques exigeantes, Claude Opus 4.7 est donné entre 94,2 % et 94,3 %, contre 93,6 % pour GPT-5.5 . L’écart est modeste, mais les sources disponibles placent Claude légèrement devant sur ce type de raisonnement scientifique et de connaissances spécialisées .
En mathématiques, le résultat s’inverse nettement. Sur FrontierMath T1-3, GPT-5.5 atteint 51,7 %, contre 43,8 % pour Claude Opus 4.7 ; sur FrontierMath T4, plus difficile, GPT-5.5 est à 35,4 %, contre 22,9 % pour Claude . Pour des tâches où la preuve, le calcul formel, la vérification étape par étape ou les problèmes mathématiques difficiles dominent, GPT-5.5 est le premier modèle à évaluer.
Humanity’s Last Exam, souvent abrégé HLE, est le point le plus délicat de cette comparaison. Mashable donne GPT-5.5 à 40,6 % et Claude Opus 4.7 à 31,2 % en condition sans outils . En revanche, o-mega et RDWorld indiquent 41,4 % pour GPT-5.5 et 46,9 % pour Claude Opus 4.7 dans une autre présentation du HLE sans outils .
Avec outils, Mashable et RDWorld donnent GPT-5.5 à 52,2 % et Claude Opus 4.7 à 54,7 %, soit un léger avantage Claude . Mais comme les résultats sans outils divergent fortement selon les sources, HLE ne doit pas être utilisé seul comme juge final du raisonnement général.
Même la fenêtre de contexte varie selon les sources. Artificial Analysis affiche 922 000 tokens pour GPT-5.5 et 1 000 000 de tokens pour Claude Opus 4.7 . LLM Stats présente de son côté les deux modèles comme des modèles à contexte de 1 million de tokens, avec le même prix d’entrée . En pratique, il faut donc les considérer comme deux modèles de très long contexte, puis vérifier les limites exactes selon l’API, le mode de raisonnement, les outils activés et le niveau de produit utilisé.
Les classements globaux donnent aussi un signal, sans trancher à eux seuls. BenchLM place Claude Opus 4.7 au 2e rang sur 110 modèles dans son leaderboard provisoire, et au 2e rang sur 14 dans son leaderboard vérifié . Le même écosystème place GPT-5.5 au 5e rang sur 112 modèles dans le leaderboard provisoire, et au 2e rang sur 16 dans le leaderboard vérifié . Cela confirme que les deux modèles sont dans le très haut du panier, mais pas lequel sera le meilleur dans votre produit.
Claude Opus 4.7 est le meilleur premier choix si votre priorité ressemble à ceci :
GPT-5.5 est le meilleur premier choix si votre priorité est plutôt :
Claude Opus 4.7 apparaît plus convaincant sur SWE-bench Pro, GPQA Diamond et MCP Atlas . GPT-5.5 ressort plus fort sur Terminal-Bench 2.0, OSWorld-Verified, BrowseComp et FrontierMath .
La bonne question n’est donc pas : Claude Opus 4.7 ou GPT-5.5 ? Elle est plutôt : quel travail voulez-vous automatiser ? Pour du code complexe et des questions scientifiques, commencez par Claude Opus 4.7. Pour du terminal, de la navigation, de l’usage d’ordinateur et des maths difficiles, commencez par GPT-5.5. Dans les deux cas, le vrai test reste le vôtre : mêmes prompts, mêmes outils, même budget, mêmes critères d’échec.