| Benchmark / domaine | GPT-5.5 | Claude Opus 4.7 | Lecture rapide |
|---|---|---|---|
| SWE-Bench Verified | 88,7 % | 87,6 % | Quasi-égalité ; l’avance de 1,1 point de GPT-5.5 n’est pas décisive . |
| SWE-Bench Pro | 58,6 % | 64,3 % | Avantage net à Claude sur des tâches de génie logiciel plus dures . |
| Terminal-Bench 2.0 | 82,7 % | 69,4 % rapporté | GPT-5.5 semble devant pour l’exécution en terminal, mais les sources ne sont pas parfaitement homogènes sur le score public d’Opus . |
| MCP Atlas | 75,3 % | 77,3–79,1 % | Claude ressort mieux sur l’appel d’outils et l’orchestration . |
| FrontierMath Tier 1–3 | 51,7 % | 43,8 % | GPT-5.5 est plus fort sur le raisonnement mathématique lourd . |
| FrontierMath Tier 4 | 35,4 % | 22,9 % | Même tendance sur le niveau mathématique le plus difficile . |
| GPQA Diamond | 93,6 % | 94,2 % | Écart minime ; Claude est légèrement devant . |
| Humanity’s Last Exam, sans outils | 41,4 % | 46,9 % | Claude mène sur ce test large de raisonnement de type examen . |
| Humanity’s Last Exam, avec outils | 52,2 % | 54,7 % | Claude conserve une petite avance avec outils . |
| BrowseComp | 84,4 % | 79,3 % | GPT-5.5 est rapporté devant sur la recherche web de type BrowseComp . |
Deux lignes méritent une prudence particulière. Sur Terminal-Bench 2.0, LLM Stats et d’autres synthèses donnent 69,4 % à Claude Opus 4.7, alors qu’une comparaison affiche 82,7 % pour GPT-5.5 sans fournir de score public Opus . Sur MCP Atlas, la capture publique de BenchLM donne Claude Opus 4.7 à 77,3 % et GPT-5.5 à 75,3 %, tandis que d’autres rapports citent 79,1 % pour Claude . Le signal général reste néanmoins cohérent : GPT-5.5 paraît plus fort en exécution terminal ; Claude Opus 4.7 paraît plus fort en orchestration d’outils.
SWE-Bench mesure la capacité d’un modèle à résoudre de vrais tickets GitHub ; sa variante Pro est décrite comme plus difficile . Sur SWE-Bench Verified, GPT-5.5 atteint 88,7 % et Claude Opus 4.7 87,6 %, ce qui ressemble davantage à une égalité pratique qu’à une victoire nette .
Le signal le plus intéressant vient de SWE-Bench Pro. Sur ce benchmark, Claude Opus 4.7 est rapporté à 64,3 %, contre 58,6 % pour GPT-5.5, soit 5,7 points d’avance . Le jeu de tâches est aussi plus exigeant : selon un aperçu de SWE-Bench Pro, le set Verified compte 500 tâches et 12 dépôts Python, tandis que Pro regroupe 1 865 tâches et 41 dépôts en Python, Go, TypeScript et JavaScript ; le nombre moyen de fichiers modifiés passe d’environ 1 à 4,1 .
Conséquence pratique : si votre priorité est la correction de bugs multi-fichiers, la réparation de pull requests, le refactoring ou des agents de codage en production, Claude Opus 4.7 mérite d’être testé en premier. MindStudio observe aussi qu’Opus 4.7 se montre plus solide sur les tâches demandant un raisonnement architectural large à travers de grands codebases .
Pour les workflows centrés sur la ligne de commande — scripts, shell, agents qui exécutent des étapes dans un terminal — GPT-5.5 a un dossier solide. Terminal-Bench 2.0 le donne à 82,7 %, contre 69,4 % pour Claude Opus 4.7 dans plusieurs rapports . Comme certaines comparaisons publiques ne donnent toutefois pas le score Opus, il vaut mieux lire ce résultat comme un signal directionnel plutôt que comme une vérité de classement définitive .
Sur l’orchestration d’outils, Claude reprend l’avantage. MCP Atlas évalue l’appel d’outils via des intégrations Model Context Protocol et des outils externes . La capture publique de BenchLM place Claude Opus 4.7 à 77,3 % et GPT-5.5 à 75,3 % . D’autres rapports donnent la même comparaison sous la forme 79,1 % contre 75,3 % . Si votre agent doit enchaîner plusieurs API, services et outils, Claude Opus 4.7 est donc un meilleur point de départ.
Il serait trompeur de parler du raisonnement comme d’une seule catégorie. Dans le tableau GPT-5.5 d’OpenAI, GPT-5.5 atteint 51,7 % sur FrontierMath Tier 1–3, contre 43,8 % pour Claude Opus 4.7 ; sur FrontierMath Tier 4, GPT-5.5 obtient 35,4 %, contre 22,9 % pour Claude . Pour les tâches très mathématiques, l’avantage de GPT-5.5 est net.
GPQA Diamond et Humanity’s Last Exam donnent un autre signal. Sur GPQA Diamond, les deux modèles sont presque à égalité : 93,6 % pour GPT-5.5 et 94,2 % pour Claude Opus 4.7 . Sur Humanity’s Last Exam, Claude est rapporté devant : 46,9 % contre 41,4 % sans outils, puis 54,7 % contre 52,2 % avec outils .
Pour la recherche web de type BrowseComp, GPT-5.5 est devant dans les chiffres disponibles : 84,4 %, contre 79,3 % pour Claude Opus 4.7 . Si vous automatisez surtout de la recherche en ligne, de la collecte d’informations ou de l’analyse fondée sur la navigation, GPT-5.5 semble donc le premier candidat à tester.
Les scores publiés ne doivent pas être traités comme une garantie de performance en production. Dans ses notes de lancement de Claude Opus 4.7, Anthropic mentionne des changements de harness, des implémentations internes et des mises à jour méthodologiques, en précisant que certains scores ne sont pas directement comparables aux classements publics . Côté GPT-5.5, une synthèse destinée aux builders signale aussi que plusieurs scores sont rapportés par OpenAI et manquent encore de réplication par des tiers .
La décision la plus sûre consiste donc à lancer une petite évaluation interne : tickets récents, dépôts réels, chaînes d’outils, prompts habituels, critères de réussite et d’échec. Les benchmarks donnent la direction ; votre choix final dépendra de votre workload, de votre tolérance à la latence, de votre outillage et du coût d’une erreur.
Si vous cherchez un modèle par défaut pour l’automatisation générale, l’exécution en terminal, le raisonnement mathématique et la recherche web de type BrowseComp, GPT-5.5 paraît être le meilleur premier essai . Si votre objectif principal est le codage difficile, les agents de développement en production ou l’orchestration multi-outils, Claude Opus 4.7 est le candidat le plus convaincant .
La conclusion utile n’est donc pas « GPT-5.5 gagne » ou « Claude gagne ». Elle est plus opérationnelle : GPT-5.5 est fort en exécution large et en maths ; Claude Opus 4.7 est fort en ingénierie logicielle difficile et en workflows d’agents outillés.