La nuance est importante : tous ces tests ne mesurent pas exactement la même chose. SWE-Bench Verified et SWE-Bench Pro Public ne doivent pas être confondus, et Terminal-Bench publie des résultats par couple agent/modèle, ce qui peut changer le vainqueur apparent .
| Besoin principal | Modèle à tester en premier | Ce que disent les données | Point de vigilance |
|---|---|---|---|
| Correction de bugs dans des dépôts, façon SWE-Bench Verified | Claude Opus 4.6 | Opus 4.6 est rapporté autour de 79,2% à 80,8% sur SWE-Bench Verified selon les sources citées . | Ne comparez pas ce score comme s’il s’agissait du même test que SWE-Bench Pro Public . |
| Agents de code en terminal | GPT-5.3-Codex, avec un cadre d’agent contrôlé | Une comparaison centrée sur GPT-5.4 donne GPT-5.3-Codex à 77,3% sur Terminal-Bench 2.0, devant GPT-5.4 à 75,1% et Claude Opus 4.6 à 65,4% . | Le classement public Terminal-Bench mesure des couples agent/modèle ; Claude Opus 4.6 atteint 79,8% avec ForgeCode . |
| Choix limité aux modèles OpenAI | GPT-5.4, mais sans attendre une rupture | Dans la comparaison citée, GPT-5.4 atteint 57,7% sur SWE-Bench Pro contre 56,8% pour GPT-5.3-Codex . | Le même rapport place GPT-5.4 derrière GPT-5.3-Codex sur Terminal-Bench 2.0 . |
| Systèmes très dépendants des outils et de MCP | GPT-5.4 mérite un test séparé | L’analyse de GPT-5.4 indique que la recherche d’outils réduit de 47% l’usage de tokens MCP en chargeant les définitions d’outils à la demande . | L’efficacité en tokens n’est pas la même chose qu’une victoire sur un benchmark de correction de bugs . |
Le meilleur argument en faveur de Claude Opus 4.6 vient de SWE-Bench Verified, un benchmark centré sur des tâches de génie logiciel réelles. Les rapports cités le donnent à 79,2%, 79,4% ou 80,8% sur cette variante .
GPT-5.3-Codex est plus difficile à résumer, car les sources ne parlent pas toujours de la même ligne SWE-Bench. Une analyse de GPT-5.4 donne GPT-5.3-Codex à 56,8% sur SWE-Bench Pro, tandis que deux comparaisons Opus-vs-Codex le placent à 78,2% sur SWE-Bench Pro Public . Ce n’est pas une invitation à faire une moyenne : c’est précisément le signal qu’il faut comparer les modèles sur la même variante. Plusieurs sources rappellent que SWE-Bench Verified et SWE-Bench Pro Public ne sont pas directement interchangeables .
Pour GPT-5.4, l’avantage le plus propre dans une comparaison OpenAI contre OpenAI reste étroit : 57,7% sur SWE-Bench Pro, contre 56,8% pour GPT-5.3-Codex dans la même analyse . Une autre synthèse cite aussi le score de 57,7% pour GPT-5.4 sur SWE-Bench Pro Public, tout en avertissant que la comparaison générale avec Claude n’est pas à armes égales .
Terminal-Bench 2.0 est encore plus facile à mal lire. Son classement public liste des couples agent/modèle, et non des scores isolés de modèles de base . Dans ce classement, GPT-5.3-Codex apparaît à 78,4% avec SageAgent, 77,3% avec Droid et 75,1% avec Simple Codex . Claude Opus 4.6 apparaît à 79,8% avec ForgeCode, 75,3% avec Capy et 62,9% avec Terminus 2 .
L’écart est suffisant pour changer le vainqueur affiché. La comparaison centrée sur GPT-5.4 donne GPT-5.3-Codex devant Claude Opus 4.6 sur Terminal-Bench 2.0, 77,3% contre 65,4% . Mais le classement public montre une entrée ForgeCode/Claude Opus 4.6 à 79,8%, au-dessus de l’entrée SageAgent/GPT-5.3-Codex à 78,4% . Pour un choix sérieux, il faut donc verrouiller le même cadre d’agent avant de conclure qu’un modèle est meilleur qu’un autre.
Si votre proxy de qualité de code est SWE-Bench Verified, Claude Opus 4.6 est le point de départ le mieux étayé par les sources fournies. Ses scores rapportés se regroupent autour de 79% à 81% : 79,2% dans l’analyse de GPT-5.4, 79,4% dans des comparaisons Opus-vs-Codex, et 80,8% dans d’autres synthèses de benchmarks .
Cela ne prouve pas qu’Opus 4.6 gagne tous les scénarios de développement. Sur Terminal-Bench, son histoire est plus contrastée : certains rapports citent 65,4%, tandis que le classement public le montre à 79,8% avec ForgeCode et à 62,9% avec Terminus 2 . En clair : excellent candidat pour la réparation de dépôts façon Verified, mais pas vainqueur automatique pour tous les agents de code.
GPT-5.3-Codex a son meilleur dossier lorsque la charge ressemble à du travail agentique en ligne de commande, comme dans Terminal-Bench. Les comparaisons le donnent à 77,3% sur Terminal-Bench 2.0, et le classement public le liste à 78,4% avec SageAgent, 77,3% avec Droid et 75,1% avec Simple Codex .
Sur SWE-Bench, il faut être plus prudent. Certaines sources donnent GPT-5.3-Codex à 78,2% sur SWE-Bench Pro Public, tandis que d’autres le listent à 56,8% sur SWE-Bench Pro . Puisque les sources citées soulignent que ces variantes ne sont pas directement comparables, GPT-5.3-Codex doit être évalué dans la même variante et le même protocole que ceux qui vous intéressent vraiment .
GPT-5.4 ne ressemble pas à une rupture spectaculaire en génération ou correction de code dans l’ensemble fourni. La comparaison la plus directe lui donne une courte avance sur SWE-Bench Pro face à GPT-5.3-Codex, 57,7% contre 56,8%, tout en le plaçant derrière sur Terminal-Bench 2.0, 75,1% contre 77,3% .
Son signal le plus différenciant concerne plutôt l’usage des outils. L’analyse de GPT-5.4 indique que la recherche d’outils réduit de 47% l’usage de tokens MCP en chargeant les définitions d’outils à la demande, au lieu de les placer toutes dans le contexte . Pour des agents de développement qui manipulent beaucoup d’outils, c’est potentiellement important ; mais cela doit être mesuré séparément d’un score de correction de bugs.
Pour de la correction de bugs façon SWE-Bench Verified, commencez par Claude Opus 4.6. Pour des workflows d’agents en terminal, mettez GPT-5.3-Codex dans le banc d’essai, mais contrôlez strictement le cadre d’agent. Pour GPT-5.4, l’intérêt est moins une domination en code qu’un possible avantage dans les systèmes OpenAI très orientés outils, notamment grâce à la recherche d’outils et à la réduction de tokens MCP rapportée .
Le verdict le plus prudent n’est donc pas qu’un modèle écrase les autres. C’est que le gagnant change avec la variante du benchmark, l’agent utilisé et la charge de travail réelle .