Claude est passé de 49,0 % sur SWE bench Verified avec Claude 3.5 Sonnet début 2025 à 97,0 % pour Claude Opus 5 sur un classement ultérieur ; ce dernier score doit toutefois être lu dans le contexte d’un benchmark pub... SWE bench Verified comporte 500 tâches d’issues GitHub, principalement dans des projets Python p...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Les chiffres attribués à Claude sur les benchmarks de programmation impressionnent : Claude 3.5 Sonnet amélioré a atteint 49,0 % sur SWE-bench Verified au début de 2025 ; les modèles Claude 4 ont ensuite été annoncés autour de 72,5 % à 72,7 % ; puis des classements ont placé Claude Opus 5 à 97,0 %. 23
24
9
La conclusion raisonnable n’est pas que Claude a « résolu » l’ingénierie logicielle. Elle est que Claude est devenu un agent de code très compétitif, souvent en tête des évaluations publiées. Lorsque les résultats approchent 100 % sur un ensemble fini et public, la vraie question devient : quel test prédit le mieux son comportement dans vos propres dépôts, avec vos outils et vos règles de revue de code ?
| Benchmark | Ce que fait l’agent | Périmètre et mesure | Ce qu’il indique |
|---|---|---|---|
| SWE-bench Verified | Il reçoit une issue GitHub réelle et un état du dépôt, puis propose un correctif. | Sous-ensemble de 500 cas de SWE-bench, filtrés par des humains, issu surtout de projets open source Python populaires. Un cas est résolu si le patch passe les tests du banc d’essai. |
La capacité à corriger une issue précisément décrite dans une base de code réelle. |
| SWE-bench Pro | Il traite des tâches de dépôt plus difficiles et de plus longue haleine, dans un cadre d’agent standardisé. | 1 865 tâches provenant de 41 dépôts et couvrant 123 langages ; le score est généralement donné en Pass@1, soit le taux de réussite au premier essai. |
Un test plus large, conçu pour réduire les effets de mémorisation de tâches publiques. |
| Terminal-Bench 4.0 | Il réalise un travail technique complet dans un terminal. | Les tâches demandent d’enquêter, lancer des commandes, modifier des fichiers, tester et se remettre d’échecs — pas seulement de soumettre un patch. |
La capacité à utiliser des outils et à exécuter un flux de travail opérationnel. |
Anthropic a indiqué que Claude 3.5 Sonnet amélioré avait atteint 49,0 % sur SWE-bench Verified, contre 45 % pour le précédent meilleur résultat rapporté. À ce moment-là, aucun modèle n’avait encore franchi les 50 %. 23
37
En mai 2025, Anthropic a annoncé 72,5 % pour Claude Opus 4 et 72,7 % pour Claude Sonnet 4 sur SWE-bench Verified, sans recours au mode de réflexion étendue. 24
En 2026, le paysage a encore évolué. Vals AI place Claude Opus 5 à 97,0 %, tandis que sept modèles évalués atteignent au moins 95 % et que DeepSeek V4 Pro 0813 est donné à 96,4 %. 9 Dire qu’Opus 5 se situe « autour de 96 % » est donc un raccourci acceptable, mais ce n’est pas un chiffre universel : la version du modèle, l’échafaudage de l’agent, le budget de calcul et le protocole de test influencent le résultat.
Sur 500 tâches, un score de 97 % laisse très peu de marge pour distinguer les systèmes de pointe. Surtout, SWE-bench Verified repose sur des tâches publiques et finies, tirées de dépôts publics. Des guides d’évaluation le décrivent comme exposé au risque de contamination — c’est-à-dire à la présence possible de problèmes, correctifs ou motifs proches dans les données d’entraînement — et en voie de saturation. 3
Le score reste informatif : il montre qu’un agent sait souvent résoudre des issues bien spécifiées et vérifiables par des tests. En revanche, il prédit moins bien la réussite sur un code interne inédit, évolutif et imparfaitement documenté.
SWE-bench Pro est présenté comme une alternative plus exigeante et plus résistante à la contamination. Sa couverture annoncée est de 1 865 tâches réparties sur 41 dépôts et 123 langages, contre 500 cas surtout centrés sur Python pour Verified. 12
16
Un classement agrégé de septembre 2026 donne 81,2 % à Claude Fable 5.1, devant Claude Mythos 5 à 80,3 % et Claude Fable 5 à 80,0 %. 53 Claude y occuperait ainsi les trois premières places.
Cette valeur doit néanmoins être maniée avec prudence. Une autre source distingue un meilleur score de 59,1 % sur l’ensemble public standardisé de Scale d’autres chiffres plus élevés issus d’agrégations de fournisseurs ; cela illustre l’importance du cadre d’agent et de la méthode de publication. 13 Une source relève aussi que le 81,2 % de Fable 5.1 n’est pas clairement étayé par un résultat SWE-bench directement publié pour ce modèle précis et pourrait relever d’une agrégation ou d’une confusion d’attribution entre versions.
55
En pratique, il faut donc considérer 81,2 % comme une valeur de classement rapportée, et non comme une mesure définitivement établie du modèle de base pris isolément.
Terminal-Bench évalue des tâches techniques de bout en bout en ligne de commande, comme compiler un logiciel ou entraîner un modèle d’apprentissage automatique. Il se distingue du format « issue + patch » de SWE-bench Verified par son caractère plus opérationnel. 38
Le comparatif cité attribue 55,8 % à Claude Fable 5.1 et 37,3 % à GPT-5.6 Sol, soit un écart de 18,5 points. 44 C’est un signal tangible en faveur de la configuration Claude rapportée sur cette évaluation.
Ce n’est pas, pour autant, la preuve d’un avantage général d’Anthropic sur OpenAI, Google, Cognition ou AWS. Une telle conclusion exigerait des modèles comparés dans le même environnement d’agent, avec les mêmes limites de temps et de jetons, sur plusieurs suites de tests indépendantes. Les éléments fournis ne permettent pas ce verdict global.
Les données disponibles étayent trois constats :
En revanche, ces résultats ne prouvent pas que Claude peut mener seul un projet de plusieurs semaines, comprendre de manière fiable des systèmes internes non documentés, arbitrer des choix d’architecture, ou mettre du code en production sans contrôle humain. Les benchmarks mesurent des tâches dont l’issue est vérifiable par des tests ; le métier d’ingénieur implique aussi la clarification des besoins, les compromis techniques, la sécurité, le déploiement et la collaboration.
SWE-bench Verified a été déterminant parce qu’il a déplacé le test au-delà des petits exercices de programmation : l’agent doit travailler dans un dépôt réel et produire un correctif validé par les tests. 1
38 Mais les modèles sont rapidement passés d’environ 40 % à plus de 80 % sur cette évaluation, selon Anthropic.
38
Pour choisir un outil, une entreprise gagnerait à combiner :
Anthropic cite SWE-bench Verified et Terminal-Bench comme exemples d’évaluations d’agents et met en avant les capacités de longue durée de Claude 4. 38
42 Les sources fournies ne suffisent toutefois pas à démontrer un abandon officiel de SWE-bench au profit d’évaluations plus longues : cette affirmation plus forte reste non établie.
À la date de septembre 2026, les performances rapportées font de Claude l’un des agents de code les plus solides à mettre sur une liste restreinte. Le jalon le plus net est le passage de 49 % sur SWE-bench Verified début 2025 à 97,0 % pour Opus 5 dans un classement ultérieur, avec en parallèle un leadership rapporté à 81,2 % sur SWE-bench Pro. 23
9
53
Mais un score isolé ne doit pas décider d’un achat. Les benchmarks servent à présélectionner les agents ; la décision doit ensuite reposer sur une évaluation contrôlée de tâches représentatives dans vos propres dépôts. Des résultats très élevés sur des tests publics montrent qu’un modèle sait corriger de nombreux problèmes connus et bien encadrés. Ils ne suffisent pas, à eux seuls, à prouver une ingénierie logicielle autonome et fiable en production.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Claude est passé de 49,0 % sur SWE bench Verified avec Claude 3.5 Sonnet début 2025 à 97,0 % pour Claude Opus 5 sur un classement ultérieur ; ce dernier score doit toutefois être lu dans le contexte d’un benchmark pub...
Claude est passé de 49,0 % sur SWE bench Verified avec Claude 3.5 Sonnet début 2025 à 97,0 % pour Claude Opus 5 sur un classement ultérieur ; ce dernier score doit toutefois être lu dans le contexte d’un benchmark pub... SWE bench Verified comporte 500 tâches d’issues GitHub, principalement dans des projets Python publics.
Le comparatif Terminal Bench 4.0 cité donne 55,8 % à Claude Fable 5.1 contre 37,3 % à GPT 5.6 Sol.