| Domaine | Benchmark | Résultat publié | À quoi ce chiffre sert surtout |
|---|---|---|---|
| Code et agents | SWE-bench Verified | 87,6 % | La référence la plus lisible dans les sources disponibles pour évaluer la résolution de tâches logicielles avec Claude Opus 4.7 . |
| Code et agents | SWE-bench Pro | 64,3 % | Un complément utile pour des tâches de développement plus exigeantes ou différentes de SWE-bench Verified . |
| Agents en terminal | Terminal-Bench 2.0 | 69,4 % | Pertinent lorsque le modèle doit agir dans des environnements proches du terminal ou utiliser des outils . |
| Agents financiers | Finance Agent v1.1 | 64,4 % | Plus parlant pour des flux d’analyse ou d’automatisation financière . |
| Code interne | Benchmark interne de 93 tâches | +13 % de résolution face à Opus 4.6 | Une amélioration relative sur une évaluation précise, pas une promesse de gain uniforme dans tous les projets . |
| Agent de recherche interne | Score général | 0,715 | Anthropic le présente comme un résultat solide pour du travail multi-étapes dans son benchmark interne de research-agent . |
| Agent de recherche interne | General Finance | 0,813 contre 0,767 pour Opus 4.6 | Indique une amélioration face à Opus 4.6 dans le module financier interne d’Anthropic . |
Pour une équipe qui compare des modèles comme agents de développement logiciel, SWE-bench Verified est le chiffre le plus simple à citer : AWS rapporte 87,6 % pour Claude Opus 4.7 . En pratique, cela confirme que le modèle est positionné très fortement sur les tâches d’ingénierie logicielle et de résolution de problèmes de code, ce qui correspond à la manière dont Anthropic décrit Opus 4.7 : un modèle axé sur le raisonnement complexe et le codage agentique .
Mais ce pourcentage ne doit pas être lu comme une mesure générale de performance. SWE-bench Verified évalue un type précis de capacité. Il ne remplace pas les benchmarks orientés terminal, finance, vision, tâches longues ou recherche. Pour une décision technique sérieuse, il vaut donc mieux regarder aussi SWE-bench Pro et Terminal-Bench 2.0, surtout si le modèle doit interagir avec des outils ou des environnements complexes .
Toutes les sources ne publient pas le même résultat. Une source secondaire indique 82,4 % sur SWE-bench Verified, tandis qu’AWS rapporte 87,6 % pour Claude Opus 4.7 . La différence est suffisante pour rappeler une règle simple : ne jamais reprendre un score sans préciser d’où il vient.
La lecture la plus prudente consiste à citer ensemble le nom exact du benchmark, le score et la source. Et, si possible, la configuration d’évaluation. AWS signale en effet qu’Opus 4.7 peut demander des ajustements de prompting et de harnais d’évaluation — autrement dit, l’environnement de test peut influencer le résultat observé .
Si votre priorité est le développement logiciel, SWE-bench Verified est un bon point de départ. Il ne suffit toutefois pas à lui seul : SWE-bench Pro et Terminal-Bench 2.0 donnent une image plus complète lorsque l’agent doit traiter des tâches plus difficiles, manipuler des outils ou fonctionner dans un environnement de type terminal .
Si l’objectif est plutôt la finance ou la recherche, les données internes publiées par Anthropic sont plus proches de ce type de flux. Dans son benchmark interne de research-agent, Opus 4.7 obtient un score général de 0,715 et atteint 0,813 sur General Finance, contre 0,767 pour Opus 4.6 dans ce même module . Ces chiffres restent toutefois des évaluations internes, à distinguer d’une validation indépendante.
Pour des workflows d’entreprise longs, les informations publiques mettent surtout en avant de meilleures performances sur les tâches de longue durée, le suivi d’instructions et le travail en contexte ambigu, selon AWS citant Anthropic . Dans ce cas, les benchmarks servent de filtre initial. Le test décisif reste de reproduire votre propre environnement : vos outils, vos prompts, vos contraintes et votre harnais d’évaluation.
Le score le plus fort et le plus facile à citer pour Claude Opus 4.7 est 87,6 % sur SWE-bench Verified, particulièrement pertinent pour le codage agentique . Mais la comparaison devient plus utile lorsqu’on ajoute les autres repères : 64,3 % sur SWE-bench Pro, 69,4 % sur Terminal-Bench 2.0, 64,4 % sur Finance Agent v1.1, ainsi que les résultats internes d’Anthropic sur le travail multi-étapes et la finance .
La bonne question n’est donc pas seulement : quel est le benchmark de Claude Opus 4.7 ? Elle est plutôt : quel benchmark ressemble le plus à votre usage réel ? Pour le code, SWE-bench Verified est le point de départ. Pour les agents, le terminal, la finance ou la recherche, les résultats complémentaires peuvent compter autant, voire davantage.