Humanity’s Last Exam, ou HLE, est un benchmark académique multimodal de 2 500 questions couvrant mathématiques, sciences humaines et sciences naturelles, conçu pour tester des capacités de frontière avec des réponses vérifiables . SWE-Bench Pro évalue l’ingénierie logicielle multilangage sur des issues GitHub réelles, selon la description reprise par DocsBot
. Terminal-Bench 2.0 apparaît chez VentureBeat dans les résultats liés aux agents et au software engineering
.
En pratique, Claude Opus 4.7 a le meilleur signal de qualité générale dans les données comparables, GPT-5.5 a l’avantage le plus clair sur Terminal-Bench 2.0, Kimi K2.6 se distingue par son rapport performance-prix en coding, et DeepSeek V4 devient surtout pertinent quand le coût et la longueur de contexte passent avant le reste .
Pour des agents qui enchaînent les appels, quelques points de benchmark peuvent compter moins que le prix au million de tokens. Les sources disponibles placent Kimi K2.6 et DeepSeek V4 dans la zone agressive côté coût, tandis que GPT-5.5 et Claude Opus 4.7 relèvent davantage du segment premium .
À noter pour Claude : la fiche Artificial Analysis mentionne 5 $/25 $ et 1 M de contexte, tandis que la table CodeRouter utilisée pour Kimi affiche d’autres valeurs pour Claude . Pour un déploiement réel, la seule référence fiable reste le tarif et le contrat en vigueur chez votre fournisseur.
Claude Opus 4.7 est le meilleur premier essai pour une revue de code complexe, une analyse longue ou une tâche où repérer les défauts cachés vaut davantage qu’économiser des tokens. Il devance GPT-5.5 et DeepSeek sur HLE dans les données de VentureBeat, arrive premier sur SWE-Bench Pro selon CodeRouter, et Artificial Analysis le place parmi les modèles leaders en intelligence tout en soulignant son coût, sa latence et sa verbosité . Il dispose aussi, selon Artificial Analysis, d’un contexte de 1 M de tokens et d’une disponibilité via l’API Anthropic, Amazon Bedrock, Microsoft Azure et Google Vertex
.
GPT-5.5 ne dépasse pas Claude Opus 4.7 sur HLE dans les chiffres de VentureBeat, mais il affiche le meilleur résultat rapporté sur Terminal-Bench 2.0 : 82,7 %, contre 69,4 % pour Claude Opus 4.7 et 67,9 % pour DeepSeek V4 . Si vos équipes utilisent déjà ChatGPT ou Codex, une guide pratique le présente comme une route naturelle avant d’envisager une migration complète vers un autre fournisseur
.
Kimi K2.6 est le cas le plus net de rapport performance-prix dans les sources disponibles : CodeRouter le donne à égalité avec GPT-5.5 sur SWE-Bench Pro, à 58,6 %, avec un tarif de 0,60 $/4,00 $ par million de tokens . Sa fenêtre de 256K tokens est plus petite que le 1 M rapporté pour GPT-5.5 et DeepSeek V4-Pro dans la même table, mais elle peut suffire si votre base de code ou votre contexte de travail rentre dans cette limite
. Si vous devez exploiter vos propres poids, Verdent rapporte que K2.6 est disponible sur Hugging Face et fonctionne avec vLLM, SGLang ou KTransformers, avec 4× H100 comme minimum viable pour la variante INT4 à contexte réduit
.
DeepSeek V4 Pro/Pro-Max reste derrière Claude Opus 4.7 et GPT-5.5 sur HLE, Terminal-Bench 2.0 et SWE-Bench Pro dans les chiffres de VentureBeat, mais son prix et son contexte de 1 M de tokens le rendent compétitif pour des pipelines à fort volume . Si l’objectif est le coût minimal, V4 Flash apparaît encore moins cher chez CodeRouter, mais doit être traité comme une variante séparée de V4-Pro
.
Si vous cherchez d’abord la qualité, commencez par Claude Opus 4.7. Si les tâches de terminal, les agents ou la continuité avec OpenAI sont prioritaires, testez GPT-5.5. Si vous voulez du coding compétitif avec une facture contenue, Kimi K2.6 mérite une évaluation en premier. Et si le goulot d’étranglement est le volume à bas coût avec contexte long, DeepSeek V4-Pro ou V4 Flash est la piste à valider, en acceptant qu’il ne mène pas les benchmarks les plus durs dans les sources disponibles .