Une réserve s’impose : les chiffres mélangent parfois variantes, modes avec ou sans outils, niveaux d’effort et configurations différentes. Il faut donc les lire comme des signaux, pas comme un classement universel gravé dans le marbre .
| Votre priorité | Modèle à tester en premier | Signal principal |
|---|---|---|
| Qualité maximale sur tâches difficiles | Claude Opus 4.7 | Il mène les chiffres comparables de HLE face à GPT-5.5 et DeepSeek, et CodeRouter le place premier sur SWE-Bench Pro avec 64,3 % . |
| Terminal, agents et environnement OpenAI | GPT-5.5 | VentureBeat rapporte 82,7 % sur Terminal-Bench 2.0, devant Claude Opus 4.7 et DeepSeek V4 ; une guide pratique l’associe aussi aux flux ChatGPT/Codex . |
| Coding compétitif sans exploser le budget | Kimi K2.6 | CodeRouter le donne à 58,6 % sur SWE-Bench Pro, à égalité avec GPT-5.5, pour 0,60 $ en entrée et 4,00 $ en sortie par million de tokens . |
| Gros volume et contexte long à coût réduit | DeepSeek V4-Pro ou V4 Flash | V4-Pro est listé à 1,74 $/3,48 $ par million de tokens avec 1 M de contexte ; V4 Flash descend à 0,14 $/0,28 $, mais c’est une autre variante . |
| Route documentée d’autohébergement | Kimi K2.6 | Verdent indique que les poids de K2.6 sont sur Hugging Face et peuvent tourner avec vLLM, SGLang ou KTransformers . |
Humanity’s Last Exam, ou HLE, est un benchmark académique multimodal de 2 500 questions couvrant mathématiques, sciences humaines et sciences naturelles, conçu pour tester des capacités de frontière avec des réponses vérifiables . SWE-Bench Pro évalue l’ingénierie logicielle multilangage sur des issues GitHub réelles, selon la description reprise par DocsBot . Terminal-Bench 2.0 apparaît chez VentureBeat dans les résultats liés aux agents et au software engineering .
| Benchmark | Lecture utile | Chiffres disponibles |
|---|---|---|
| HLE sans outils | Claude Opus 4.7 est devant dans le tableau comparable de VentureBeat. | Claude Opus 4.7 : 46,9 % ; GPT-5.5 : 41,4 % ; DeepSeek V4 : 37,7 %. Kimi K2.6 n’apparaît pas dans cet extrait comparable . |
| HLE avec outils | Claude reste devant GPT-5.5 et DeepSeek dans VentureBeat ; Kimi a un score compétitif, mais dans une autre source. | Claude Opus 4.7 : 54,7 % ; GPT-5.5 : 52,2 % ; DeepSeek V4 : 48,2 % dans VentureBeat. CodeRouter liste Kimi K2.6 à 54,0 sur HLE avec outils, mais ce n’est pas la même table . |
| SWE-Bench Pro | Claude mène ; GPT-5.5 et Kimi forment le deuxième groupe ; DeepSeek reste proche mais derrière. | CodeRouter rapporte Claude Opus 4.7 à 64,3 %, GPT-5.5 et Kimi K2.6 à 58,6 %, et DeepSeek V4-Pro autour de 55 %. VentureBeat cite 55,4 % pour DeepSeek . |
| Terminal-Bench 2.0 | C’est l’argument le plus net en faveur de GPT-5.5 dans les chiffres comparables. | GPT-5.5 : 82,7 % ; Claude Opus 4.7 : 69,4 % ; DeepSeek V4 : 67,9 %. Aucun chiffre Kimi K2.6 n’est disponible dans l’extrait cité . |
En pratique, Claude Opus 4.7 a le meilleur signal de qualité générale dans les données comparables, GPT-5.5 a l’avantage le plus clair sur Terminal-Bench 2.0, Kimi K2.6 se distingue par son rapport performance-prix en coding, et DeepSeek V4 devient surtout pertinent quand le coût et la longueur de contexte passent avant le reste .
Pour des agents qui enchaînent les appels, quelques points de benchmark peuvent compter moins que le prix au million de tokens. Les sources disponibles placent Kimi K2.6 et DeepSeek V4 dans la zone agressive côté coût, tandis que GPT-5.5 et Claude Opus 4.7 relèvent davantage du segment premium .
| Modèle ou variante | Prix rapporté | Contexte rapporté | À retenir |
|---|---|---|---|
| Claude Opus 4.7 | 5 $ en entrée / 25 $ en sortie par million de tokens chez Artificial Analysis . | 1 M de tokens, avec 128K tokens de sortie maximale . | Artificial Analysis le décrit aussi comme l’un des modèles leaders en intelligence, mais cher, plus lent que la moyenne et verbeux . |
| GPT-5.5 | 5 $ en entrée / 30 $ en sortie par million de tokens chez CodeRouter . | 1 M de tokens . | Plus naturel si votre équipe travaille déjà dans ChatGPT/Codex ou si Terminal-Bench est déterminant . |
| Kimi K2.6 | 0,60 $ en entrée / 4,00 $ en sortie par million de tokens chez CodeRouter . | 256K tokens . | Artificial Analysis affiche aussi 256K de contexte pour Kimi contre 1000K pour Claude Opus 4.7 dans sa comparaison directe . |
| DeepSeek V4-Pro | 1,74 $ en entrée / 3,48 $ en sortie par million de tokens chez CodeRouter . | 1 M de tokens . | Option intéressante pour volume élevé et contexte long, même si elle ne mène pas HLE ni SWE-Bench Pro dans les chiffres disponibles . |
| DeepSeek V4 Flash | 0,14 $ en entrée / 0,28 $ en sortie par million de tokens chez CodeRouter . | 1 M de tokens . | Variante distincte : il ne faut pas lui transférer automatiquement les benchmarks de V4-Pro ou V4-Pro-Max . |
À noter pour Claude : la fiche Artificial Analysis mentionne 5 $/25 $ et 1 M de contexte, tandis que la table CodeRouter utilisée pour Kimi affiche d’autres valeurs pour Claude . Pour un déploiement réel, la seule référence fiable reste le tarif et le contrat en vigueur chez votre fournisseur.
Claude Opus 4.7 est le meilleur premier essai pour une revue de code complexe, une analyse longue ou une tâche où repérer les défauts cachés vaut davantage qu’économiser des tokens. Il devance GPT-5.5 et DeepSeek sur HLE dans les données de VentureBeat, arrive premier sur SWE-Bench Pro selon CodeRouter, et Artificial Analysis le place parmi les modèles leaders en intelligence tout en soulignant son coût, sa latence et sa verbosité . Il dispose aussi, selon Artificial Analysis, d’un contexte de 1 M de tokens et d’une disponibilité via l’API Anthropic, Amazon Bedrock, Microsoft Azure et Google Vertex .
GPT-5.5 ne dépasse pas Claude Opus 4.7 sur HLE dans les chiffres de VentureBeat, mais il affiche le meilleur résultat rapporté sur Terminal-Bench 2.0 : 82,7 %, contre 69,4 % pour Claude Opus 4.7 et 67,9 % pour DeepSeek V4 . Si vos équipes utilisent déjà ChatGPT ou Codex, une guide pratique le présente comme une route naturelle avant d’envisager une migration complète vers un autre fournisseur .
Kimi K2.6 est le cas le plus net de rapport performance-prix dans les sources disponibles : CodeRouter le donne à égalité avec GPT-5.5 sur SWE-Bench Pro, à 58,6 %, avec un tarif de 0,60 $/4,00 $ par million de tokens . Sa fenêtre de 256K tokens est plus petite que le 1 M rapporté pour GPT-5.5 et DeepSeek V4-Pro dans la même table, mais elle peut suffire si votre base de code ou votre contexte de travail rentre dans cette limite . Si vous devez exploiter vos propres poids, Verdent rapporte que K2.6 est disponible sur Hugging Face et fonctionne avec vLLM, SGLang ou KTransformers, avec 4× H100 comme minimum viable pour la variante INT4 à contexte réduit .
DeepSeek V4 Pro/Pro-Max reste derrière Claude Opus 4.7 et GPT-5.5 sur HLE, Terminal-Bench 2.0 et SWE-Bench Pro dans les chiffres de VentureBeat, mais son prix et son contexte de 1 M de tokens le rendent compétitif pour des pipelines à fort volume . Si l’objectif est le coût minimal, V4 Flash apparaît encore moins cher chez CodeRouter, mais doit être traité comme une variante séparée de V4-Pro .
Si vous cherchez d’abord la qualité, commencez par Claude Opus 4.7. Si les tâches de terminal, les agents ou la continuité avec OpenAI sont prioritaires, testez GPT-5.5. Si vous voulez du coding compétitif avec une facture contenue, Kimi K2.6 mérite une évaluation en premier. Et si le goulot d’étranglement est le volume à bas coût avec contexte long, DeepSeek V4-Pro ou V4 Flash est la piste à valider, en acceptant qu’il ne mène pas les benchmarks les plus durs dans les sources disponibles .