OpenAI décrit Terminal-Bench 2.0 comme un benchmark de workflows complexes en ligne de commande, où le modèle doit planifier, itérer et coordonner des outils ; GPT-5.5 y atteint 82,7 % selon OpenAI . Sur SWE-Bench Pro, qui évalue la résolution d’issues GitHub réelles, OpenAI annonce 58,6 % pour GPT-5.5
.
Côté DeepSeek, le changelog officiel indique que V4-Pro et V4-Flash sont disponibles via l’interface OpenAI ChatCompletions et via l’interface Anthropic ; les paramètres de modèle sont deepseek-v4-pro et deepseek-v4-flash . C’est une preuve de disponibilité produit, pas une preuve de victoire sur les benchmarks.
Pour Claude Opus 4.7 et Kimi K2.6, il faut lire les chiffres avec plus de prudence. LushBinary fournit des valeurs comparatives Claude-vs-GPT , tandis que CodeRouter apporte surtout des indications de prix et de positionnement pour Kimi K2.6 et DeepSeek V4
.
Ici, « n.d. » signifie que les sources disponibles ne donnent pas de chiffre suffisamment comparable pour cette combinaison modèle-benchmark.
Si le critère principal est le code, les chiffres cités favorisent Claude Opus 4.7. LushBinary donne 64,3 % à Claude Opus 4.7 sur SWE-Bench Pro, contre 58,6 % pour GPT-5.5 ; OpenAI confirme de son côté le score GPT-5.5 de 58,6 % . La même source place aussi Claude Opus 4.7 devant GPT-5.5 sur SWE-Bench Verified et CursorBench
.
Kimi K2.6 reste néanmoins intéressant pour des équipes qui lancent beaucoup d’agents, de brouillons ou de tentatives successives. CodeRouter le situe au niveau de GPT-5.5 sur SWE-Bench Pro tout en indiquant des prix nettement plus bas : 0,60 $ en entrée et 4,00 $ en sortie par million de tokens . Ce n’est pas un substitut à une évaluation interne, mais c’est un signal fort pour les usages où le coût par essai compte autant que le score brut.
Pour DeepSeek V4, les sources officielles utilisées ici ne donnent pas de valeur de benchmark code directement comparable. Ce qui est établi, c’est l’accès API à V4-Pro et V4-Flash .
Pour les workflows d’agents en terminal — scripts, commandes shell, appels d’outils, corrections successives — GPT-5.5 est le choix le mieux étayé par des chiffres publics. OpenAI annonce 82,7 % sur Terminal-Bench 2.0, benchmark conçu pour tester des tâches complexes en ligne de commande nécessitant planification, itération et coordination d’outils . LushBinary situe Claude Opus 4.7 autour de 72 % sur ce même benchmark
.
Les métriques plus proches du « travail de connaissance » et de l’usage d’un ordinateur vont dans le même sens dans la source tierce citée : 84,9 % pour GPT-5.5 sur GDPval contre environ 78 % pour Claude Opus 4.7, et 78,7 % sur OSWorld-Verified contre environ 65 % pour Claude Opus 4.7 . Pour orchestrer des outils, manipuler des environnements et automatiser des tâches proches d’une interface utilisateur, GPT-5.5 est donc le point de départ le mieux justifié par les chiffres disponibles.
Sur les tâches visuelles et documentaires, les sources ne fournissent pas de tableau complet pour les quatre modèles. Le signal positif le plus clair concerne Claude Opus 4.7 : un rapport Arena cité par Latent Space/AINews place Claude Opus 4.7 en tête de la Vision & Document Arena .
LLM Stats indique aussi que Claude Opus 4.7 peut traiter des images jusqu’à 2 576 pixels sur le côté long, soit environ 3,75 mégapixels ; la même source indique que GPT-5.5 accepte l’entrée image et lui attribue 81,2 % sur MMMU-Pro sans outils et 83,2 % avec outils . Ces éléments aident à comparer Claude et GPT-5.5 sur le multimodal, mais ils ne suffisent pas à établir un classement propre entre DeepSeek V4, Kimi K2.6, Claude Opus 4.7 et GPT-5.5.
Le meilleur argument prix dans les sources disponibles revient à Kimi K2.6. CodeRouter le décrit comme un gagnant coût/qualité et indique 0,60 $ en entrée et 4,00 $ en sortie par million de tokens .
DeepSeek V4 Flash est présenté dans la même source comme une option de travail très économique, à 0,14 $ en entrée et 0,28 $ en sortie par million de tokens, avec un contexte de 1M . La documentation officielle DeepSeek confirme par ailleurs que V4-Pro et V4-Flash sont disponibles via les interfaces API actuelles
.
Mais le prix seul ne fait pas un bon modèle en production. Un modèle moins cher peut être excellent pour multiplier les essais ou absorber des tâches à faible risque ; il devient moins intéressant si ses erreurs entraînent beaucoup de reprises, de vérifications humaines ou de bugs coûteux.
Pour une décision de production, un classement public ne suffit pas. Le plus utile est de construire un petit jeu d’évaluation avec vos propres tâches : issues réelles de votre dépôt, documents internes anonymisés, workflows d’agents, scripts, tickets de support ou tâches multimodales si elles existent dans votre cas d’usage.
Il faut mesurer plus que la première réponse : coût par résultat accepté, nombre de retries, gravité des erreurs, temps d’exécution, stabilité sur plusieurs runs et facilité d’intégration API. Il faut aussi séparer clairement les valeurs officielles des analyses tierces. Dans cette comparaison, GPT-5.5 dispose de chiffres OpenAI pour Terminal-Bench 2.0 et SWE-Bench Pro . DeepSeek V4 dispose d’une confirmation officielle de disponibilité API
. Les comparaisons directes les plus fortes pour Claude Opus 4.7 et Kimi K2.6 proviennent surtout de sources externes
.
Le comparatif ne donne pas un champion absolu. Claude Opus 4.7 semble le mieux placé dans les benchmarks proches du code cités ici. GPT-5.5 est le plus solidement documenté pour les agents terminal, l’orchestration d’outils et le Computer Use. Kimi K2.6 porte le récit coût-performance le plus clair. DeepSeek V4, lui, est surtout un candidat API disponible qu’il faut mesurer sur ses propres tâches avant de lui attribuer une place dans le classement .