| Besoin principal | Modèle à tester en priorité | Pourquoi |
|---|---|---|
| Navigation web agentique, automatisation en terminal, workflow multi-outils | GPT-5.5 | GPT-5.5 atteint 84,4 % sur BrowseComp et 82,7 % sur Terminal-Bench 2.0, au-dessus des chiffres listés pour Claude Opus 4.7 et DeepSeek-V4-Pro-Max dans le résumé de VentureBeat. |
| Raisonnement difficile, revue, décisions à faible marge d’erreur | Claude Opus 4.7 | Claude Opus 4.7 obtient 94,2 % sur GPQA Diamond et 46,9 % sur Humanity’s Last Exam sans outils, devant GPT-5.5 et DeepSeek-V4-Pro-Max dans le même tableau. |
| Appels API à fort volume et budget serré | DeepSeek V4 | Le prix public indiqué est de 1,74 $US par million de tokens d’entrée et 3,48 $US par million de tokens de sortie, sous les prix comparables de GPT-5.5 et Claude Opus 4.7. |
| Expérimentation coding-agent open source et longs workflows de développement | Kimi K2.6 | DocsBot décrit Kimi K2.6 comme un modèle agentique nativement multimodal et open source de Moonshot AI, avec 256K tokens de contexte ; il manque toutefois un benchmark public complet face aux trois autres. |
Les sources publiques n’emploient pas toujours exactement le même nom : certains tableaux parlent de DeepSeek V4, d’autres de DeepSeek V4 Pro ou de DeepSeek-V4-Pro-Max. Le tableau ci-dessous conserve donc les libellés des sources, afin d’éviter de traiter comme identiques des configurations qui ne le sont pas forcément.
| Indicateur | GPT-5.5 | Claude Opus 4.7 | DeepSeek V4 / V4-Pro-Max | Kimi K2.6 |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | xhigh 60 ; high 59. | Adaptive Reasoning, Max Effort 57. | Pas de score visible au même format dans le résumé fourni. | Pas de score visible au même format dans le résumé fourni. |
| BrowseComp | 84,4 %. | 79,3 %. | 83,4 % pour DeepSeek-V4-Pro-Max. | |
| Terminal-Bench 2.0 | 82,7 %. | 69,4 %. | ||
| SWE-Bench Pro | 58,6 %. | 64,3 %. | ||
| GPQA Diamond | 93,6 %. | 94,2 %. | 90,1 % pour DeepSeek-V4-Pro-Max. | |
| Humanity’s Last Exam, sans outils | 41,4 % ; GPT-5.5 Pro atteint 43,1 %. | 46,9 %. | 37,7 %. | |
| Prix API, entrée / sortie, par million de tokens | 5 / 30 $US ; fenêtre de contexte 1M. | 5 / 25 $US ; fenêtre de contexte 1M. | 1,74 / 3,48 $US ; fenêtre de contexte 1M. |
Dans le résumé visible d’Artificial Analysis, les cinq premiers modèles par Intelligence Index sont GPT-5.5 xhigh à 60, GPT-5.5 high à 59, Claude Opus 4.7 Adaptive Reasoning, Max Effort à 57, puis Gemini 3.1 Pro Preview et GPT-5.4 xhigh également à 57.
Ce constat autorise une conclusion limitée : dans ce classement visible, GPT-5.5 apparaît devant Claude Opus 4.7. Il ne permet pas de classer équitablement les quatre modèles, car le même résumé ne donne pas de score Intelligence Index comparable pour DeepSeek V4 ni pour Kimi K2.6.
BrowseComp mesure surtout la navigation web agentique, notamment la capacité à chercher de l’information dans des environnements très structurés. Sur ce test, VentureBeat liste GPT-5.5 à 84,4 %, DeepSeek-V4-Pro-Max à 83,4 % et Claude Opus 4.7 à 79,3 %. Autrement dit, DeepSeek est presque au niveau de GPT-5.5 pour ce scénario précis, tandis que Claude Opus 4.7 est un peu plus loin dans ce tableau.
L’écart se creuse sur Terminal-Bench 2.0. VentureBeat indique 82,7 % pour GPT-5.5, 69,4 % pour Claude Opus 4.7 et 67,9 % pour DeepSeek. Yahoo / Investing.com décrit Terminal-Bench 2.0 comme un test de workflows en ligne de commande et confirme le score de 82,7 % pour GPT-5.5.
Kimi K2.6 affiche bien un score visible de 66,70 % sur Terminal-Bench 2.0, mais ce chiffre vient d’une autre comparaison, face à Claude Opus 4.6 et GPT-5.4, et non d’un même tableau avec GPT-5.5, Claude Opus 4.7 et DeepSeek V4.
Sur SWE-Bench Pro, le tableau de DataCamp donne 55,4 % pour DeepSeek V4 Pro, 58,6 % pour GPT-5.5 et 64,3 % pour Claude Opus 4.7. Yahoo / Investing.com indique aussi que GPT-5.5 atteint 58,6 % sur SWE-Bench Pro, un benchmark consacré à la résolution d’issues GitHub.
Kimi K2.6 mérite une lecture séparée. Verdent rapporte 58,60 % sur SWE-Bench Pro, 80,20 % sur SWE-Bench Verified et 89,60 % sur LiveCodeBench v6 ; mais la même source précise que les chiffres Kimi K2.6 viennent de la model card officielle de Moonshot AI et que SWE-Bench Pro utilise un harness interne Moonshot. Ces résultats justifient de tester Kimi K2.6 pour des agents de développement, mais pas de l’insérer mécaniquement dans un classement quatre modèles.
En pratique, pour un grand dépôt, une revue de code ou un agent qui travaille longtemps avec des outils, il vaut mieux ne pas s’arrêter à un seul score SWE. Claude Opus 4.7 a le meilleur chiffre visible sur SWE-Bench Pro ; GPT-5.5 domine Terminal-Bench 2.0, plus représentatif de workflows outillés longs ; Kimi K2.6 doit être testé sur vos propres dépôts et votre propre chaîne d’outils.
Sur GPQA Diamond, VentureBeat liste Claude Opus 4.7 à 94,2 %, GPT-5.5 à 93,6 % et DeepSeek-V4-Pro-Max à 90,1 %. Sur Humanity’s Last Exam sans outils, la même source donne 46,9 % à Claude Opus 4.7, 41,4 % à GPT-5.5, 43,1 % à GPT-5.5 Pro et 37,7 % à DeepSeek-V4-Pro-Max.
La lecture de LLM Stats va dans le même sens : sur les 10 benchmarks rapportés par les deux fournisseurs, Claude Opus 4.7 mène sur 6 et GPT-5.5 sur 4. Les avances de Claude se concentrent sur les tests lourds en raisonnement et en revue, tandis que celles de GPT-5.5 se concentrent sur les tests d’utilisation d’outils au long cours.
Mashable indique les prix API suivants : DeepSeek V4 à 1,74 $US par million de tokens d’entrée et 3,48 $US par million de tokens de sortie, avec une fenêtre de contexte de 1M ; GPT-5.5 à 5 $US en entrée et 30 $US en sortie, également avec 1M de contexte ; Claude Opus 4.7 à 5 $US en entrée et 25 $US en sortie, avec 1M de contexte.
DataCamp utilise le même ordre de prix et liste environ 1M tokens de contexte pour DeepSeek V4 Pro, GPT-5.5 et Claude Opus 4.7. Dans les chiffres visibles, DeepSeek V4 est donc nettement moins cher que GPT-5.5 et Claude Opus 4.7 ; combiné à son 83,4 % sur BrowseComp, proche des 84,4 % de GPT-5.5, il devient un candidat logique pour les routes API sensibles au coût.
Pour Kimi K2.6, les sources fournies ne donnent pas de prix API strictement comparable. DocsBot le décrit en revanche comme un modèle agentique open source de Moonshot AI, avec 256K tokens de contexte, orienté long-horizon coding, conception pilotée par le code, exécution autonome et orchestration d’agents.
Pour une équipe produit, la vraie décision n’est souvent pas de choisir un unique modèle. Mieux vaut bâtir un routage par type de tâche, avec tests de régression sur vos prompts, vos outils et vos critères de succès.
Si l’on se limite aux données publiques visibles, GPT-5.5 est le meilleur premier choix pour l’usage agentique d’outils et le classement général visible ; Claude Opus 4.7 est le meilleur candidat pour le raisonnement difficile et la revue ; DeepSeek V4 est le choix le plus convaincant pour réduire les coûts API ; Kimi K2.6 est à placer dans le banc d’essai open source et coding-agent, mais les preuves disponibles ne suffisent pas encore à le classer équitablement dans un tableau quatre modèles complet.
Avant un achat ou une mise en production, la méthode la plus sûre reste simple : mêmes prompts, mêmes droits d’outils, même longueur de contexte, mêmes critères de réussite. Les benchmarks publics servent à décider qui tester en premier ; le choix final dépendra de votre cas d’usage, du coût des erreurs et du coût des tokens.
| Pas de score public quatre modèles dans les sources fournies. |
| 67,9 %. |
| 66,70 %, mais dans une autre comparaison avec Claude Opus 4.6 et GPT-5.4, pas dans un face-à-face complet avec les trois autres. |
| 55,4 % pour DeepSeek V4 Pro. |
| 58,60 %, mais Verdent précise que le chiffre vient d’un harness interne Moonshot et d’une comparaison différente. |
| Pas de score quatre modèles dans les sources fournies. |
| Pas de score quatre modèles dans les sources fournies. |
| Pas de prix au même format dans les sources fournies ; DocsBot mentionne 256K tokens de contexte. |