| Besoin principal | Modèle à tester en premier | Pourquoi |
|---|---|---|
| Performance globale et tâches à valeur économique | GPT-5.5 | GPT-5.5 high est crédité de 59 sur l’Artificial Analysis Intelligence Index, et GPT-5.5 xhigh de 1785 Elo sur GDPval-AA. |
| Raisonnement approfondi, revue, tâches spécialisées | Claude Opus 4.7 | LLM Stats indique que, sur 10 benchmarks communs avec GPT-5.5, Claude Opus 4.7 mène sur 6 contre 4 pour GPT-5.5. |
| Usage long avec outils, terminal, navigation web | GPT-5.5 | LLM Stats le décrit comme particulièrement fort sur Terminal-Bench 2.0, BrowseComp, OSWorld-Verified et CyberGym. |
| Modèle à poids ouverts, vitesse et rapport prix-performance | Kimi K2.6 | Dans le tableau open-weight d’Artificial Analysis, Kimi K2.6 affiche Intelligence 54, 256k de contexte, Price 1,7 $ et 112 tokens/s. |
| Très long contexte et prix API bas | DeepSeek V4 Pro / DeepSeek V4 | Artificial Analysis donne 1 M de contexte à DeepSeek V4 Pro, et Mashable rapporte pour DeepSeek V4 des tarifs API inférieurs à ceux de GPT-5.5 et Claude Opus 4.7. |
| Modèle | Ce que disent les benchmarks | Ce que cela implique en coût et exploitation |
|---|---|---|
| GPT-5.5 | GPT-5.5 high atteint 59 sur l’Artificial Analysis Intelligence Index. GPT-5.5 xhigh est annoncé à 1785 Elo sur GDPval-AA, soit environ 30 points devant Claude Opus 4.7 max selon Artificial Analysis. | Mashable rapporte un prix API de 5 $ par million de tokens d’entrée et 30 $ par million de tokens de sortie. |
| Claude Opus 4.7 | Dans la synthèse LLM Stats des 10 benchmarks communs, Claude Opus 4.7 mène 6 à 4. Mashable rapporte aussi 64,3 % sur SWE-Bench Pro, 94,2 % sur GPQA Diamond et 54,7 % sur Humanity’s Last Exam avec outils. | Mashable rapporte un prix API de 5 $ par million de tokens d’entrée et 25 $ par million de tokens de sortie. |
| Kimi K2.6 | Artificial Analysis le crédite d’un score Intelligence de 54. The Decoder rapporte, d’après les chiffres de Moonshot AI, 54,0 sur HLE with Tools, 58,6 sur SWE-Bench Pro et 83,2 sur BrowseComp. | Dans le même tableau Artificial Analysis : 256k de contexte, Price 1,7 $ et 112 tokens/s. |
| DeepSeek V4 Pro | Artificial Analysis le crédite d’un score Intelligence de 52. DataCamp résume DeepSeek V4 comme un modèle qui ne dépasse pas GPT-5.5 ou Claude Opus 4.7 en capacité pure, mais vise une performance proche du frontier à moindre coût. | Artificial Analysis indique 1 M de contexte, Price 2,2 $ et 36 tokens/s pour V4 Pro ; Mashable rapporte pour DeepSeek V4 un prix API de 1,74 $ par million de tokens d’entrée et 3,48 $ par million de tokens de sortie. |
Sur les chiffres rapportés par Mashable, Claude Opus 4.7 prend l’avantage sur SWE-Bench Pro et GPQA Diamond, tandis que GPT-5.5 mène sur Terminal-Bench 2.0, Humanity’s Last Exam, BrowseComp et ARC-AGI-1 Verified.
| Benchmark | GPT-5.5 | Claude Opus 4.7 | Avantage dans le tableau Mashable |
|---|---|---|---|
| SWE-Bench Pro | 58,6 % | 64,3 % | Claude Opus 4.7 |
| Terminal-Bench 2.0 | 82,7 % | 69,4 % | GPT-5.5 |
| Humanity’s Last Exam | 40,6 % | 31,2 % | GPT-5.5 |
| Humanity’s Last Exam avec outils | 52,2 % | 54,7 % | Claude Opus 4.7 |
| BrowseComp | 84,4 % | 79,3 % | GPT-5.5 |
| GPQA Diamond | 93,6 % | 94,2 % | Claude Opus 4.7 |
| ARC-AGI-1 Verified | 94,5 % | 92,0 % | GPT-5.5 |
Tous les scores de ce tableau sont ceux rapportés par Mashable.
La lecture de LLM Stats est légèrement différente mais très utile : sur 10 benchmarks communs, Claude Opus 4.7 est devant sur 6 et GPT-5.5 sur 4. L’écart se joue par famille de tâches : Opus 4.7 ressort davantage sur le raisonnement lourd et la revue, GPT-5.5 sur l’usage prolongé d’outils.
La prudence reste indispensable. LLM Stats précise que ces scores proviennent des niveaux de raisonnement élevés des fournisseurs et qu’ils sont comparables dans leur forme, mais pas nécessairement dans leur méthodologie. Même sur Humanity’s Last Exam, certaines sources ne donnent pas exactement la même impression de leadership selon la variante et le contexte d’évaluation.
Pour Kimi K2.6 et DeepSeek V4 Pro, il est plus parlant de raisonner en candidats open-weight qu’en rivaux directs des deux modèles propriétaires frontier. Leur intérêt dépend beaucoup de l’infrastructure, du coût par requête et de la quantité de contexte à traiter.
| Indicateur Artificial Analysis | Kimi K2.6 | DeepSeek V4 Pro |
|---|---|---|
| Intelligence | 54 | 52 |
| Fenêtre de contexte | 256k | 1 M |
| Price | 1,7 $ | 2,2 $ |
| Vitesse de sortie | 112 tokens/s | 36 tokens/s |
Ces valeurs proviennent du tableau des modèles à poids ouverts d’Artificial Analysis. À ce niveau de lecture, Kimi K2.6 est mieux placé sur le score Intelligence et surtout sur la vitesse de sortie, tandis que DeepSeek V4 Pro se distingue par une fenêtre de contexte de 1 M de tokens.
The Decoder rapporte aussi, d’après les chiffres de Moonshot AI, que Kimi K2.6 obtient 54,0 sur HLE with Tools, 58,6 sur SWE-Bench Pro et 83,2 sur BrowseComp. Mais ces résultats ne doivent pas être lus comme une comparaison strictement équivalente avec GPT-5.5 et Claude Opus 4.7. La carte du modèle sur Hugging Face indique que les évaluations de Kimi K2.6 utilisent notamment le thinking mode, temperature 1.0, top-p 1.0 et un contexte de 262 144 tokens, avec des comparaisons surtout face à Claude Opus 4.6, GPT-5.4 et Gemini 3.1 Pro.
DeepSeek V4 Pro, lui, se lit moins comme un champion absolu que comme un choix de coût et de contexte. DataCamp résume DeepSeek V4 ainsi : il ne dépasse pas GPT-5.5 ou Claude Opus 4.7 en capacité pure, mais vise une performance proche du frontier à plus bas coût.
La tentation est grande de conclure rapidement que tel modèle est cher ou bon marché. Mais les chiffres cités ne mesurent pas tous la même chose.
D’abord, il y a les tarifs API au million de tokens. Mashable rapporte 1,74 $ par million de tokens d’entrée et 3,48 $ par million de tokens de sortie pour DeepSeek V4, contre 5 $ / 30 $ pour GPT-5.5 et 5 $ / 25 $ pour Claude Opus 4.7.
Ensuite, il y a la colonne Price d’Artificial Analysis. Kimi K2.6 y apparaît à 1,7 $ et DeepSeek V4 Pro à 2,2 $, mais cette colonne ne doit pas être confondue avec les tarifs API rapportés par Mashable.
Enfin, il y a le coût d’exécution d’un benchmark. Dans un article d’Artificial Analysis, le coût pour faire tourner l’Intelligence Index est indiqué à 1 071 $ pour DeepSeek V4 Pro, 948 $ pour Kimi K2.6 et 4 811 $ pour Claude Opus 4.7.
Autrement dit, affirmer que DeepSeek est moins cher, que Kimi est plus économique ou que Claude coûte cher n’a de sens qu’en précisant de quel prix on parle : tarif API, coût d’évaluation, volume de tokens de sortie ou coût réel en production.
Claude Opus 4.7 bénéficie d’un signal spécifique sur la fiabilité. Mashable rapporte qu’Anthropic revendique un honesty rate de 92 % et moins de sycophancy, c’est-à-dire une moindre tendance à flatter ou approuver l’utilisateur à tort.
Anthropic affirme aussi que Claude Opus 4.7 est arrivé à égalité en tête sur son benchmark interne de research agent, avec un score global de 0,715 sur six modules, et qu’il progresse sur General Finance à 0,813 contre 0,767 pour Opus 4.6.
Ces données ne sont pas interchangeables avec SWE-Bench Pro, GPQA Diamond ou BrowseComp. En production, il faut séparer plusieurs questions : le modèle résout-il la tâche, combien coûte-t-il, à quelle vitesse répond-il, invente-t-il des faits et peut-on auditer facilement ses sorties ?
Pour un usage réel, choisir un seul modèle pour tout faire est rarement optimal. MindStudio rapporte que GPT-5.5 utilise 72 % de tokens de sortie en moins que Claude Opus 4.7 sur les mêmes tâches de codage, tout en notant que la minutie d’Opus 4.7 peut justifier son coût sur des bases de code complexes et fortement dépendantes du raisonnement.
Une stratégie pragmatique consiste donc à router les tâches. GPT-5.5 peut être testé en priorité pour les tâches standards de génération, correction, automatisation et terminal ; Claude Opus 4.7 pour les revues profondes et les jugements spécialisés ; Kimi K2.6 pour les expérimentations open-weight rapides ; DeepSeek V4 Pro pour les traitements à très long contexte ou à gros volume où le prix API pèse lourd.
Avec les données publiques disponibles, le plus sûr n’est pas de désigner un vainqueur unique. GPT-5.5 ressort pour la performance générale et les tâches économiquement utiles ; Claude Opus 4.7 pour le raisonnement, la revue et certaines évaluations spécialisées ; Kimi K2.6 pour la vitesse et le rapport prix-performance en open-weight ; DeepSeek V4 Pro pour le long contexte et l’économie d’API autour de DeepSeek V4.
Il faut aussi noter que les pages d’Artificial Analysis ne donnent pas toujours la même photographie selon le modèle, le réglage et la date de mise à jour : une page crédite GPT-5.5 high de 59 sur l’Intelligence Index, tandis qu’une page de comparaison place Claude Opus 4.7 Adaptive Reasoning, Max Effort en tête avec 57.
La conclusion la plus robuste est donc simple : utilisez les benchmarks comme point de départ, puis faites tourner un petit banc d’essai sur vos propres tâches, avec vos contraintes de budget, de latence, de qualité attendue et de tolérance à l’erreur.