| GPT-5.5 (Pro) | 30,00 $ | 180,00 $ | — | 1M |
| Qwen3.7-Max | 2,50 $ | 7,50 $ | 0,25 $ (90% de réduction) | 1M |
| Kimi K2.6 | 0,60–0,95 $ | 3,00–4,00 $ | 0,10 $ | 262K |
| Gemini 3.5 Flash | 1,50 $ | 9,00 $ | 0,15 $ | 1M |
| Grok 4.3 | 1,25 $ | 2,50 $ | 0,30 $ | 1M |
| DeepSeek V4-Flash | 0,14 $ | 0,28 $ | 0,0028 $ | 1M |
| DeepSeek V4-Pro | 0,435 $ (remise permanente) | 0,87 $ (remise permanente) | 0,0036 $ | 1M |
Points clés sur les prix :
Les benchmarks ne sont utiles qu'avec du contexte. Nous avons organisé les résultats en fonction de ce qu'ils mesurent réellement — intelligence générale, capacité de codage et performance agentique — plutôt que d'utiliser un score composite unique, souvent trompeur.
Cette catégorie mesure les connaissances brutes, les mathématiques et le raisonnement scientifique.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| Indice d'Intelligence AA | 61,4 | 60,2 | ~55 | 56,6 | 53 | ~52 |
| GPQA Diamond | 93,6 % | — | 90,1 % | 92,4 % | ||
| AIME / USAMO 2026 (Maths) | 96,7 % | 95,2 % | ||||
| HLE (avec outils) | 57,9 % | — | 37,7 % | — | — | — |
Claude Opus 4.8 a creusé un écart faible mais significatif avec GPT-5.5 en intelligence générale, soutenu par un bond massif de 27,4 points en performance mathématique par rapport à son prédécesseur . Qwen3.7-Max se distingue comme le meilleur modèle chinois, égalant presque les leaders en raisonnement scientifique de niveau doctorat (GPQA Diamond) .
Les benchmarks les plus pertinents pour les développeurs.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 80,2 % | 88,7 % | 88,6 % | 72,5 % |
| SWE-bench Pro | ~58 % | 58,6 % | 58,6 % | 69,2 % | |
| LiveCodeBench v6 | 93,5 % | 89,6 % |
La performance de codage crée une segmentation claire. Claude Opus 4.8 et GPT-5.5 sont à égalité au sommet pour la correction de bugs générale (SWE-bench Verified), mais Claude prend une avance confortable de plus de 10 points sur l'ensemble Pro, bien plus difficile . Pour une efficacité de codage pure par dollar dépensé, DeepSeek V4-Pro est imbattable, offrant des performances de niveau GPT-5.4 pour un coût 30 fois inférieur .
Capacité d'un modèle à agir de manière indépendante dans un environnement réel.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82,7 % | 76,2 % | |||
| τ²-Bench (Suivi d'instructions) | — | — | — | — | 98 % |
GPT-5.5 conserve sa couronne de modèle le plus performant pour le travail d'agent en terminal ouvert, mais l'évaluation supérieure de Claude Opus 4.8 sur les tâches du monde réel (GDPval-AA Elo) suggère un partenaire agentique plus fiable et prêt pour les entreprises . Grok 4.3 offre une option économique convaincante pour les tâches à fort volume de suivi d'instructions .
Pour la première fois, les modèles chinois ne rivalisent pas seulement sur le prix, mais aussi sur la capacité. Qwen3.7-Max devance tous les modèles sur le benchmark de codage agentique SWE-bench Pro à 60,6 % . Kimi K2.6 égale les performances de GPT-5.5 sur ce même test et devance tous les autres modèles sur Humanity's Last Exam (HLE) avec outils à 54,0 % , défiant ainsi les fers de lance américains sur les tâches de raisonnement fondamentales tout en pratiquant des prix radicalement plus bas.
Une comparaison directe et complète entre les sept modèles est actuellement impossible en raison de la publication sélective des benchmarks par les fournisseurs . Plusieurs facteurs clés faussent un choix purement basé sur les chiffres :
Votre priorité doit dicter votre choix :
Pour tout déploiement critique, effectuez des tests sur votre propre charge de travail spécifique. Les benchmarks rapportés par les fournisseurs constituent un point de départ utile, pas une réponse définitive.
| — |
| 92,6 % |
| — |
| — |
| — |
| — |
| 60,6 % |
| — |
| — |
| — |
| 74,6 % |
| 69,7 % |
| — |