| 80.6 |
| 80.2 |
| SWE-Bench Pro | 60.6 | 55.4 | 58.6 |
| SWE-Bench Multilingual | 78.3 | — | 76.7 |
| Terminal-Bench 2.0 | 69.7 | 67.9 | 66.7 |
| LiveCodeBench (Pass@1) | — | 93.5 | 89.6 |
| Classement Codeforces | — | 3206 | — |
| SciCode | 53.5 | — | — |
Le combat est incroyablement serré sur SWE-Bench Verified, le test de référence pour la résolution de bugs réels. DeepSeek V4 brille par sa domination écrasante sur le code pur, comme en témoigne son score stratosphérique sur LiveCodeBench et le classement Codeforces, qui mesure les performances en programmation compétitive . Qwen3.7 Max est le maître des terminaux et des nouvelles métriques comme Terminal-Bench 2.0 et SciCode. Kimi K2.6 n'est pas en reste et prend la tête sur SWE-Bench Pro, un ensemble de tâches d'ingénierie logicielle plus ardues .
| Benchmark | Qwen3.7-Max | DeepSeek V4 Pro Max | Kimi K2.6 Thinking |
|---|---|---|---|
| AA Intelligence Index v4.0 | 56.6 (#5) | 52.0 | — |
| GPQA Diamond | 92.4 | — | — |
| HLE (avec outils) | 41.4 | 37.7 | 54.0 |
| HMMT 2026 (Maths) | 97.1 % | 95.2 % | |
| AIME 2026 | — | — | 96.4 % |
| DeepSearchQA (F1) | — | — | 92.5 |
| SimpleQA Chinois | — | 84.4 | 75.9 |
Sur les capacités de raisonnement, les rôles sont plus distincts. Qwen3.7 Max est la bête de somme des mathématiques, dominant le HMMT et le GPQA Diamond . Kimi K2.6 est le champion de la réflexion augmentée : il pulvérise les scores à l'examen « Humanity's Last Exam » (HLE) dès lors qu'il peut utiliser des outils externes, et écrase ses concurrents en recherche d'information profonde (DeepSearchQA) . DeepSeek V4 Pro Max reste compétitif, mais n'est leader sur aucun de ces fronts spécifiques, sauf sur le SimpleQA en chinois .
Voici la question qui fâche : combien coûte la puissance ?
| Élément de tarification | Qwen3.7-Max | DeepSeek V4 Pro | Kimi K2.6 |
|---|---|---|---|
| Entrée (hors cache) | $2.50 | $1.74 | $0.95 |
| Sortie | $7.50 | $3.48 | $4.00 |
| Cache (entrée) | $0.25 (-90%) | $0.0145 (-99%) | $0.16 (-83%) |
| Fenêtre de Contexte | 1M tokens | 1M tokens | 256K tokens |
| Tokens de Sortie Max | 65 536 | 384 000 | — |
| Poids Ouverts | Non (API uniquement) | Oui (Hugging Face) | Oui |
Note sur le prix de DeepSeek : Une promotion de lancement de -75% a rendu le modèle temporairement accessible à $0.435/$0.87 l'entrée/sortie. Cette promotion est devenue permanente, ce qui en fait les tarifs standards actuels . Le tableau reflète donc les prix finaux.
DeepSeek V4 Pro est, sans conteste, le champion du rapport qualité-prix. Son coût de sortie est plus de deux fois inférieur à celui de Kimi et près de huit fois inférieur à celui de Qwen. Cerise sur le gâteau, ses poids sont ouverts, autorisant l'auto-hébergement pour un contrôle total des coûts . Qwen3.7 Max est le plus cher, une stratégie assumée pour un positionnement « premium » . Kimi K2.6 offre un bon milieu de gamme, mais sa fenêtre de contexte plus limitée (256K tokens) peut être un frein pour traiter de très longs documents .
Un bémol important : Méfiez-vous des benchmarks auto-déclarés. Une évaluation de mai 2026 par le NIST CAISI (l'institut américain des normes) a révélé que les scores « maison » de DeepSeek V4 Pro étaient plus optimistes que ses performances lors de tests indépendants. Selon ce rapport, le modèle serait plus proche du niveau de GPT-5 (sorti en août 2025) que des derniers modèles de pointe comme Claude Opus 4.6 . Cette nuance ne s'applique pas aux scores de Qwen3.7-Max ou Kimi K2.6, qui n'ont pas été évalués dans ce même rapport.
| 92.7 % |