Les benchmarks indépendants de l'évaluation CAISI du NIST montrent que le DeepSeek V4 Pro rivalise directement avec les meilleurs d'OpenAI et d'Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (raisonnement scientifique) | 90,1 % | 96 % | 91 % |
| MMLU-Pro (connaissances générales) | 87,5 % | ~92 % | 89,1 % |
| SWE-bench Verified (codage) | 80,6 % | ~75 % | ~78 % |
Points forts supplémentaires :
L'histoire financière de l'IA chinoise est aussi spectaculaire que l'histoire technique :
Alibaba (Qwen) poursuit une stratégie d'écosystème open-source : la plupart des modèles sont publiés sous licence Apache 2.0, faciles à ajuster et gratuits à héberger . Cela a fait de Qwen la famille de modèles la plus téléchargée sur Hugging Face. La contrepartie est la monétisation : l'IA d'Alibaba est un succès, mais difficile à transformer en une source de revenus directe, comme l'a rapporté le New York Times
. Cependant, Alibaba a commencé à pivoter : le fleuron Qwen 3.6 Max Preview a été publié en tant que modèle API fermé et propriétaire en avril 2026
.
DeepSeek adopte une approche hybride : il publie les poids de son V4 sous licence MIT (1,6 billion de paramètres, modèle Mixture-of-Experts, 49 milliards de paramètres actifs), tout en proposant une couche API peu coûteuse . Son architecture, un MoE avec une activation extrêmement dispersée, permet des performances de pointe pour un coût d'inférence considérablement réduit.
Les acteurs occidentaux (OpenAI, Anthropic, Google) s'appuient principalement sur des API fermées et propriétaires avec des prix élevés. OpenAI et Anthropic ont publié des gammes "nano" et "mini" moins chères en réponse à la pression, mais aucune n'égale le rapport performance-prix de pointe de DeepSeek .