Onafhankelijke benchmarks van NIST's CAISI-evaluatie tonen aan dat DeepSeek V4 Pro rechtstreeks concurreert met de beste modellen van OpenAI en Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (wetenschappelijk redeneren) | 90,1% | 96% | 91% |
| MMLU-Pro (brede kennis) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (programmeren) | 80,6% | ~75% | ~78% |
Aanvullende prestaties:
Het financiële verhaal van Chinese AI is net zo dramatisch als het technische:
Alibaba (Qwen) hanteert een open-source ecosysteemstrategie: de meeste modellen worden uitgebracht onder Apache 2.0, zijn eenvoudig te finetunen en gratis zelf te hosten . Dit maakte Qwen de meest gedownloade modellenfamilie op Hugging Face. Het nadeel is de monetisatie: Alibaba's AI is een hit, maar moeilijk om te zetten in directe inkomsten, zo meldde de New York Times
. Toch begint Alibaba te kantelen: het vlaggenschip Qwen 3.6 Max Preview werd in april 2026 uitgebracht als een gesloten, propriëtair API-model
.
DeepSeek hanteert een hybride aanpak: het brengt de V4-gewichten uit onder een MIT-licentie (1,6 biljoen parameter Mixture-of-Experts, 49 miljard actieve parameters) en biedt tegelijkertijd een goedkope API-laag . De architectuur - MoE met extreem sparse activatie - maakt front-end prestaties mogelijk tegen aanzienlijk lagere inferentiekosten.
Westerse gevestigde partijen (OpenAI, Anthropic, Google) vertrouwen voornamelijk op gesloten, propriëtaire API's met premieprijzen. OpenAI en Anthropic hebben goedkopere 'nano'- en 'mini'-lagen uitgebracht als reactie op de druk, maar geen enkele evenaart DeepSeek's prijs-prestatieverhouding op frontniveau .