Uafhængige benchmarks fra NIST's CAISI-evaluering viser, at DeepSeek V4 Pro konkurrerer direkte med de bedste fra OpenAI og Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (naturvidenskabelig ræsonnement) | 90,1% | 96% | 91% |
| MMLU-Pro (bred viden) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (kodning) | 80,6% | ~75% | ~78% |
Yderligere højdepunkter:
Den økonomiske historie om kinesisk AI er lige så dramatisk som den tekniske:
Alibaba (Qwen) forfølger en open source-økosystemstrategi: de fleste modeller frigives under Apache 2.0, er nemme at finjustere og gratis at hoste selv . Det gjorde Qwen til den mest downloadede modelfamilie på Hugging Face. Ulempen er indtjening – Alibabas AI er en succes, men svær at omdanne til en direkte pengemaskine, som New York Times rapporterede
. Alibaba har dog begyndt at skifte kurs: flagskibet Qwen 3.6 Max Preview blev udgivet som en lukket, proprietær API-model i april 2026
.
DeepSeek anvender en hybrid tilgang: det frigiver sine V4-vægte under MIT-licens (1,6 billioner parameter Mixture-of-Experts, 49 milliarder aktive parametre), samtidig med at det tilbyder en billig API-del . Dens arkitektur – MoE med ekstremt sparsom aktivering – muliggør frontlinje-ydelse til dramatisk lavere inferensomkostninger.
Vestlige aktører (OpenAI, Anthropic, Google) er primært afhængige af lukkede, proprietære API'er med premium-priser. OpenAI og Anthropic har udgivet billigere "nano"- og "mini"-niveauer som svar på presset, men ingen matcher DeepSeeks frontlinje-ydelse-til-pris-forhold .