Uavhengige tester fra NISTs CAISI-evaluering viser at DeepSeek V4 Pro konkurrerer direkte med det beste fra OpenAI og Anthropic :
| Ytelsestest | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (vitenskapelig resonnering) | 90,1% | 96% | 91% |
| MMLU-Pro (bred kunnskap) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (koding) | 80,6% | ~75% | ~78% |
Flere ytelseshøydepunkter:
Den økonomiske historien om kinesisk KI er like dramatisk som den teknologiske:
Alibaba (Qwen) følger en strategi med åpent kildekode-økosystem: de fleste modeller er utgitt under Apache 2.0, lette å finjustere og gratis å hoste selv . Dette gjorde Qwen til den mest nedlastede modellfamilien på Hugging Face. Ulempen er inntjening – Alibabas KI er en suksess, men vanskelig å gjøre til en direkte inntektskilde, rapporterte New York Times
. Alibaba har imidlertid begynt å endre seg: flaggskipet Qwen 3.6 Max Preview ble utgitt som en lukket, proprietær API-modell i april 2026
.
DeepSeek tar en hybrid tilnærming: de åpner kildekoden til V4-vektene under MIT-lisens (1,6 billioner parameter Mixture-of-Experts, 49 milliarder aktive parametere), samtidig som de tilbyr et rimelig API-nivå . Arkitekturen – MoE med ekstremt sparsom aktivering – muliggjør toppytelse til dramatisk lavere inferenskostnad.
Vestlige aktører (OpenAI, Anthropic, Google) stoler primært på lukkede, proprietære API-er med premiumpriser. OpenAI og Anthropic har lansert billigere "nano"- og "mini"-nivåer som svar på presset, men ingen matcher DeepSeek sin pris-ytelse på toppnivå .