I benchmark indipendenti della valutazione CAISI del NIST (Istituto Nazionale di Standard e Tecnologia USA) mostrano DeepSeek V4 Pro in diretta competizione con il meglio di OpenAI e Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (ragionamento scientifico) | 90,1% | 96% | 91% |
| MMLU-Pro (conoscenza generale) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (coding) | 80,6% | ~75% | ~78% |
Altri punti salienti sulle prestazioni:
La storia finanziaria dell'IA cinese è drammatica tanto quanto quella tecnica:
Alibaba (Qwen) adotta una strategia basata sull'ecosistema open-source: la maggior parte dei modelli viene rilasciata con licenza Apache 2.0, è facile da mettere a punto e gratuita da ospitare autonomamente . Questo ha reso Qwen la famiglia di modelli più scaricata su Hugging Face. Il compromesso è la monetizzazione: l'IA di Alibaba è un successo, ma difficile da trasformare in un profitto diretto, come riportato dal New York Times
. Tuttavia, Alibaba ha iniziato a cambiare rotta: il modello di punta Qwen 3.6 Max Preview è stato rilasciato come modello API proprietario e chiuso nell'aprile 2026
.
DeepSeek adotta un approccio ibrido: rilascia i pesi di V4 con licenza MIT (modello Mixture-of-Experts da 1,6 trilioni di parametri, 49 miliardi attivi), offrendo anche un livello API poco costoso . La sua architettura — MoE con attivazione estremamente sparsa — consente prestazioni di frontiera a un costo di inferenza drasticamente inferiore.
Gli incumbent occidentali (OpenAI, Anthropic, Google) si affidano principalmente ad API chiuse e proprietarie con prezzi premium. OpenAI e Anthropic hanno rilasciato livelli "nano" e "mini" più economici in risposta alla pressione, ma nessuno eguaglia il rapporto prezzo-prestazioni di DeepSeek a livello di frontiera .