Незалежні тести NIST CAISI показують, що DeepSeek V4 Pro безпосередньо конкурує з найкращими моделями від OpenAI та Anthropic :
| Тест | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (наукове міркування) | 90,1% | 96% | 91% |
| MMLU-Pro (широкі знання) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (програмування) | 80,6% | ~75% | ~78% |
Додаткові показники продуктивності:
Фінансова історія китайського ШІ така ж драматична, як і технічна:
Alibaba (Qwen) дотримується стратегії екосистеми з відкритим кодом: більшість моделей випускаються під ліцензією Apache 2.0, їх легко доналаштовувати та безкоштовно розміщувати самостійно . Це зробило Qwen найбільш завантажуваним сімейством моделей на Hugging Face. Зворотний бік — монетизація. Як повідомляє The New York Times, ШІ Alibaba є успішним, але його важко перетворити на прямий заробіток
. Однак Alibaba почала змінювати курс: флагманська модель Qwen 3.6 Max Preview була випущена як закрита, власницька API-модель у квітні 2026 року
.
DeepSeek використовує гібридний підхід: він публікує ваги V4 з відкритим кодом під ліцензією MIT (1,6 трильйона параметрів Mixture-of-Experts, 49 мільярдів активних параметрів), а також пропонує недорогий API-рівень . Його архітектура — MoE з надзвичайно розрідженою активацією — забезпечує продуктивність найвищого рівня при значно нижчій вартості висновків.
Західні гіганти (OpenAI, Anthropic, Google) покладаються в основному на закриті, власницькі API з високими цінами. OpenAI та Anthropic випустили дешевші рівні "nano" та "mini" у відповідь на тиск, але жоден з них не відповідає співвідношенню ціни та продуктивності DeepSeek на флагманському рівні .