| 基準測試 | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond(科學推理) | 90.1% | 96% | 91% |
| MMLU-Pro(廣泛知識) | 87.5% | ~92% | 89.1% |
| SWE-bench Verified(程式碼) | 80.6% | ~75% | ~78% |
其他效能亮點:
中國 AI 的財務故事與技術故事一樣引人注目:
阿里巴巴(Qwen) 採取 開源生態系統策略:大多數模型在 Apache 2.0 授權下發布,易於微調,且可免費自託管 。這使 Qwen 成為 Hugging Face 上下載量最大的模型家族。其代價是盈利困難——正如《紐約時報》所報導,阿里巴巴的 AI 雖然受歡迎,但難以直接轉化為利潤
。然而,阿里巴巴已開始轉向:其旗艦產品 Qwen 3.6 Max Preview 於 2026 年 4 月作為封閉的專有 API 模型發布
。
DeepSeek 採取 混合方法:它在 MIT 授權下開源其 V4 權重(1.6 兆參數的混合專家模型,其中 490 億參數活躍),同時提供一個價格低廉的 API 層級 。其架構——具有極其稀疏激活機制的 MoE——使其能夠以極低的推理成本實現頂尖效能。
西方現有巨頭(OpenAI、Anthropic、Google)主要依賴 封閉的、專有的 API,並收取高額費用。OpenAI 和 Anthropic 已因應壓力推出了更便宜的「nano」和「mini」層級,但沒有任何一款能與 DeepSeek 的頂尖性價比相匹敵 。