| 基准测试 | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond(科学推理) | 90.1% | 96% | 91% |
| MMLU-Pro(广泛知识) | 87.5% | ~92% | 89.1% |
| SWE-bench Verified(编码) | 80.6% | ~75% | ~78% |
其他性能亮点:
中国AI的财务故事与技术故事同样引人注目:
阿里巴巴(Qwen) 奉行开源生态系统战略:大多数模型在Apache 2.0许可下发布,易于微调,且免费自托管 。这使Qwen成为Hugging Face上下载量最大的模型系列。其代价是商业化困难——正如《纽约时报》所报道,阿里巴巴的AI很受欢迎,但难以直接盈利
。不过,阿里巴巴已开始转型:旗舰模型Qwen 3.6 Max Preview于2026年4月作为封闭的专有API模型发布
。
DeepSeek采取混合策略:它在MIT许可下开源其V4权重(1.6万亿参数的混合专家模型,490亿活跃参数),同时提供廉价的API接口 。其架构——具有极其稀疏激活的混合专家模型——使其能够以极低的推理成本实现前沿性能。
西方现有巨头(OpenAI、Anthropic、谷歌)主要依赖封闭的专有API,并采用高溢价定价。OpenAI和Anthropic已针对市场压力推出了更便宜的“nano”和“mini”级别,但没有任何一款产品能匹配DeepSeek在前沿领域的性价比 。