| GPT-5.5 (专业版) | $30.00 | $180.00 | — | 100万 |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (90%折扣) | 100万 |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 26.2万 |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 100万 |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 100万 |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 100万 |
| DeepSeek V4-Pro | $0.435 (永久折扣) | $0.87 (永久折扣) | $0.0036 | 100万 |
核心定价洞察:
基准测试只有在特定背景下才有意义。我们根据其实际评估的内容——通用智能、编程能力和智能体性能——对结果进行了分类,而非依赖单一的、常具误导性的综合分数。
此类别衡量原始知识、数学和科学推理能力。
| 基准测试 | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA智能指数 | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA钻石 | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (数学) | 96.7% | 95.2% | ||||
| HLE (带工具) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8在通用智能上已与GPT-5.5拉开了一个虽小但显著的差距,其数学性能相比前代提升了惊人的27.4个百分点 。Qwen3.7-Max作为中国顶尖模型的代表,在研究生级别的科学推理(GPQA钻石)方面几乎与领先者并驾齐驱 。
对开发者而言最具参考价值的基准测试。
| 基准测试 | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
编程性能呈现明显的梯队分化。在通用Bug修复(SWE-bench Verified)上,Claude Opus 4.8与GPT-5.5并列顶尖,但在难度更高的Pro组别中,克劳德以超过10个百分点的优势遥遥领先 。论及纯粹的编程性价比,DeepSeek V4-Pro无出其右,以30倍的价差提供了媲美GPT-5.4级别的编程能力 。
模型在真实环境中独立行动的能力。
| 基准测试 | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (指令遵循) | — | — | — | — | 98% |
GPT-5.5依然是开放式终端智能体工作的最强模型,但Claude Opus 4.8在真实世界任务评级(GDPval-AA Elo)上的卓越表现,预示着它是一个更可靠、更适合商业场景的智能伙伴 。对于大批量、指令遵循型任务,Grok 4.3提供了一个极具吸引力的平价选择 。
这是第一次,中国模型不仅在价格上竞争,更在能力上奋起直追。Qwen3.7-Max在SWE-bench Pro这一智能体编程基准上以60.6%的成绩领跑所有模型 。Kimi K2.6在同一测试中与GPT-5.5的表现不相上下,并在带工具的"人类最后的考试"(HLE)中以54.0%的成绩领先其他所有模型 ,在核心推理任务上向美国前沿模型发起挑战,同时价格却远低于对手。
由于各厂商选择性报告基准测试,目前无法对所有七款模型进行直接、全面的比较 。以下几个关键因素可能会影响你单纯基于数字做出的决策:
你的优先级决定了你的选择:
无论如何,对于任何关键部署,都务必在你自己的特定工作负载上进行测试。供应商报告的基准测试提供了有益的起点,但绝非最终的答案。
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |