下表中的 — 表示:在提供的来源片段中,没有可直接比较的同一项结果。
问题不在于这些模型不强,而在于表格之间并不完全可比。Artificial Analysis 对比的是 GPT-5.5 medium、Kimi K2.6 与 Claude Opus 4.7 non-reasoning high;AkitaOnRails 使用的是 GPT-5.5 xHigh/Codex,并把 DeepSeek V4 Flash 和 DeepSeek V4 Pro 分开列;VentureBeat 还区分了 GPT-5.5 与 GPT-5.5 Pro。
即便只看 GPT-5.5 与 Claude Opus 4.7,也不是单边碾压。LLM Stats 统计两家都报告的 10 个基准后发现:Claude Opus 4.7 领先 6 项,GPT-5.5 领先 4 项;Claude 的优势集中在重推理和 review-grade 测试,GPT-5.5 的优势则集中在长时间工具使用、shell-driven 任务等方向。
GPT-5.5 最有说服力的信号来自 ARC 和 Terminal-Bench。在 ARC-AGI-2 中,GPT-5.5 为 85%,Claude Opus 4.7 为 75.8%;在 ARC-AGI-1 中,GPT-5.5 为 95%,Claude 为 93.5%。
Terminal-Bench 2.0 的差距更明显:GPT-5.5 为 82.7%,Claude Opus 4.7 为 69.4%,DeepSeek 为 67.9%。这说明在命令行、终端式操作和工具链调用相关任务中,GPT-5.5 在这些数据里有很强的优势。
Artificial Analysis 也把 GPT-5.5 medium 放在这组可见竞品之前:GPT-5.5 medium 为 57,Kimi K2.6 为 54,Claude Opus 4.7 non-reasoning high 为 52。 但这不是所有运行模式的总排名,LLM Stats 同时显示 Claude 在部分推理和软件工程测试上领先 GPT-5.5。
Claude Opus 4.7 的强项更偏“难题推理”和“复杂代码判断”。在 Humanity’s Last Exam 不开工具的结果中,Claude 为 46.9%,GPT-5.5 为 41.4%,DeepSeek 为 37.7%;开启工具后,Claude 为 54.7%,GPT-5.5 为 52.2%,DeepSeek 为 48.2%。
在 SWE-Bench Pro 上,DataCamp 给出的 Claude Opus 4.7 为 64.3%,GPT-5.5 为 58.6%,DeepSeek V4 Pro 为 55.4%。 这也符合 LLM Stats 的总体观察:Claude 在 GPQA、HLE 不开工具、HLE 开工具、SWE-Bench Pro、MCP Atlas 和 FinanceAgent v1.1 上领先;GPT-5.5 则在 Terminal-Bench 2.0、BrowseComp、OSWorld-Verified 和 CyberGym 上领先。
Kimi K2.6 难以和另外三款模型做一个完整的“一表定胜负”排名,因为它并不总是出现在同一批基准里。在 Artificial Analysis 的可用片段中,Kimi K2.6 得分 54,低于 GPT-5.5 medium 的 57,但高于 Claude Opus 4.7 non-reasoning high 的 52。
在 AkitaOnRails coding benchmark 中,Kimi K2.6 得分 87,低于 Claude Opus 4.7 的 97 和 GPT-5.5 xHigh/Codex 的 96,但高于 DeepSeek V4 Flash 的 78 与 DeepSeek V4 Pro 的 69。 Verdent 另一个 SWE-Bench Verified 对比中,Claude Opus 4.7 为 87.6%,Kimi K2.6 为 80.2%。
Kimi 的特殊价值在于开放权重路线。Verdent 写道,K2.6 权重可在 Hugging Face 获取,并可通过 vLLM、SGLang 或 KTransformers 运行;同一来源还提到,在缩小上下文的 INT4 版本下,最低可行配置为 4× H100。 Hugging Face README 还列出 Kimi K2.6 的一些代理指标,例如 HLE-Full 开工具 54.0、BrowseComp 83.2、DeepSearchQA f1-score 92.5、Toolathlon 50.0、MCPMark 55.9;但这张表主要把 Kimi 与 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 对比,并不是本文四个模型的完整同场对比。
在提供的资料中,DeepSeek V4 更像是 value model,而不是最高 benchmark score 的领先者。VentureBeat 的 HLE 不开工具、HLE 开工具和 Terminal-Bench 2.0 数据里,DeepSeek 都低于 GPT-5.5 与 Claude Opus 4.7。 DataCamp 显示,DeepSeek V4 Pro 在 SWE-Bench Pro 为 55.4%,低于 GPT-5.5 的 58.6% 与 Claude Opus 4.7 的 64.3%。
AkitaOnRails 中,DeepSeek V4 Flash 为 78,DeepSeek V4 Pro 为 69,也低于同表的 Kimi K2.6、GPT-5.5 xHigh/Codex 和 Claude Opus 4.7。
但价格会改变产品选择。Mashable 给出的 API 价格显示,DeepSeek V4 每 100 万输入 token 为 1.74 美元、每 100 万输出 token 为 3.48 美元;GPT-5.5 为 5/30 美元,Claude Opus 4.7 为 5/25 美元。 这并不意味着 DeepSeek 是基准冠军,却可能让它成为大批量草稿、低风险任务、内部评测和成本敏感型实验的优先候选。
只看 benchmark,第一梯队更像是 GPT-5.5 与 Claude Opus 4.7 并列分工:GPT-5.5 在 ARC 和 Terminal-Bench 更突出,Claude Opus 4.7 在 HLE 和 SWE-Bench Pro 更稳。 Kimi K2.6 是有吸引力的 coding/agentic 与开放权重候选,但与其他三者的直接同场数据较少。
DeepSeek V4 在这些数据里通常不是 raw score 最高者,不过 API 价格让它在性价比试点中很难被忽视。