在知识工作评测 GDPval 中,它在约 84.9% 的比较中达到或超过专业人士水平,任务覆盖法律、金融、产品管理等多个职业。
这些结果表明 GPT‑5.5 的优势主要在于:
复杂任务规划与自主代理能力。
Anthropic 的 Claude Opus 4.7 在软件工程相关评测中表现尤为突出。
核心成绩包括:
SWE‑bench 的任务来自真实开源仓库中的 bug 修复。Opus 4.7 能解决 87.6% 的 Verified 任务,是当前公开比较中最强的编码成绩之一。
虽然在 Terminal‑Bench 上落后 GPT‑5.5,但在软件工程场景中,Opus 4.7 仍然被认为是最强模型之一。
Google DeepMind 的 Gemini 3.5 Flash 很特殊,因为它并不是旗舰模型,而是主打速度与成本效率。
公开成绩包括:
Google 表示,该模型在输出速度上大约比同级前沿模型快 4 倍,同时在多个代理任务和编码评测中超过此前的 Gemini 3.1 Pro。
因此,Gemini 3.5 Flash 的主要优势是:
接近旗舰能力,但延迟更低、成本更低。
DeepSeek V4 受到关注的原因在于它是开权重(open‑weight)模型,可以被研究者和企业自行部署。
该系列包含两个版本:
在最大推理模式下,V4‑Pro 的成绩包括:
这些成绩使其在某些编码评测中接近闭源旗舰模型。
不过,美国国家标准与技术研究院(NIST)旗下 CAISI 项目的独立评估指出:
DeepSeek V4 的能力整体仍比前沿模型落后约 8 个月。
这说明开源模型正在逼近前沿,但仍存在差距。
xAI 的 Grok 4.3 相比前代有明显提升,尤其是在代理任务方面。
公开数据包括:
GDPval‑AA 的分数相比上一代提升 300 多 Elo,说明其在真实任务自动化方面取得了显著进展。
但多数第三方分析仍认为它整体能力低于 OpenAI 与 Anthropic 的最新模型。
综合多个评测,可以看到明显的分工:
不过这些结论仍然只是趋势判断,因为不同公司报告的评测设置并不完全一致。
当前AI评测难以稳定排名,主要原因包括:
因此,新模型发布后的几个月内,排名通常会随着独立测试增加而不断变化。
截至2026年的公开数据,并不存在一个“全面碾压”的AI模型。相反,前沿模型已经出现明显分工:
随着更多独立评测出现,这些模型之间的真实差距和排名仍可能继续变化。