与此同时,Claude Opus 4.7 在软件工程领域格外突出。Anthropic 报告:
这些评测的目标是检验模型是否能修复真实的 GitHub 开源项目问题。
Google 的 Gemini 3.5 Flash 则成为一匹“意外黑马”。虽然它定位为快速推理模型,但在官方跨模型对比中:
这意味着 Flash 系列在性能上已经非常接近旗舰模型。
至于 Grok 4.3 与 DeepSeek V4,由于评测透明度和方法差异较大,目前很难进行完全可比的排名。
在各类评测中,编程能力是最容易区分模型差异的领域之一。
Claude Opus 4.7 的优势最明显。
该测试要求模型在真实开源仓库中定位并修复问题,覆盖多种编程语言,被认为是最接近真实开发环境的评测之一。
GPT‑5.5 在同一评测中的成绩为:
虽然略低,但 GPT‑5.5 在更复杂的工程流程任务中表现强劲。例如:
该评测关注命令行自动化、工具调用和多步骤协调能力。
Gemini 3.5 Flash 在编程评测中的成绩为:
虽然不及 Opus 4.7,但考虑到其定位为高速模型,这一成绩依然相当突出。
对于 Grok 4.3,公开指标包括:
不过这些评测更偏向特定任务,因此难以与 SWE‑Bench 或 Terminal‑Bench 直接对比。
至于 DeepSeek V4,目前公开的编程成绩大多来自内部测试或泄露信息,尚未被独立复现,因此可比性有限。
近年来,大模型评测越来越重视“代理能力”,即模型能否调用工具并完成复杂任务。
在这方面,Gemini 3.5 Flash 表现非常强势。Google 公布的结果包括:
这些评测测试模型在多工具协作与复杂流程中的表现。
GPT‑5.5 在类似场景中也非常强。例如:
该评测覆盖多个职业的知识工作任务。
Claude Opus 4.7 在“电脑操作型”任务中也表现稳定:
这类测试模拟模型直接操作桌面应用。
基准测试无法完全反映模型部署时的重要因素,例如上下文窗口、推理速度和价格。
Grok 4.3 的特点之一是超长上下文:
价格约为:
这使它在处理长文档或大型上下文任务时具有成本优势。
Gemini 3.5 Flash 的主要设计目标则是速度。Google 表示其输出速度可达到部分前沿模型的数倍,同时在多个代理评测中保持竞争力。
DeepSeek 系列模型通常强调开放权重或低成本部署策略,这使它们在需要本地部署或自建基础设施的场景中更具吸引力。
目前最可信的独立评测来自 美国国家标准与技术研究院(NIST)的 CAISI 项目。
评估结论包括:
报告还指出:
这也说明为什么跨公司比较 AI 模型时,独立评测非常重要。
即使有公开数字,不同模型之间仍然很难进行完全公平的排名,主要原因包括:
因此,目前所有模型的“绝对排名”都需要谨慎解读。
根据目前最可靠的公开证据,可以得出一个大致判断:
在实际应用中,“最好”的模型往往取决于具体场景:编程代理、研究助手、长文档分析或成本敏感型推理任务,可能分别适合不同模型。