但这些数字要带着怀疑精神看。LLM Stats 在 GPT-5.5 页面提示,相关分数可能来自模型供应商自报,且未必经过独立验证 。因此,公开 benchmark 更适合用来筛选进入内部评测的候选模型,而不是直接拍板生产环境用哪一个。
| Benchmark | GPT-5.5 | Claude Opus 4.7 | 怎么读 |
|---|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 69.4% | GPT-5.5 优势明显。OpenAI 称该测试考察复杂命令行工作流,要求规划、迭代和工具协同 。 |
| SWE-Bench Pro | 58.6% | 64.3% | |
| GPQA Diamond | 93.6% | 94.2% | |
| BrowseComp | 84.4% | 79.3% | |
| GDPval | 84.9% | 80.3% | GPT-5.5 领先。 |
| OSWorld-Verified | 78.7% | 78.0% | GPT-5.5 只是小幅领先,最好回到真实自动化流程里复测。 |
| MCP Atlas | 75.3% | 79.1% | Claude Opus 4.7 在这个工具编排相关 benchmark 上领先。 |
| FrontierMath T1–3 | 51.7% | 43.8% | GPT-5.5 在 Vellum 表格中领先。 |
| FinanceAgent v1.1 | 公开来源中没有完整可比的成对数字 | DataCamp 列出 64.4% | LLM Stats 将 Claude 列为该项领先者,但这里缺少完整对照分数,应谨慎解读 。 |
| Humanity’s Last Exam | 来源不一致 | 来源不一致 | 不建议当作决胜项;LLM Stats、Mashable 和 o-mega 给出的信号并不一致 。 |
如果只看 LLM Stats 的汇总,在双方都有报告的 10 个 benchmark 中,Claude Opus 4.7 领先 6 项,GPT-5.5 领先 4 项;该来源还概括说,Claude 的优势集中在 reasoning-heavy 和 review-grade 测试,GPT-5.5 的优势集中在长时间工具使用和 shell-driven tasks 。这个归纳有参考价值,但它不能消除 HLE 等项目中不同来源互相打架的问题 。
如果你的产品更像 CLI copilot、DevOps 助手,或者需要模型在终端里反复跑测试、读报错、改文件、再跑测试,那么 GPT-5.5 是更值得优先试的候选。它在 Terminal-Bench 2.0 上为 82.7%,高于 Claude Opus 4.7 的 69.4% 。OpenAI 对 Terminal-Bench 2.0 的描述也正是复杂命令行工作流,强调规划、迭代和工具协调 。
但如果你的核心任务是“修真实仓库里的 issue”,结论会倒过来。Claude Opus 4.7 在 SWE-Bench Pro 上为 64.3%,高于 GPT-5.5 的 58.6% 。OpenAI 称 SWE-Bench Pro 评估的是真实 GitHub issue 的解决能力 。所以,做 bug fixing、repo 内多文件修改、review-grade software tasks 时,Claude Opus 4.7 应该进入第一轮候选。
SWE-Bench Verified 这一项则不适合直接拿来定胜负。MindStudio 写 Claude Opus 4.7 为 82.4%,APIyi 和 DataCamp 则给出 87.6%;在这里提供的来源中,没有一个稳定、同条件的 GPT-5.5 vs Claude Opus 4.7 成对数字可用 。
在 Agent 工作流相关指标里,GPT-5.5 的公开信号更密集。Vellum 表格显示,GPT-5.5 在 BrowseComp 上为 84.4%,高于 Claude Opus 4.7 的 79.3%;在 GDPval 上为 84.9%,高于 80.3%;在 OSWorld-Verified 上为 78.7%,略高于 78.0% 。Mashable 也列出 GPT-5.5 在 BrowseComp 上以 84.4% 对 79.3% 领先 。LLM Stats 还称 GPT-5.5 在 CyberGym 上领先,但提供的片段没有显示具体百分比分数 。
Claude Opus 4.7 也不是只在“写代码”上有看点。Vellum 表格显示,它在 MCP Atlas 上为 79.1%,高于 GPT-5.5 的 75.3% 。LLM Stats 将 FinanceAgent v1.1 列为 Claude 领先项,DataCamp 也列出 Claude Opus 4.7 在 FinanceAgent v1.1 上为 64.4% 。Anthropic 自身发布材料也强调,Claude Opus 4.7 在 coding、agents、vision 和多步骤任务上表现更强 。
所以,若你的工作流偏 shell、浏览、操作系统式自动化,GPT-5.5 的起跑位置更好;若任务偏结构化工具编排、MCP 或金融 Agent,Claude Opus 4.7 不应被过早排除。
在 GPQA Diamond 上,Claude Opus 4.7 为 94.2%,GPT-5.5 为 93.6% 。这确实是 Claude 的领先,但 0.6 个百分点的差距太小,不足以推出“所有推理任务都该选 Claude”。如果你关心科学问答、专业分析或长推理,最稳妥的方式仍是把两者放到你的真实题库里跑。
Humanity’s Last Exam 更需要谨慎。LLM Stats 称 Claude Opus 4.7 在 HLE no tools 和 HLE with tools 两项都领先 ;Mashable 则列出 GPT-5.5 在无工具 HLE 上为 40.6%,高于 Opus 4.7 的 31.2%,但在带工具 HLE 上 Claude 为 54.7%,高于 GPT-5.5 的 52.2% ;o-mega 还给出另一组 HLE 数字 。当公开来源没有统一运行条件时,HLE 不适合作为二选一的最终裁判。
如果你优先做终端 Agent、shell workflow、测试循环或多步骤自动化,先测 GPT-5.5 更合理,因为 Terminal-Bench 2.0 明显向 GPT-5.5 倾斜 。如果你还关心 browsing/search-style workflow、GDPval、OSWorld-Verified 或 FrontierMath T1–3,Vellum 和 Mashable 的公开表格也让 GPT-5.5 值得早早进入候选名单 。
如果你的核心是 SWE-Bench Pro 式的软件 issue 修复,Claude Opus 4.7 应该先测,因为它在该项上领先 GPT-5.5 。如果你关注 GPQA 风格的科学推理、MCP/tool orchestration 或金融 Agent 工作流,Claude 也应留在 shortlist 里,这一点来自 GPQA Diamond、MCP Atlas、FinanceAgent v1.1 以及 LLM Stats 的汇总判断 。
最稳妥的做法,是不要把公开 leaderboard 当采购单。把你的任务拆成四类:仓库内 coding、终端/Agent 自动化、无工具推理、有工具工作流。每一类都用同一批 prompt、同一套工具权限、同样的 sampling、同样的 reasoning effort 和同样的评分规则跑一遍。公开 benchmark 告诉你从哪里开始;内部 eval 才能告诉你哪个模型值得进产品,尤其是在部分公开分数可能是自报、且未必独立验证的情况下 。
| Claude Opus 4.7 领先。OpenAI 将该测试描述为评估真实 GitHub issue 解决能力的 benchmark 。 |
| Claude 略高,但只差 0.6 个百分点,不宜据此判断所有推理任务。 |
| GPT-5.5 在浏览/检索风格任务上更有优势。 |