| SWE-bench Multilingual | 80.5% | 另一个来源提到该值,并与 Opus 4.6 的 77.8% 对比;因来源覆盖较少,适合谨慎参考。 |
这张表有意采用保守口径:只纳入当前公开材料中明确出现的数值。对于采购、迁移或生产环境选型,它更像是“第一轮筛选”,而不是最终结论。
在当前资料中,Claude Opus 4.7 的 SWE-bench Verified 87.6% 是支撑最充分的 benchmark 数字。一个迁移与基准介绍页面以及 LLM-Stats 都明确给出了同一数值。
LLM-Stats 还把这项成绩描述为相比 Opus 4.6 提高 6.8 个百分点。 ALM Corp 也把 Opus 4.7 放在更强的复杂编码与智能体式(agentic)工作流表现这一语境下介绍。
对做软件工程的团队来说,这意味着:SWE-bench Verified 可以作为外部比较的起点。真正决定是否采用的,仍然是模型在你自己的代码库、测试框架、依赖环境和验收标准下表现如何。
GPQA 94.2% 这个数值在 LLM-Stats 中被明确列出。 Anthropic 的官方发布页当然是重要的一手材料;不过在本文可用的摘要信息里,能直接看到的是开发者可以通过 Claude API 使用
claude-opus-4-7,而不是一张可完整引用的基准成绩表。
如果你关心多语言代码库或跨语言技术栈,SWE-bench Multilingual 80.5% 值得留意。一个公开来源提到,Claude Opus 4.7 在该项上升至 80.5%,并把它与 Opus 4.6 的 77.8% 作对比。
但这里也要留个心眼:这个数值在当前材料中的覆盖面不如 SWE-bench Verified。它可以作为多语言开发环境的线索,但不应替代对真实项目的回归测试、构建测试和代码审查流程测试。
Claude Opus 4.7 并不只是一次分数更新。VentureBeat 将这次发布描述为 Anthropic 迄今公开发布的最强大大型语言模型。 ALM Corp 则把它定位为面向高难度编码、长时间智能体任务、文档密集推理、高分辨率视觉理解和专业工作流的通用可用 Opus 模型。
对实际选型来说,下面这些产品特性可能和 benchmark 分数一样重要:
这些变化会影响模型的真实使用体验:长上下文可能扩大可处理材料范围,视觉能力影响图像和文档类任务,effort 设置可能改变回答质量与耗时,而分词器变化则可能改变团队对 token 用量和预算的估算。尤其是迁移旧项目时,tokenizer 变化不应等上线后才发现。
如果准备生产迁移: 别只跑接近 benchmark 的题目。还要测上下文长度、工具使用、视觉输入、token 消耗、延迟和失败恢复。公开分数能帮你缩小范围,真正的上线决策仍然要靠真实工作流验证。
一句话概括:Claude Opus 4.7 目前公开材料中最值得记录的三个基准数值是 SWE-bench Verified 87.6%、GPQA 94.2% 和 SWE-bench Multilingual 80.5%。其中,SWE-bench Verified 是最稳的参考点,因为它被多个来源明确提到。
GPQA 和 SWE-bench Multilingual 都有价值,但在这组资料中的支撑宽度较弱。对严肃的模型选型来说,公开 benchmark 适合做起点,不适合当终点。