但上下文容量不等于上下文可靠性。更大的窗口可以让任务“装得下”,却不保证模型在多轮、多工具调用后仍能稳定检索并正确使用关键细节。
引用材料中最具体的量化信号来自 Anthropic 披露的 Applied AI 反馈。Applied AI 称,Opus 4.7 在其六模块内部研究智能体基准中以0.715并列总分第一;在 General Finance 模块中从 Opus 4.6 的0.767提升到0.813;并展现出其测试中最一致的长上下文表现。
其他 Anthropic 托管的合作伙伴反馈也指向类似方向。Sourcegraph 描述其在异步工作流、自动化、CI/CD(持续集成/持续交付)和长时间运行任务中表现强;Cognition 则称 Opus 4.7 在 Devin 中可以连贯工作数小时,并支持比过去更深入的调查任务。
一些公开基准信息能支持“Opus 4.7 的相邻能力很强”这一判断。Vellum 的基准解读涵盖 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0,以及面向规模化工具使用的 MCP-Atlas 等类别。 LLM Stats 报告称,Opus 4.7 在 SWE-bench Verified 上为87.6%,在 GPQA 上为94.2%,并支持100万 token 上下文。
这些数字有参考价值,因为编码、推理、终端操作和工具使用常常是智能体工作流的一部分。 但它们不能完全回答长程可靠性问题。一个模型在编码或推理基准上得分高,并不等于它能在数小时或数天内持续处理变化状态、反复工具调用、局部失败和错误恢复。
但实操上,最好把它放进自己的评测环境,而不是直接默认它胜出。对比候选模型时,应尽量统一:
长程智能体不能只看最后答案是否漂亮。更应该跟踪任务完成率、工具调用失败、指令漂移、上下文记忆错误、走错路后的恢复能力、人工接管次数、耗时,以及每个成功任务的成本。
Claude Opus 4.7 看起来是长程智能体任务的强候选。100万 token 上下文、Anthropic 的明确定位、微软 Foundry 的目录描述,以及 Anthropic 展示的合作伙伴反馈,都指向一个具有前沿竞争力的智能体模型。