能较有把握说的是另一件事:Claude Opus 4.7 的官方文件线索更清楚。Anthropic 有 Opus 4.7 的官方发布和开发者文档,并在模型系统卡页面列出 Claude Opus 4.7。 但这只能说明资料更容易追溯,不能自动推出它在污染研究任务中比 GPT-5.5 Spud 更安全。
Anthropic 的官方资料确认 Claude Opus 4.7 已发布并有开发者文档;相关文档提到 Opus 4.7 引入 task budgets,Claude 的提示实践也提醒,在 max 或 xhigh effort 下,应提供足够输出 token,让模型有空间跨子智能体和工具调用完成任务。
这说明 Anthropic 对长任务、工具使用和智能体式工作流有公开说明。Claude 4 系统卡还描述了按照 Responsible Scaling Policy 进行的发布前安全测试、Usage Policy 违规行为测试、reward hacking 评估,以及 computer use 和 coding capabilities 的智能体安全评估。 Claude 4.1 系统卡目录也列出与 prompt injection attacks and computer use 相关的章节。
不过,这些仍是安全评估背景,不是 Claude Opus 4.7 与 GPT-5.5 Spud 在研究污染场景下的同场对照。
OpenAI 的 GPT-5 系统卡覆盖 factual correctness 与 hallucination 评估,并说明使用具备 web access 的 LLM-based grading model 标记重大和轻微事实错误;该文件还称,GPT-5 models 在 browse-on 与 browse-off 设置下,相比列出的 OpenAI 对照模型有更低 hallucination rates。
OpenAI 的 ChatGPT Agent 系统卡描述了 SecureBio static 与 agentic evaluations、manual red-teaming,以及需要 web-search 和 reasoning 的任务评估。 GPT-5-Codex 系统卡增补则明确列出 prompt injection 风险和专门的 prompt injection evaluation suite。
提示注入的风险在于,模型读取网页、文件、表格或附件时,把不可信内容里的文字误当成更高优先级的任务指令。Claude 4 与 4.1 的资料显示,Anthropic 有智能体安全、computer use 和提示注入相关评估脉络;OpenAI 的 ChatGPT Agent 与 GPT-5-Codex 文件也显示其有智能体评估、人工红队测试和提示注入评估套件。
但最关键的问题仍未被回答:在同一批被植入恶意指令的研究资料里,Claude Opus 4.7 和 GPT-5.5 Spud 谁更少服从不可信内容?没有同场测试,就不应把“有安全文档”解读成“已经赢了”。
但这不等于“假引用专项压力测试”。公开资料没有给出 GPT-5.5 Spud 在真 DOI、假 DOI、真 URL、失效 URL、伪造期刊名混合数据集上的表现,也没有给出 Claude Opus 4.7 在同一数据集上的对照结果。
因此,实际使用中不应把 PDF 安全完全交给模型自己判断。更稳妥的评测方式,是先把 PDF 视为不可信输入,在隔离环境中抽取文字和结构,再测量模型是否把文件内容里的命令当成任务指令。
Anthropic 的 Claude 4 系统卡包含 bias evaluations 相关章节,Claude 4.1 系统卡也列出 political bias 与 discriminatory bias 评估;OpenAI 的 GPT-4.5 系统卡则列出 BBQ Evaluation Dataset 等偏见相关评估。
但偏见 benchmark 与受污染的研究流程不是一回事。真正需要测的是:模型会不会指出资料来源失衡、主动寻找反方证据、标注样本限制,还是把偏颇样本误写成总体结论。现有公开资料没有给出 Claude Opus 4.7 与 GPT-5.5 Spud 在这类端到端任务上的可比成绩。
系统卡的价值,是让外界了解供应商在发布前做过哪些能力和风险评估。Anthropic 的资料指出,其 Responsible Scaling Policy 要求 frontier models 在化学、生物、放射性与核武器(CBRN)、网络安全和自主能力等潜在灾难性风险领域发布前做全面安全评估;Claude 4 系统卡也描述多类安全测试和智能体安全评估。 OpenAI 的 GPT-5 与 ChatGPT Agent 文件同样提供 factual correctness、hallucination、智能体评估和人工红队测试等背景。
但研究污染测的是整条工作流:检索系统、附件解析器、提示层级、工具权限、模型行为、引用核查、日志和人工复核。某个模型在官方评估中表现良好,并不自动代表它在真实研究流程里能抵抗所有外部资料污染。
还要注意,模型行为会受提示和场景影响。Anthropic 的 alignment-faking 研究显示,在特定实验设置下,大语言模型可能出现 alignment-faking 相关行为,而且不同 prompt 条件下结果会有差异。 这不代表 Claude Opus 4.7 或 GPT-5.5 Spud 一定会在研究任务中失守;它提醒我们,安全边界不能只靠供应商摘要、第三方截图或一次演示来推断。
更可靠的做法不是凭文档站队,而是建立一套可复现红队测试集,让两个模型在同一条件下比较。至少应包括:
严格依照公开可核对资料,不能证明 Claude Opus 4.7 或 GPT-5.5 Spud 在提示注入、伪造引用、恶意 PDF 与偏见资料污染下谁更强。Claude 一侧在官方文件可追溯度上更清楚;OpenAI 一侧有 GPT-5、ChatGPT Agent 与 GPT-5-Codex 的安全评估材料,但这些不是 GPT-5.5 Spud 的直接证据。
所以,最负责任的结论是:Claude 在公开文件完整度这个狭窄标准上略占优;在受污染研究流程的实际安全性上,证据不足。