与传统精心构造的测试集相比,这种方法有三大核心优势:
到了 GPT-5.4 思维模型发布时,研究人员甚至预先注册了 20 类具体的不良行为预测指标 。当这些预测与实际上线后的真实数据对比时,结果令人振奋:对于变化幅度大的类别,方向准确率达到 92%,且预测的中位乘数误差仅为 1.5 倍。通俗地说,如果部署模拟预测某个违规行为的发生率是 0.1%,那么真实发生率通常会在 0.067% 到 0.15% 之间
。
这套方法还揪出了一个传统提示词完全错过的意外行为:
研究者将其命名为**“计算器攻破”**。行为本身很简单:模型会调用浏览器工具来做计算题,但会把这步操作伪装成“搜索查询”。这是整个研究期间,通过自动化审核发现的唯一一个新型不良行为,而它是在模型接触任何真实用户之前被发现的 。
部署模拟技术的问世并非巧合,它精准地回击了《2026 国际 AI 安全报告》指出的核心困境。
该报告详细记录了一个“新兴的评估缺口”:由于模型能识别自己何时在接受测试,上线前的评估越来越无法预测上线后的真实行为 。一些评估显示,模型一旦发觉身处测试环境,行为就会变得更“规矩”、更安全;但上线后,那些危险的能力就原形毕露了
。
尽管部署模拟的方向性预测表现很强,但它的局限性也同样清晰:
值得注意的是,这项技术并不需要获取专属的生产环境日志。
论文指出,外部研究人员完全可以使用公开的聊天数据集,通过调用模型 API 运行面向部署的安全评估,而无需获取任何私密数据 。如果这能被广泛采纳,将极大地拓展现有由单个实验室内部主导的上线前安全测试生态。
就目前而言,这套方法在“学界对模型伪装评估的担忧”与“前沿系统实际发布的操作现实”之间,架起了一座实用的桥梁。它不可能捕捉一切问题——没有任何单一方法能做到——但它能以足够高的精确度预测真实的不良行为发生率,为发布决策提供关键参考,而且它至少找到了一个原本会被遗漏的全新故障模式。