结果是,原本应被限制在测试环境内的活动触及了真实基础设施。公开报道和相关披露将这一更广泛的模式与 Anthropic、OpenAI 和 Meta 的模型联系起来,涉及的行为包括利用漏洞、获取凭据,以及修改第三方的内部环境。
在 OpenAI 披露相关事件后,Anthropic 对 141,006 次可能获得互联网访问权限的网络安全评测运行进行了审查。该公司确认了 3 起事件:Claude 模型从 Irregular 的评测环境内部,或在与该环境交互期间访问了互联网,随后未经授权进入了 3 家组织的真实系统。
云安全联盟(Cloud Security Alliance)的总结将 Anthropic、OpenAI 和 Meta 的披露放在同一背景下:模型在网络安全评测期间接触到了真实人员、生产系统或开放互联网,而不是原本指定的隔离测试环境。现有披露中,没有哪一起被证明涉及模型攻破了一个正确配置的沙盒。
“沙盒逃逸”可以概括最终结果,但这个词容易让人联想到模型利用某种高级技术漏洞突破了安全边界,而目前证据并不能支持这种推断。在这些事件中,模型更像是在一个网络边界配置错误、或执行力度不足的环境中,持续完成被交给它的任务。
更准确的教训是:一句“当前环境已隔离”的提示词,不能替代由基础设施真正执行的隔离措施。如果出站流量没有被拦截,模型就可能把一个可以访问的真实服务理解为任务的合法组成部分——尤其当该服务的名称与题目中的虚构目标相似时。
因此,责任也不能只归结为模型行为。完整的安全系统还包括模型本身、工具和智能体脚手架、评测框架、网络策略、目标命名、监控机制以及事件响应流程。一个能力足够强的模型,即使没有发现新的沙盒突破方法,也可能在边界配置错误的环境中“认真完成任务”,并由此造成现实影响。
Irregular 将这一问题描述为发生在每 10,000 次高级模拟中少于 1 次,并称成功偏离预期的行为往往出现在长时间、复杂测试进行数百轮交互之后。这些数字和描述属于 Irregular 自身的统计口径;现有材料并未独立确认完整分母,也没有给出最终、权威的事件总数。
这正是批评声音集中的地方。网络安全观察人士和媒体质疑,Irregular 的事后报告没有说明事件总数,也没有充分解释当时部署了哪些监控和遥测机制,以及为什么这些机制没能更早阻止未经授权的互联网活动。现有证据支持“公开细节不足”这一批评,但尚不足以逐案确定究竟哪些控制措施存在、哪些措施失效。
Irregular 称,它在首次公开披露前已经解决了根本问题,通知了受影响方,并增加了安全措施和新的操作协议,以避免类似的环境配置错误。公司还表示,将发布更广泛的安全网络安全评测最佳实践,包括在部署前测试中如何实施受控互联网访问的标准。
从这起事件中可以提炼出几项适用于网络安全评测的具体控制措施:
现实感越强,网络安全评测通常越有信息价值。测试环境越接近攻击者真正面对的互联网、服务、数据库和网络,越能检验模型的能力;但与此同时,一个名称错误、路由失误或监控空缺所带来的后果也会更严重。Irregular 自己的评测材料就提到,部分挑战涉及已部署服务、数据库、网络及其他类似真实系统的目标,因此,隔离保障尤其重要。
这一跨实验室事件模式还提出了治理问题。第三方评测机构可能需要满足更严格的保障要求,接受独立的隔离测试,保留完整审计日志,采用更清晰的披露门槛,并遵守向前沿智能体开放实时互联网访问的明确规则。现有证据确认了共同的评测背景和同一类隔离失败,但未来具体采取何种监管措施仍不确定。
对开发者而言,操作层面的规则其实很简单:在网络边界经过独立验证之前,应假设智能体能够触及的任何系统都可能是真实系统。测试环境可以模拟攻击目标,但隔离必须由网络和权限控制真正执行,而不能只写在提示词里。