这比单纯比较模型能力更进一步。一个模型即使在基准测试中表现出色,如果缺少访问权限管理、持续监控、漏洞披露流程或人工监督安排,也不一定适合用于公共服务或关键基础设施场景。
MOU 的第三个重点,是研究前沿模型“可信访问”的政策路径。基本思路是实行分层、受控的模型使用:高能力系统应当能够被用于合法的安全测试和有价值的工作,但不能在缺乏与其能力和风险相匹配的防护措施时,直接向所有人开放。
因此,这份协议所指向的是一条分层安全链:先测试系统,再分享经验;必要时限制访问;同时通过治理规则明确谁负责、如何追责。
Anthropic 的 Claude Mythos Preview 展示了前沿 AI 面临的典型“双重用途”问题。Anthropic 表示,它与约 50 家 Project Glasswing 合作伙伴使用这一受限模型,在具有系统重要性的软件中发现了超过 1 万个高危或严重级别漏洞。Anthropic 还称,Mythos 能够识别并利用主要操作系统和浏览器中的漏洞,包括零日漏洞。
这种能力一方面可以帮助防守方在网络犯罪分子之前发现缺陷;另一方面,如果模型被广泛发布或管理不当,也可能缩短从漏洞发现到实际利用的时间。正因如此,Anthropic 通过 Project Glasswing 向有限合作伙伴开放 Mythos,而不是将其公开发布。
不过,现有证据并不能证明 Claude Mythos 直接促成或触发了 6 月 12 日的新加坡—微软 MOU。更稳妥的理解是:Mythos 体现了网络安全能力快速提升所带来的风险环境,也说明为什么结构化评估、受控访问和治理框架变得越来越重要。
Project Glasswing 的有限访问模式,本身就是风险管理措施。Anthropic 没有把 Mythos 广泛发布,而是向经过筛选的一组合作伙伴提供访问权限,用于防御性安全工作。这样既能让安全团队研究模型的实际能力,也能减少高风险能力的暴露范围。
当然,受限访问并不是完整的安全体系。它还依赖合作方审查、使用监控、安全存储和负责任披露等机制。但它体现了 MOU 所探索的可信访问原则:模型的访问权限应当与其能力和风险相匹配,而不是把每个前沿模型都当作普通公共软件来发布。
发现漏洞只是第一步。新加坡网络安全局(CSA)已建议机构及时修复严重和高危漏洞,在所有接口和网关启用多因素认证,并检查不必要的访问权限。这些措施可以在机构调查和修复问题期间,减少攻击者利用漏洞的机会。
现有证据也不支持把 Mythos 发现的约 1 万个漏洞描述成已经得到广泛修复。一份后续评估称,已向软件维护者披露 1,596 个漏洞,但只有 97 个完成修复。这并不意味着 Project Glasswing 没有产生防御价值,但有关“许多漏洞已经修复”的表述仍应谨慎使用。
这里的启示不仅是技术性的,也是运营层面的:AI 安全必须包括风险识别、负责任披露、修复优先级排序,以及在修复完成前降低系统暴露面的完整流程。
微软能够提供前沿模型研发、企业级基础设施,以及评估和控制 AI 系统访问权限方面的运营经验。不过,根据 MOU 已公布的范围,这项合作并不局限于微软自己的某一个模型,而是关注一般意义上的前沿模型安全测试方法和可信访问框架。
目前提供的证据不足以证明以下内容是这份新加坡—微软协议的正式承诺:微软 MAI 模型的具体安排、通过 Azure AI Foundry 访问 OpenAI 和 Anthropic 模型的相关方案,或微软与英国人工智能安全研究所、美国人工智能标准与创新中心之间的可比协议。上述细节不应被当作本次 MOU 已确认的内容。
综合来看,这份协议构成了一条较为务实的安全链:
这正是这份 MOU 的意义所在。它本身不会让前沿 AI 自动变得安全,也不能消除 Claude Mythos 所展示的风险。它更像是在技术评估、访问治理和网络安全实践之间搭起一座桥,试图在“能力很强”被误认为“已经可以放心使用”之前,为先进 AI 建立更安全、可靠、稳健且可问责的使用条件。