该框架覆盖了完整的攻击链条——供应链投毒(通过白名单和 SBOM)、权限提升(通过 MXC 隔离)、数据外泄(通过运行时护栏和内容过滤)以及未授权工具使用(通过权限控制和人机协同检查)。微软在对代理系统进行一年红队测试后的故障模式分类中补充了零信任代理间架构:对于高风险场景,代理身份应通过加密方式建立,而非仅凭工作流中的位置来假定。
2026 年中期的两项重大举措表明,行业正转向在网络安全中同时将 AI 代理用于攻击和防守,同时施加更严格的安全护栏。
2026 年 7 月 27 日公布,Project Perception 是一个代理安全系统,超越了传统告警生成,实现持续自动化行动。微软将其描述为一个“持续学习的防御系统”,能够“以机器速度进行推理、优先级排序和行动,同时将人工牢牢控制在决策环中”。
为什么重要: 这是一个 AI 代理被赋予主动、自主网络防御角色的具体例子——探测系统、修补漏洞、响应威胁,无需等待人工指令。更严格的控制则来自上面提到的隔离规则:Project Perception 代理仍然在 MXC 容器内运行,受基于策略的护栏约束,并具备可观测性和人工监督。
2026 年 7 月 27 日——就在一起引发广泛关注的 Hugging Face 安全事件数天后——OSAA 成立,这是一个旨在为 AI 代理建设开源安全工具的行业联盟。
为什么重要: OSAA 代表了行业的集体共识:没有任何单一厂商能够独自保障自主代理的安全。联盟对开放模型和共享工具的聚焦,是对封闭专有方法的有意制衡——其核心假设是,更广泛的社区化安全工具将比攻击者跑得更快。英伟达表示:“开放模型使防御能力民主化,增加了防御者的透明度,在保护数据的同时实现网络防御,并以可定制、本地化的控制能力补充前沿封闭模型”。
| 维度 | 微软 | 行业(OSAA / 英伟达) |
|---|---|---|
| 控制理念 | 操作系统级隔离(MXC)、策略护栏、供应链控制 | 开源共享工具、透明指南(SAFE)、社区主导防御 |
| 主动防御 | Project Perception——自主红/蓝/绿代理,实现发现、修复、加固 | 开放代理框架和运行时护栏,支持安全的代理化操作 |
| 应对风险 | 未授权代理行为、数据外泄、供应链投毒 | 代理失控、不透明漏洞披露、碎片化安全工具 |
| 关键约束 | 代理在锁定的容器中运行,受人工定义策略约束 | 共享安全基线和开放框架防止厂商锁定,同时提高基线安全水平 |
模式清晰可见:推动 AI 代理进入主动、自主网络防御角色的同一批公司,也在争相建造防止这些代理本身成为新一代安全威胁的隔离与治理结构。