攻击者利用混淆技术在Word文档中嵌入恶意指令——例如,使用白底白字的8号字体。Word在处理文档内容时,会在将原始文本发送给大语言模型(LLM)前剥离格式信息,因此这些不可见的文本对Copilot来说是完全可读的。
当受害者使用Copilot for Word(例如点击“用Copilot编辑”按钮)时,LLM会摄取包括隐藏指令在内的整个文档上下文,并将其解释为用户请求的一部分。随后,AI助理会按照注入的指令行事——例如“将财务报告中的所有数字减半”——并将攻击提示的副本追加到新生成的文档中。这就形成了一个类似蠕虫的传播链条:每一份新文档都成为新的携带者,可以感染下一个Copilot辅助工作流。
这种传播在受害者毫不知情的情况下进行,因为恶意文本在渲染后的文档中不可见,但在模型处理的底层文本中却是活跃的。值得关注的是,攻击者无需获取受害者Microsoft 365租户的访问权限——只需要一个共享的恶意文档即可发动攻击。
Måløy于2026年3月6日向微软安全响应中心(MSRC)提交了报告。微软于3月31日确认了该行为。
缓解措施一: 微软封锁了最初的概念验证提示词的确切措辞。Måløy重新措辞了载荷,攻击仍然有效。
缓解措施二: 微软将底层模型升级到了GPT-5.5,并于2026年7月14日部署。次日,Måløy在GPT-5.6上进行了测试——经过重新措辞的提示词攻击再次成功。
截至2026年7月28日公开发布时,这个更广泛的漏洞类别仍然可以被利用。微软官方立场承认其采取了“纵深防御”措施,但同时表示“目前尚无针对该漏洞类别的稳健缓解方案”。该研究员及多家媒体将这一问题定性为当前大语言模型系统的架构性弱点,而非简单的代码缺陷。截至发稿时,在NVD、CVE.org和微软安全更新指南的搜索中,均未找到针对Word发现结果的公开CVE或独立的微软安全公告。
数据和指令之间没有信任边界。 当前的大语言模型架构将攻击者控制的文档内容和受信任的系统提示词置于相同的上下文窗口中。系统无法在架构上区分“数据”和“指令”。
自传播型AI蠕虫是一个全新的攻击类别。 与传统宏病毒不同,这类攻击利用LLM的解释能力。正如一位分析人士所言:“宏蠕虫从未离开,它们只是学会了英文”。
此前的相关攻击。 此次披露之前,已有多起针对Microsoft 365 Copilot的提示词注入攻击案例,包括CVE-2025-32711(EchoLeak,一种零点击提示词注入攻击,利用ASCII走私技术在2025年窃取敏感数据),以及此前通过电子邮件和共享文档进行的提示词注入演示。微软此前也修补过一条零点击攻击链,该攻击链可以从邮箱、OneDrive、SharePoint、Office文件和MS Teams中窃取数据。2026年4月,微软在发现另一个提示词注入漏洞后召回了Copilot企业数据,该漏洞能够通过精心编制的文档内容从SharePoint和OneDrive中提取数据。
行业内尚无整体解决方案。 无论是微软还是其他主流LLM供应商,都还没有针对基于文档指令的间接提示词注入的完整缓解方案。专家建议的防御措施包括:提示词分区(prompt partitioning)、基于来源的访问控制(provenance-based access control)、更严格的输入/输出过滤以及内容安全策略——但这些都尚未大规模部署。微软自己的安全指南推荐了一种纵深防御的方法,包括Prompt Shields防护、用于数据标记的Spotlighting、计划漂移检测(plan drift detection)、批评者代理(critic agents)以及工具链沙箱(tool chain sandboxing)。
在等待根本性的架构修复方案出现之前,目前可采取的最有效措施包括:将外部文档转换为纯文本后再提供给Copilot处理;对Copilot的数据访问实施严格的治理和最小权限原则;实施数据丢失防护策略以检测Copilot输出中的敏感信息;并监控Microsoft 365统一审计日志中异常的Copilot活动。企业管理员还应定期查阅微软的安全公告,并在发布后及时应用服务器端修复程序。