持久记忆让 AI 智能体更有用:它可以在不同任务之间保留偏好、过往工作、操作流程和上下文。但这也带来一种独特的安全问题:一旦不可信内容被存入记忆,攻击者未必需要立即让系统出错,只需等待智能体在未来某个看似无关的任务中重新检索到那条被污染的记录。
1
5
延迟式记忆投毒是如何发生的
记忆投毒针对的是智能体日后会当作“自己已积累知识”的信息完整性。其基本链路可概括为:
- 注入: 智能体从其获准读取的普通输入或环境中接触到误导性、对抗性内容;
- 持久化: 该内容被写入长期记忆,并可能与正常笔记、事实记录或历史任务信息混在一起;
- 沉睡: 智能体继续完成看似正常的工作,最初的写入因而不易引起注意;
- 检索: 后续查询、任务、特定措辞或语义相近的上下文触发系统找回这条被污染的记忆;
- 激活: 被找回的内容影响智能体的推理、建议,或对工具的调用。
1
2
5
与普通提示词注入相比,核心差异在于时间错位。恶意记忆一旦写入成功,即使最初的交互没有明显改变智能体行为,也可能影响之后的会话。
1
30
攻击者也不一定要直接改写记忆数据库。以网页智能体为例,研究描述了一种跨会话、跨网站的攻击:智能体在正常运行中浏览到被操纵的网页,记忆随之受污染,随后在另一个任务中被触发。
2
卡尔加里大学相关研究分析了什么
与卡尔加里大学有关联的研究人员分析了 2,614 条模拟的多步骤攻击轨迹,对象是具备记忆能力的大语言模型智能体。研究没有把攻击是否成功简单视为“是或否”,而是考察失陷如何随时间演化,并归纳出四种攻击模式:链式投毒、策略改写、后门触发和缓慢漂移。
14
链式投毒
链式投毒会在多步骤流程的早期埋入一个有害前提。之后的推理可能沿着这个前提,通过一系列表面合理的中间决策,最终导向不安全的结果。安全上的难点在于:若孤立审视,每一步未必都显得明显恶意。
14
策略改写
策略改写是指污染被记住的规则、审批信息、优先级或运行假设。未来任务检索到这些被篡改的记录后,智能体可能遵循攻击者替换进去的策略,而不是原本设定的规则。
14
后门触发
后门式记忆条目会保持沉睡,直到未来任务包含合适的触发条件,例如某个短语、任务情境或语义匹配。既有研究已展示,更广泛的风险在于:一次受污染的观察结果被存储后,可能在不同会话和网站中的后续工作里被激活。
2
14
缓慢漂移
缓慢漂移指的是较小、较不显眼的改变,随着时间推移逐步扭转智能体的建议或行动模式。关于持久记忆失陷的研究发现,之后在词面或语义上相近的任务,可能唤回被污染的记录,并在跨会话过程中诱导出不安全模式。
29
为什么一次性测试容易漏掉风险
卡尔加里团队的分析强调了一个时间维度的问题:某些攻击在注入当下很难与正常行为区分开来。危害与最初的记忆写入相分离,可能只有在之后发生检索时才显现。
14
因此,风险并不一定会线性上升。它可能在数次互动中保持沉寂,等到相关任务、上下文或触发条件使被污染记忆的检索排序足够靠前时,才突然增加。其他研究同样将记忆投毒视为两阶段过程:先注入,再通过后续检索激活。
5
只问一句“智能体是否在这条提示词上失败”,可能带来错误的安全感。逐步测试如果重置上下文、跳过中间会话,或从未运行可能触发记忆的未来任务,也很难复现真正的激活条件。
更合适的测试单位应是完整轨迹,包括:
- 不可信输入,以及是否将其写入记忆的决策;
- 其间穿插的正常会话;
- 可能检索该条目的未来查询及不同语义表述;
- 检索之后智能体的推理过程;
- 以及通过工具或外部系统产生的后续行动。
2
14
对可自主行动的智能体,持久记忆为何风险更高
投毒的即时后果可能只是一次错误回答;真正更大的风险出现在智能体查阅记忆后拥有采取行动的权限时。一次未来检索可能影响邮件发送、网页操作、数据库处理或其他由工具介导的任务。eTAMP 研究尤其表明,仅靠权限型防护未必能阻止一种经由智能体获准查看的环境间接引入的威胁。
2
这意味着,记忆不再只是便利功能,而是运行安全边界的一部分。一个会接收不可信材料、又在日后将其作为有用上下文呈现的记忆系统,可能把早先一次低可见度事件转化为延迟发生的安全事故。
1
4
实用的测试与防护清单
现有研究并未给出一种放之四海而皆准的防御方案,也不能据此判断各组织是否已广泛采用成熟的事件响应实践。但证据足以支持一个结论:持久记忆应被当作需要明确控制措施的安全敏感系统。
跨时间测试,而非只测提示词
对抗性评估应纳入延迟触发、重复会话、穿插的正常任务、不同检索措辞,以及符合实际的工具权限。还应测试:发现可疑记忆写入后,智能体能否恢复到安全状态。
2
14
追踪记忆写入的来源与来历
应记录记忆来自哪里、为何被保存,以及写入时适用何种信任条件。针对长期记忆保护的研究提出,将写入、授权提升以及允许或拒绝的判定写入防篡改日志链,说明可审计的记忆历史具有价值。
31
将记忆与授权分离
被检索出的一条笔记,不应自动拥有已验证指令或正式策略的权威性。对于低信任度或外部来源的记忆,要限制智能体可据此执行的操作;凭据和高影响动作也应彼此隔离。
同时检查写入与检索
检测不能只盯着进入系统的提示词。团队需要看见哪些内容进入记忆、之后检索了什么,以及检索后触发了哪些下游操作。有一种检测思路利用可观察到的“检索到行动”转换关系,但其报告结果依赖具体架构,不应被当作通用解法。
18
预先设计撤销与回滚能力
响应流程应能定位可疑条目,将其隔离或删除;在可行情况下使由其衍生的摘要失效;并审查这些可能受污染记忆被检索后,智能体已经执行过哪些操作。
核心启示
记忆投毒把问题从“智能体此刻能否抵抗恶意提示词”,转变为“它能否安全管理那些会在很久以后影响自身的信息”。对 2,614 条轨迹的分析说明,答案不能由一次互动得出。对于配备记忆的智能体,安全测试必须追踪完整路径:从不可信输入,到存储,再到延迟检索,最终到现实世界中的行动。
14