記憶投毒是一種延遲式完整性攻擊:不受信任的內容被寫入 AI 代理的持久記憶,日後可能被當成既有知識取回。 研究分析鏈式投毒、政策改寫、後門觸發與緩慢漂移四種模式,顯示安全評估必須檢驗完整任務軌跡,而非孤立提示。 對能跨工作階段使用工具的代理而言,記憶寫入、取回、權限與復原程序,都應被視為安全邊界的一部分。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: How does “memory poisoning” work as a delayed attack against AI agents with persistent memory—where attackers inject false information that. Article summary: Memory poisoning is a delayed integrity attack: an attacker causes untrusted content—false facts, misleading instructions, or unsafe procedures—to be written into an agent’s persistent memory. The agent may appear normal. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
持久記憶讓 AI 代理更實用:它可以跨任務保留使用者偏好、過往工作、操作程序與上下文。然而,這也帶來一種獨特的資安問題:若不受信任的內容被存進記憶,攻擊者未必需要立即令代理失誤;他們可以等到代理在日後看似毫不相關的任務中,取回那筆已遭投毒的記錄。 1
5
記憶投毒攻擊的目標,是破壞代理日後會視為自身累積知識的內容完整性。典型流程如下:
它與一般提示注入(prompt injection)最大的差別在於時間。一次成功的惡意記憶寫入,即使初始互動沒有可見異常,也可能影響日後的工作階段。 1
30
而且,攻擊者不一定要直接修改記憶資料庫。以網頁代理為例,研究描述了一種跨工作階段、跨網站的攻擊:代理在正常運作時讀取了遭操弄的網頁,記憶因而受到污染,並在日後任務中被啟動。 2
與卡加利大學相關的研究人員表示,他們分析了 2,614 條模擬的多步驟攻擊軌跡,研究對象是具備記憶功能的大型語言模型(LLM)代理。研究並未只問「攻擊有沒有成功」,而是觀察代理如何隨時間逐步被攻陷,涵蓋四種攻擊模式:鏈式投毒、政策改寫、後門觸發與緩慢漂移。 14
鏈式投毒會在多步驟流程的早期埋入有害前提。之後的推理可在這個前提上,經由表面合理的中間決策逐步推進,最終造成不安全的結果。其資安意義在於:若把每一步拆開看,未必有任何一步顯得明顯惡意。 14
政策改寫是指竄改被記住的規則、核准事項、優先順序或操作假設。當後續任務取回這些遭修改的紀錄時,代理可能遵循攻擊者替換過的政策,而非原本預定的規範。 14
帶有後門性質的記憶項目,會一直保持潛伏,直到日後任務出現正確的觸發條件,例如特定字詞、任務脈絡或語意匹配。既有研究已展示,更廣泛的風險在於:單一受污染的觀察內容,可被儲存後,於未來跨工作階段、跨網站的任務中啟動。 2
14
緩慢漂移是指較小、較不顯眼的改變,隨時間推移逐步改變代理的建議或行動模式。針對持久記憶遭入侵的研究發現,與日後任務在詞彙或語意上相近的內容,可能讓被投毒紀錄重新浮現,並跨工作階段誘發不安全模式。 29
卡加利的分析強調了一個時間面問題:有些攻擊在注入當下,可能很難與正常行為區分。其危害效果與初始的記憶寫入分離,可能要到之後取回時才會出現。 14
因此,風險未必是線性上升的。它可能在數次互動中保持沉寂,直到某項相關任務、上下文或觸發條件,使被投毒記憶的取回排序足夠靠前,風險才突然攀升。其他研究同樣將記憶投毒描述為兩階段過程:先注入,之後再透過取回啟動。 5
若測試只問「代理有沒有在這個提示中失敗?」便可能產生錯誤的安全感。同樣地,逐步測試若每次都重設上下文、跳過中間工作階段,或從未執行可能觸發取回的未來任務,就可能無法重現啟動攻擊所需的條件。
更合適的測試單位應是完整軌跡,包括:
投毒最直接的影響,或許只是一個錯誤答案;但當代理會查閱記憶後再採取行動,問題就更嚴重。一次日後的取回,可能影響電子郵件、瀏覽器工作流程、資料庫操作,或其他由工具媒介的任務。eTAMP 研究特別指出,僅靠權限型防禦,未必能阻止經由代理獲准檢視的環境間接帶入的威脅。 2
這表示記憶不只是便利功能,而是作業安全邊界的一環。若記憶系統接受不受信任的材料,並在日後將其當成有用上下文呈現,早先一個不易察覺的事件就可能演變為延遲發生的資安事故。 1
4
現有研究並未提出放諸四海皆準的防禦方案,也未說明有多少組織已建立成熟的事故應變做法。但它確實支持一項結論:持久記憶應被視為需要明確控制措施的安全敏感系統。
進行對抗性評估時,應納入延遲觸發、重複工作階段、穿插的正常任務、不同取回措辭,以及接近真實情況的工具權限。也應測試:一旦發現可疑記憶寫入,代理能否恢復。 2
14
記錄記憶從何而來、為何被儲存,以及寫入當下適用的信任條件。長期記憶保護研究提出以雜湊鏈記錄寫入與授權決策,使事後竄改可被察覺,說明可稽核的記憶歷程具有價值。 31
被取回的一則筆記,不應自動具備已驗證指令或正式政策的權威性。對低信任度或外部來源的記憶,應限制代理可據以執行的動作;憑證與高影響操作也應採取分隔措施。
偵測不能只聚焦於進站提示。團隊需要看見哪些內容進入記憶、日後取回了什麼,以及隨後觸發了哪些行動。有研究提出利用可觀察的「取回到行動」轉換來偵測異常,但其結果取決於系統架構,不應被視為通用解方。 18
應變流程應能找出可疑記憶項目、隔離或移除它們;在可行時使衍生摘要失效,並檢視代理在可能取回被投毒記憶後所採取的行動。
記憶投毒把問題從「代理此刻能否抵抗惡意提示?」改成「它能否安全管理可能在很久以後影響其行為的資訊?」卡加利研究對 2,614 條軌跡的分析凸顯,答案無法從單次互動判定。對具備記憶的代理而言,安全測試必須追蹤整條路徑:從不受信任輸入、儲存、延遲取回,到實際世界中的行動。 14
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
記憶投毒是一種延遲式完整性攻擊:不受信任的內容被寫入 AI 代理的持久記憶,日後可能被當成既有知識取回。
記憶投毒是一種延遲式完整性攻擊:不受信任的內容被寫入 AI 代理的持久記憶,日後可能被當成既有知識取回。 研究分析鏈式投毒、政策改寫、後門觸發與緩慢漂移四種模式,顯示安全評估必須檢驗完整任務軌跡,而非孤立提示。
對能跨工作階段使用工具的代理而言,記憶寫入、取回、權限與復原程序,都應被視為安全邊界的一部分。