更可怕的是,這種攻擊的高成功率並非只侷限於單一系統。研究證實,無論面對哪種主流的代理人架構(STORM、Co-STORM 或 OmniThink),也不管是在哪個主題類別下的查詢群組,效果都一樣顯著。這說明此弱點是結構性問題,而非某個特定程式的軟體臭蟲。
這項攻擊手法的核心問題,在於所謂的「檢索重疊」(retrieval overlap)。研究人員觀察到,在一個主題集群中,同一個 Reddit 頁面會出現在相關查詢搜尋結果的機率高達 48%。換句話說,只要汙染一條流量不錯的 Reddit 討論串,就能影響到近半數關於該主題的使用者提問,無論是「最好的道路救援服務」、「如何取消某訂閱」還是「最高評價的交友軟體」,全部都有可能中招。這種集中性將一個「單點故障」變成了一個「廣泛性的弱點」。
1. 全面封鎖使用者生成內容網域
這招最直接,只要不讓代理人去擷取 Reddit 或維基百科等有問題的網站,就能立刻阻斷攻擊。但這帖藥的副作用比疾病本身更致命:這些平台所蘊含的豐富、詳盡且充滿經驗分享的資訊,正是 AI 深度研究有價值的主因。一旦移除,代理人根本無法產出使用者期待的深度報告。
2. 以語言模型進行來源篩選
也就是在擷取前,讓代理人用自己的語言模型先判斷來源是否可信。這種做法偶爾能抓到一些過於明顯的汙染,但卻有根本上的不可靠性。一段精心編寫的惡意文字,其語調和風格完全可以與週遭的正常留言如出一轍,輕鬆就能逃過檢查。更糟的是,這會大幅增加處理延遲與成本,但在安全性上的回報卻不成比例。
3. 對最終產出進行合理性檢查
這是指在報告生成後,再次檢查其邏輯一致性或是否有異常推薦。問題在於 WARP 攻擊的設計本來就極其隱蔽,惡意注入的文字簡短、貼合情境,且完全不降低報告的整體品質。這份最終文件能輕易通過所有合理性審查,表面上看不出任何可疑之處,但它卻已在無聲無息中,推薦了攻擊者選擇的產品。
這份研究的結論相當沉重:這並非一個可以靠軟體修補的漏洞,而是這些 AI 代理人設計與運作原理下,一個根本性的後果。它們過度仰賴一小部分被反覆取用的使用者生成內容頁面,形成了一個集中且可被利用的攻擊面。所有現存防禦手段都無法在不破壞代理人核心功能的前提下,有效封閉這個弱點。