Co je obzvlášť znepokojivé: injektovaný text nepůsobí v celkové zprávě nijak podezřele. Nenásilně splývá s legitimním obsahem, takže doporučení podvodné služby je velmi těžké odhalit pouhým okem i automatickými filtry .
Jádrem problému je jev, kterému vědci říkají "překrývání výsledků vyhledávání" (retrieval overlap). Studie ukázala, že stejné Reddit stránky se objevovaly ve výsledcích hledání až u 48 % souvisejících dotazů v rámci jednoho tématu. Pokud tedy útočník otráví jeden frekventovaný Reddit příspěvek, může tím ovlivnit odpovědi na téměř polovinu uživatelských otázek k danému tématu – od "nejlepší asistenční služby" až po "jak zrušit předplatné". Z jednoho bodu selhání se tak stává plošná zranitelnost .
Výzkumný tým otestoval tři přímé obranné strategie a všechny buď selhaly, nebo nadělaly víc škody než užitku :
Blokování celých domén, jako je Reddit nebo Wikipedie, útok spolehlivě zastaví. Je to ale jako léčit bolení hlavy gilotinou – právě uživatelský obsah dává agentům schopnost poskytovat bohaté, detailní a pro lidi užitečné informace. Bez těchto zdrojů by nedokázali vytvářet komplexní zprávy, které od nich uživatelé očekávají.
Prověřování zdrojů jazykovým modelem před jejich stažením sice občas odhalí hrubou manipulaci, ale v zásadě je nespolehlivé. Dobře napsaný kus textu, který stylisticky odpovídá okolním legitimním komentářům, těmito kontrolami snadno projde. Navíc toto řešení výrazně zpomaluje celý proces a zvyšuje náklady, aniž by přineslo odpovídající bezpečnostní záruku.
Kontrola věrohodnosti finálního výstupu dokáže odhalit extrémní nebo logicky nesmyslná doporučení. Problém je, že útok WARP je od základu navržen tak, aby byl subtilní. Krátká, kontextově přiléhavá injekce nezhoršuje celkovou kvalitu zprávy, takže celý dokument projde kontrolou bez jediného varovného signálu – jen nyní tiše doporučuje podvodníkem zvolený produkt.
Závěr studie je střízlivý. Nejedná se o softwarovou chybu, kterou by šlo jednoduše opravit. Zranitelnost je fundamentálním důsledkem samotného návrhu těchto agentů. Jejich silná závislost na malém souboru opakovaně stahovaných uživatelských stránek vytváří koncentrovaný a snadno zneužitelný útočný prostor, který žádná existující obrana nedokáže uzavřít, aniž by zároveň rozbila klíčovou funkčnost agentů .