Naukowcy z Cornell Tech wykazali, że agenci AI do badań internetowych (deep research) są wyjątkowo podatni na prosty atak o nazwie WARP. Atak kończy się sukcesem, ponieważ agenci AI pobierają te same strony z treściami od użytkowników nawet w 48% powiązanych ze sobą zapytań.
Research answer

Create a landscape editorial hero image for this Studio Global article: What does a Cornell Tech study reveal about how a single short Reddit comment can trick AI deep-research agents into recommending scams or f. Article summary: A new Cornell Tech preprint (Zhang, Triedman, and Shmatikov) demonstrates that deep-research AI agents are highly vulnerable to a simple attack called **WARP (Web Agent Retrieval Poisoning)**. A single short comment, as . Topic tags: general, academic, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject ""We show that a tiny snippet—just 13 words—of retrieved text on a UGC website like Reddit, Wikipedia, Quora, or Facebook can change AI agents to output spam / scam content pretty c" source context "It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research ..." Reference image 2: visual
Gdy następnym razem zapytasz narzędzie AI o najlepszą aplikację randkową lub jak anulować subskrypcję, odpowiedź może być już spreparowana. Wystarczy jeden sprytnie napisany komentarz w serwisie Reddit. Nowa publikacja naukowców z Cornell Tech – Tingwei Zhanga, Harolda Triedmana i Vitaly’ego Shmatikova – dowodzi, że agenci AI typu deep research są alarmująco łatwi w manipulacji za pomocą ataku nazwanego przez badaczy WARP, czyli Web Agent Retrieval Poisoning .
Agenci badawczy tacy jak STORM, Co-STORM czy OmniThink działają poprzez zadawanie wielu powiązanych zapytań i syntezę zebranych informacji w kompleksowy raport. Naukowcy z Cornell odkryli ich piętę achillesową: agenci ci w przeważającej mierze polegają na treściach tworzonych przez użytkowników (UGC). Od 54% do 71% wszystkich adresów URL pobieranych podczas sesji badawczej pochodzi z platform UGC, a Reddit i Wikipedia to najczęściej konsultowane źródła .
Ta koncentracja tworzy pole do ataku. Oszust po prostu zamieszcza spreparowany komentarz w istniejącym, popularnym wątku na Reddicie – lub dyskretnie edytuje stronę na Wikipedii – w celu wypromowania konkretnego podmiotu, na przykład fałszywego produktu lub nieuczciwej usługi. Ponieważ agenci wielokrotnie pobierają te same, wysoko notowane strony UGC dla wielu różnych zapytań na dany temat, pojedyncza zatruta strona może zainfekować cały kontekst badawczy agenta .
Wyniki badań są uderzające. Okazało się, że zatruty tekst o długości zaledwie 13 słów wystarczył, aby osiągnąć wskaźnik wzmiankowania na poziomie od 38% do 62%. Oznacza to, że wskazany przez atakującego podmiot był bezpośrednio cytowany w końcowym raporcie AI dla tego zakresu zapytań. Badanie potwierdza tę skuteczność w wielu klastrach zapytań i dla różnych architektur agentów, co dowodzi, że nie jest to luka w pojedynczym systemie, a strukturalna słabość całej technologii .
Co gorsza, atak nie sprawia, że raport staje się nonsensowny lub niskiej jakości. Wstrzyknięty tekst wiarygodnie wtapia się w legalną treść, przez co subtelna promocja oszukańczego produktu jest trudna do wykrycia zarówno dla użytkowników, jak i automatycznych filtrów .
Sednem problemu jest tak zwane nakładanie się wyników wyszukiwania. Badacze zaobserwowali, że te same strony Reddita pojawiały się w wynikach dla nawet 48% powiązanych zapytań w ramach jednego klastra tematycznego. Oznacza to, że zatrucie jednego popularnego wątku na Reddicie może wpłynąć na odpowiedzi AI na niemal połowę zapytań użytkowników na ten temat – od „najlepszej pomocy drogowej”, przez „jak anulować subskrypcję”, po „najwyżej oceniane aplikacje randkowe”. Ta koncentracja zamienia pojedynczy punkt awarii w szerokie, podatne na atak spektrum możliwości .
Zespół badawczy przetestował trzy proste strategie obronne i odkrył, że każda z nich jest albo nieskuteczna, albo przynosi efekt odwrotny do zamierzonego .
Całkowite blokowanie domen UGC natychmiast powstrzymuje atak, usuwając skażone strony Reddita i Wikipedii z puli danych. Jednak ta obrona jest lekarstwem gorszym od choroby: platformy UGC dostarczają bogatych, szczegółowych i opartych na doświadczeniach informacji, które w pierwszej kolejności czynią agentów deep research wartościowymi. Ich usunięcie sprawia, że agenci nie są w stanie tworzyć dokładnych raportów, których oczekują użytkownicy .
Wykorzystanie własnego modelu językowego agenta do weryfikacji źródeł przed ich pobraniem czasami wyłapuje oczywiste zatrucia, ale jest zasadniczo zawodne. Dobrze spreparowany tekst, napisany w tym samym tonie co otaczające go legalne komentarze, z łatwością omija te kontrole. Podejście to zwiększa również znacząco opóźnienia i koszty przetwarzania, nie dając proporcjonalnego wzrostu bezpieczeństwa .
Stosowanie kontroli wiarygodności do końcowego wyniku może oznaczyć niektóre skrajne lub logicznie niespójne rekomendacje. Problem polega na tym, że ataki WARP są zaprojektowane tak, aby były subtelne. Zatruta treść jest krótka, odpowiednia do kontekstu i nie obniża ogólnej jakości raportu. Końcowy dokument przechodzi testy wiarygodności bez żadnych widocznych czerwonych flag, mimo że po cichu poleca produkt wybrany przez atakującego .
Wniosek z badania jest otrzeźwiający. Opisana podatność nie jest błędem w oprogramowaniu, który można załatać; jest fundamentalną konsekwencją sposobu, w jaki te systemy są zaprojektowane. Ich duże uzależnienie od małego zestawu wielokrotnie pobieranych stron UGC tworzy skoncentrowaną, podatną na ataki powierzchnię, której żadne istniejące zabezpieczenie nie jest w stanie uszczelnić, nie niszcząc przy tym podstawowej funkcjonalności agentów .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Naukowcy z Cornell Tech wykazali, że agenci AI do badań internetowych (deep research) są wyjątkowo podatni na prosty atak o nazwie WARP.
Naukowcy z Cornell Tech wykazali, że agenci AI do badań internetowych (deep research) są wyjątkowo podatni na prosty atak o nazwie WARP. Atak kończy się sukcesem, ponieważ agenci AI pobierają te same strony z treściami od użytkowników nawet w 48% powiązanych ze sobą zapytań.