Cornell Tech forskere fant at avanserte KI forskningsagenter er svært sårbare for et enkelt angrep kalt WARP. Angrepet lykkes fordi KI agentene gjenbruker de samme brukerskapte nettsidene for opptil 48 % av relaterte søk.
Research answer

Create a landscape editorial hero image for this Studio Global article: What does a Cornell Tech study reveal about how a single short Reddit comment can trick AI deep-research agents into recommending scams or f. Article summary: A new Cornell Tech preprint (Zhang, Triedman, and Shmatikov) demonstrates that deep-research AI agents are highly vulnerable to a simple attack called **WARP (Web Agent Retrieval Poisoning)**. A single short comment, as . Topic tags: general, academic, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject ""We show that a tiny snippet—just 13 words—of retrieved text on a UGC website like Reddit, Wikipedia, Quora, or Facebook can change AI agents to output spam / scam content pretty c" source context "It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research ..." Reference image 2: visual
Neste gang du spør et KI-forskningsverktøy om den beste datingappen eller hvordan du avslutter et abonnement, kan svaret være plantet av en svindler. Ifølge en ny preprint-studie fra Cornell Tech, utført av Tingwei Zhang, Harold Triedman og Vitaly Shmatikov, er avanserte KI-agenter alarmerende enkle å manipulere gjennom et angrep forskerne kaller WARP (Web Agent Retrieval Poisoning) .
KI-forskningsagenter som STORM, Co-STORM og OmniThink fungerer ved å kjøre mange relaterte søk og syntetisere informasjon til omfattende rapporter. Cornell-forskerne oppdaget en kritisk svakhet: Agentene er ekstremt avhengige av brukergenerert innhold (UGC). Mellom 54 % og 71 % av alle nettadresser som hentes ut i en forskningsøkt, stammer fra UGC-plattformer, med Reddit og Wikipedia som de mest brukte kildene .
Denne konsentrasjonen skaper en angrepsflate. En angriper kan ganske enkelt poste en spesialskrevet kommentar i en eksisterende, populær Reddit-tråd – eller diskret redigere en Wikipedia-artikkel – med mål om å fremme en bestemt aktør, for eksempel et falskt produkt. Fordi agentene stadig henter de samme høytrangerte UGC-sidene på tvers av mange ulike søk innenfor et tema, kan én enkelt forgiftet side infisere hele forskningskonteksten .
Resultatene er slående effektive. Studien viste at en forgiftet tekst på så lite som 13 ord var nok til å oppnå en nevningsrate på 38 % til 62 %. Dette betyr at angriperens mål ble sitert direkte i KI-ens endelige svar i denne andelen av søkene. Studien bekrefter at denne effektiviteten holdt seg på tvers av ulike spørregrupper og underliggende KI-arkitekturer, noe som viser at sårbarheten er strukturell og ikke begrenset til ett enkelt system .
Angrepet får ikke den totale rapporten til å virke meningsløs eller av lav kvalitet. Den injiserte teksten blander seg troverdig med ekte innhold, noe som gjør den subtile promoteringen av et svindelprodukt vanskelig å oppdage for både brukere og automatiserte filtre .
Problemet er overlappende informasjonsinnhenting. Forskerne observerte at de samme Reddit-sidene dukket opp i søkeresultater for så mange som 48 % av relaterte spørsmål i en enkelt emnegruppe . Det betyr at hvis man forgifter godt besøkte Reddit-tråder, kan det påvirke nesten halvparten av alle brukerspørsmål om et gitt tema, fra «beste veihjelp» til «hvordan si opp et abonnement» til «topprangerte datingapper».
Forskerteamet testet tre opplagte forsvarsstrategier og fant at hver av dem enten var ineffektive eller selvmotsigende .
Å blokkere alle UGC-domener stopper angrepet umiddelbart. Men dette forsvaret er verre enn sykdommen: UGC-plattformer tilbyr den rike, detaljerte erfaringsbaserte informasjonen som gjør agenter verdifulle. Å fjerne dem gjør agentene ute av stand til å produsere rapportene brukerne forventer .
Å bruke agentens egen språkmodell til å screene kilder på forhånd, kan fange opp åpenbar forgiftning, men er fundamentalt upålitelig. En velskrevet, forgiftet tekst i samme tone som ekte kommentarer kan enkelt unngå disse sjekkene. Tilnærmingen tilfører også betydelig prosesseringsforsinkelse og kostnad uten proporsjonal sikkerhetsgevinst .
Å utføre troverdighetssjekker på det ferdige produktet kan flagge noen ekstreme anbefalinger. Problemet er at WARP-angrep er designet for å være subtile. Selve rapporten består en plausibilitetssjekk uten åpenbare faresignaler, selv om den nå stille anbefaler et produkt valgt av en angriper .
Studiens konklusjon er nøktern: Sårbarheten er ikke en programfeil som kan fikses, men en fundamental konsekvens av hvordan disse agentene er designet. Deres massive avhengighet av et lite sett sider med brukerskapt innhold, som hentes gjentatte ganger, skaper en konsentrert og utnyttbar angrepsflate som intet eksisterende forsvar kan tette uten samtidig å ødelegge kjernefunksjonaliteten .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Cornell Tech forskere fant at avanserte KI forskningsagenter er svært sårbare for et enkelt angrep kalt WARP.
Cornell Tech forskere fant at avanserte KI forskningsagenter er svært sårbare for et enkelt angrep kalt WARP. Angrepet lykkes fordi KI agentene gjenbruker de samme brukerskapte nettsidene for opptil 48 % av relaterte søk.