Cornell Techin tutkijat havaitsivat, että tekoälyn syvätutkimusagentit ovat erittäin haavoittuvaisia WARP nimellä kutsutulle yksinkertaiselle hyökkäykselle. Hyökkäys onnistuu, koska tekoälyagentit hakevat samoja käyttäjien tuottaman sisällön sivuja jopa 48 prosentissa aiheeseen liittyvistä kyselyistä.
Research answer

Create a landscape editorial hero image for this Studio Global article: What does a Cornell Tech study reveal about how a single short Reddit comment can trick AI deep-research agents into recommending scams or f. Article summary: A new Cornell Tech preprint (Zhang, Triedman, and Shmatikov) demonstrates that deep-research AI agents are highly vulnerable to a simple attack called **WARP (Web Agent Retrieval Poisoning)**. A single short comment, as . Topic tags: general, academic, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject ""We show that a tiny snippet—just 13 words—of retrieved text on a UGC website like Reddit, Wikipedia, Quora, or Facebook can change AI agents to output spam / scam content pretty c" source context "It Is Trivially Easy to Use Reddit to Manipulate AI Search, Research ..." Reference image 2: visual
Kun seuraavan kerran kysyt tekoälyn tutkimustyökalulta, mikä on paras deittisovellus tai miten tilauksen voi peruuttaa, vastaus saattaa olla huijarin istuttama – ja sen ujuttamiseen on tarvittu vain yksi ainoa Reddit-kommenttiin kätketty virke. Cornell Techin tuore esijulkaisu osoittaa, että tekoälyn syvätutkimusagentit ovat hämmentävän helppoja harhautettavia hyökkäyksellä, jota tutkijat kutsuvat nimellä WARP (Web Agent Retrieval Poisoning) .
Syvätutkimusagentit, kuten STORM, Co-STORM ja OmniThink, toimivat tekemällä lukuisia aiheeseen liittyviä hakukyselyitä ja kokoamalla löytämänsä tiedot yhtenäiseksi raportiksi. Cornellin tutkijat löysivät kriittisen heikkouden: nämä agentit nojaavat valtavasti käyttäjien tuottamaan sisältöön. Peräti 54–71 prosenttia kaikista tutkimussession aikana noudetuista verkko-osoitteista tulee käyttäjälähtöisiltä alustoilta, ja Reddit ja Wikipedia ovat kaikkein useimmin käytettyjä lähteitä .
Tämä keskittyminen luo hyödynnettävissä olevan hyökkäyspinnan. Hyökkääjän tarvitsee vain kirjoittaa räätälöity kommentti olemassa olevaan, suosittuun Reddit-ketjuun – tai muokata huomaamattomasti Wikipedia-sivua – tarkoituksenaan mainostaa tiettyä kohdetta, kuten valetuotetta tai petollista palvelua. Koska agentit noutavat toistuvasti samoja korkealle rankattuja käyttäjälähtöisiä sivuja useisiin eri kyselyihin, yksittäinen myrkytetty sivu voi saastuttaa agentin koko tutkimuskontekstin .
Tulokset ovat tehokkuudessaan silmiinpistäviä. Tutkimuksessa havaittiin, että jopa vain 13 sanan mittainen myrkytetty teksti riitti saavuttamaan 38–62 prosentin mainintaprosentin – mikä tarkoittaa, että hyökkääjän kohde mainittiin suoraan agentin tuottamassa lopputuloksessa kyseisellä kyselyvälillä. Tutkimusraportti vahvistaa tämän tehokkuuden toistuneen useissa kyselyklustereissa ja eri agenttiarkkitehtuureissa, mikä osoittaa haavoittuvuuden olevan rakenteellinen, ei yhteen järjestelmään rajoittuva .
Hyökkäys ei tee kokonaisraportista järjetöntä tai heikkolaatuista. Istutettu teksti sulautuu uskottavasti legitiimin sisällön sekaan, minkä vuoksi sekä käyttäjien että automatisoitujen suodattimien on vaikea havaita hienovaraista huijaustuotteen mainostamista .
Ongelman ydin on hakupäällekkäisyys. Tutkijat havaitsivat samojen Reddit-sivujen esiintyvän hakutuloksissa jopa 48 prosentissa aiheeseen liittyvistä kyselyistä yhden aiheklusterin sisällä. Tämä tarkoittaa, että yhden vilkkaasti liikennöidyn Reddit-ketjun myrkyttäminen voi vaikuttaa lähes puoleen kaikista saman aihepiirin käyttäjäkyselyistä, olipa kyse sitten "parhaasta tiepalvelusta", "tilauksen peruuttamisesta" tai "parhaiten arvostelluista deittisovelluksista". Tämä keskittyminen muuntaa yksittäisen vikapisteen laaja-alaiseksi haavoittuvuudeksi .
Tutkimusryhmä testasi kolmea suoraviivaista puolustusstrategiaa ja totesi jokaisen joko tehottomaksi tai itseään vastaan kääntyväksi .
Käyttäjälähtöisten verkkotunnusten täydellinen estäminen pysäyttää hyökkäyksen välittömästi poistamalla saastuneet Reddit- ja Wikipedia-sivut hakupoolista. Tämä puolustuskeino on kuitenkin pahempi kuin itse tauti: käyttäjälähtöiset alustat tarjoavat rikasta, yksityiskohtaista ja kokemusperäistä tietoa, joka tekee syvätutkimusagenteista alun perinkin arvokkaita. Niiden poistaminen tekee agenteista kyvyttömiä tuottamaan käyttäjien odottamia perusteellisia raportteja .
Agenttien oman kielimallin käyttäminen lähteiden seulomiseen ennen hakua saattaa joskus tunnistaa ilmeisen myrkytyksen, mutta on pohjimmiltaan epäluotettavaa. Hyvin laadittu myrkytetty teksti, joka on kirjoitettu samaan sävyyn kuin ympäröivät legitiimit kommentit, väistää nämä tarkastukset helposti. Tämä lähestymistapa lisää myös merkittävästi käsittelyviivettä ja kustannuksia ilman, että turvallisuus paranee samassa suhteessa .
Uskottavuustarkistusten soveltaminen lopulliseen tuotokseen voi liputtaa joitain äärimmäisiä tai loogisesti ristiriitaisia suosituksia. Ongelma on, että WARP-hyökkäykset on suunniteltu olemaan hienovaraisia. Myrkytetty lisäys on lyhyt, kontekstiin sopiva eikä heikennä raportin yleistä laatua. Loppudokumentti läpäisee uskottavuustarkastukset ilman selviä varoitusmerkkejä, vaikka se nyt hiljaisesti suositteleekin hyökkääjän valitsemaa tuotetta .
Tutkimuksen johtopäätös on pysäyttävä. Haavoittuvuus ei ole ohjelmistovirhe, joka voidaan korjata päivityksellä; se on perustavanlaatuinen seuraus siitä, miten nämä agentit on suunniteltu toimimaan. Niiden vahva riippuvuus pienestä joukosta toistuvasti noudettuja käyttäjälähtöisiä sivuja luo keskittyneen, hyödynnettävissä olevan hyökkäyspinnan, jota mikään olemassa oleva puolustus ei voi sulkea rikkomatta samalla agenttien ydintoiminnallisuutta .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Cornell Techin tutkijat havaitsivat, että tekoälyn syvätutkimusagentit ovat erittäin haavoittuvaisia WARP nimellä kutsutulle yksinkertaiselle hyökkäykselle.
Cornell Techin tutkijat havaitsivat, että tekoälyn syvätutkimusagentit ovat erittäin haavoittuvaisia WARP nimellä kutsutulle yksinkertaiselle hyökkäykselle. Hyökkäys onnistuu, koska tekoälyagentit hakevat samoja käyttäjien tuottaman sisällön sivuja jopa 48 prosentissa aiheeseen liittyvistä kyselyistä.