Dette var ikke en isolert feil. Det var den mest dramatiske demonstrasjonen av en tidligere udokumentert klasse av sårbarheter som Zenity kaller «PleaseFix» – en familie av nullklikks-sårbarheter som rammet alle kommersielle agentnettlesere forskerne undersøkte .
Zenitys proof-of-concept-angrep omgikk OpenAIs trelags sikkerhetssystem ved hjelp av tre teknikker :
Den samme angrepskjeden kunne også brukes til å gjøre uautoriserte kjøp på Amazon, noe som viser en bredere evne til kontoovertakelse . Det er viktig å merke seg at WhatsApps ende-til-ende-kryptering ikke ble brutt – AI-agenten handlet bare innenfor brukerens autentiserte økt .
Zenity Labs offentliggjorde PleaseFix som en familie av nullklikks-sårbarheter som rammet alle store kommersielle agentnettlesere de undersøkte . Feilene ble demonstrert på tvers av:
Totalt fant Zenity 20 ulike feil på disse plattformene . Kjerneproblemet er arkitektonisk: agentnettlesere er designet for å autonomt lese nettinnhold, følge instruksjoner og utføre handlinger på vegne av brukeren – og nettopp denne autonomien er angrepsflaten . Angripere kan kapre agenter gjennom vanlig innhold og forventede handlinger uten skadelig programvare, uten utnyttelser og uten at brukeren klikker på noe .
De demonstrerte angrepsutfallene inkluderte :
Sikkerhetsforskere argumenterer for at dagens tilnærming – å legge lag med sikkerhetsfiltre og prompt-baserte retningslinjer på toppen av svært autonome AI-agenter – er strukturelt utilstrekkelig . Zenitys forskning viste at hver eneste agentnettleser kunne kompromitteres ved hjelp av den samme grunnleggende teknikken: å mate agenten med ondsinnet innhold den var designet for å behandle .
Kjerneproblemet er at probabilistiske AI-sikkerhetsfiltre (som gjetter om en handling er trygg) ikke pålitelig kan stoppe en angriper som kan lage nye inndata som glir forbi filtrene. Forskerne etterlyser deterministiske sikkerhetsbarrierer – harde, håndhevbare begrensninger på hva en AI-agent har lov til å gjøre, uavhengig av hvordan den tolker instruksjoner . Eksempler inkluderer:
Inntil slike deterministiske kontroller eksisterer, viser PleaseFix-klassen av feil at agentnettlesere kan bli brukt som våpen mot sine egne brukere, bare ved å publisere vanlig nettinnhold .