Dette var ikke en isoleret fejl. Det var den mest dramatiske demonstration af en hidtil udokumenteret klasse af sårbarheder, som Zenity kalder 'PleaseFix' – en familie af nul-klik-sårbarheder, der påvirkede alle større kommercielle agent-styrede browsere, som forskerne undersøgte .
Zenitys proof-of-concept-angreb omgik OpenAIs trelags sikkerhedssystem ved hjælp af tre teknikker :
Den samme udnyttelseskæde kunne også bruges til at foretage uautoriserede køb på Amazon, hvilket demonstrerede en bredere kapacitet til kontoovertagelse . WhatsApps end-to-end-kryptering blev ikke brudt – AI-agenten handlede blot inden for brugerens allerede autentificerede session .
Zenity Labs offentliggjorde PleaseFix som en familie af nul-klik-sårbarheder, der påvirker alle større kommercielle agent-styrede browsere, de undersøgte . Sårbarhederne blev demonstreret på:
I alt fandt Zenity 20 forskellige fejl på tværs af disse platforme . Kernen i problemet er arkitektonisk: agent-styrede browsere er designet til selvstændigt at læse webindhold, følge instruktioner og udføre handlinger på brugerens vegne – og netop denne autonomi er selve angrebsfladen . Angribere kaprer agenter gennem almindeligt indhold og forventede handlinger uden behov for malware, udnyttelser eller et eneste klik fra brugeren .
De demonstrerede angreb inkluderede :
Sikkerhedsforskere argumenterer for, at den nuværende tilgang – at lægge sikkerhedsfiltre og prompt-baserede autoværn oven på stærkt autonome AI-agenter – er strukturelt utilstrækkelig . Zenitys forskning viste, at hver eneste agent-styrede browser kunne kompromitteres ved hjælp af den samme grundlæggende teknik: at fodre agenten med ondsindet indhold, den var designet til at behandle .
Kerneproblemet er, at sandsynlighedsbaserede AI-sikkerhedsfiltre (som gætter på, om en handling er sikker) ikke pålideligt kan stoppe en angriber, der kan skabe nye input, der glider gennem filtrene. Forskere efterlyser deterministiske sikkerhedsbarrierer – hårde, håndhævbare begrænsninger for, hvad en AI-agent må gøre, uanset hvordan den fortolker instruktioner . Eksempler inkluderer:
Indtil sådanne deterministiske kontroller eksisterer, viser PleaseFix-klassen af fejl, at agent-styrede browsere kan bevæbnes mod deres egne brugere blot ved at offentliggøre almindeligt udseende webindhold .