Detta var inte en isolerad bugg. Det var den mest dramatiska demonstrationen av en tidigare odokumenterad klass av sårbarheter som Zenity kallar ”PleaseFix” – en familj av nollklickssårbarheter som drabbade alla stora kommersiella agentiska webbläsare som forskarna undersökte .
Zenitys konceptbevisattack kringgick OpenAI:s treskiktssäkerhetssystem med hjälp av tre tekniker :
Samma exploateringskedja kunde också användas för att göra obehöriga köp på Amazon, vilket visade på en bredare förmåga att ta över konton . WhatsApps end-to-end-kryptering bröts inte – AI-agenten agerade helt enkelt inom användarens autentiserade session .
Zenity Labs avslöjade PleaseFix som en familj av nollklickssårbarheter som drabbade alla stora kommersiella agentiska webbläsare de undersökte . Sårbarheterna demonstrerades på:
Totalt hittade Zenity 20 distinkta brister på dessa plattformar . Kärnproblemet är arkitektoniskt: agentiska webbläsare är utformade för att självständigt läsa webbinnehåll, följa instruktioner och utföra handlingar för användarens räkning – och den autonomi är i sig själv attackytan . Angripare kapar agenter genom vanligt innehåll och förväntade handlingar – utan skadlig kod, utan sårbarhetsutnyttjande och utan att användaren behöver klicka .
De demonstrerade attackutfallen inkluderade :
Säkerhetsforskare hävdar att den nuvarande strategin – att lägga säkerhetsfilter och promptnivåskydd ovanpå mycket autonoma AI-agenter – är strukturellt otillräcklig . Zenitys forskning visade att varje enskild agentisk webbläsare kunde komprometteras med samma grundläggande teknik: att mata agenten med skadligt innehåll som den var utformad för att bearbeta .
Kärnproblemet är att probabilistiska AI-säkerhetsfilter (som gissar om en handling är säker) inte på ett tillförlitligt sätt kan stoppa en angripare som kan skapa nya indata som glider förbi filtren. Forskare efterfrågar deterministiska säkerhetsbarriärer – hårda, verkställbara begränsningar för vad en AI-agent tillåts göra, oavsett hur den tolkar instruktioner . Exempel inkluderar:
Förrän sådana deterministiska kontroller finns, visar PleaseFix-klassen av sårbarheter att agentiska webbläsare kan beväpnas mot sina egna användare helt enkelt genom att publicera vanligt utseende webbinnehåll .