Nešlo o ojedinělou chybu. Byla to nejdramatičtější ukázka dříve nezdokumentované třídy zranitelností, kterou Zenity nazývá „PleaseFix“ – rodina zero-click chyb, které postihly všechny hlavní komerční agentní prohlížeče, které výzkumníci testovali .
Při svém důkazu konceptu obešli výzkumníci tříúrovňový bezpečnostní systém OpenAI pomocí tří technik :
Stejný řetězec zneužití bylo možné použít také k neautorizovaným nákupům na Amazonu, což demonstrovalo širší možnost převzetí účtu . Šifrování end-to-end u WhatsAppu nebylo prolomeno – AI agent jednoduše jednal v rámci již autentizovaného uživatelského sezení .
Zenity Labs zveřejnila PleaseFix jako rodinu zero-click zranitelností postihujících všechny hlavní komerční agentní prohlížeče, které testovali . Chyby byly demonstrovány na:
Celkem Zenity našla 20 různých chyb napříč těmito platformami . Hlavní problém je architektonický: agentní prohlížeče jsou navrženy tak, aby autonomně četly webový obsah, řídily se instrukcemi a prováděly akce jménem uživatele – a právě tato autonomie je útočným povrchem . Útočníci unášejí agenty prostřednictvím běžného obsahu a očekávaných akcí, bez potřeby malwaru, exploitů nebo kliknutí uživatele .
Demonstrované dopady útoků zahrnovaly :
Bezpečnostní výzkumníci tvrdí, že současný přístup – vrstvení bezpečnostních filtrů a zábradlí na úrovni promptů na vysoce autonomní AI agenty – je strukturálně nedostatečný . Výzkum Zenity ukázal, že každý agentní prohlížeč mohl být kompromitován stejnou základní technikou: krmením agenta škodlivým obsahem, který byl navržen zpracovávat .
Hlavní problém je v tom, že pravděpodobnostní AI bezpečnostní filtry (které hádají, zda je akce bezpečná) nemohou spolehlivě zastavit útočníka, který dokáže vytvořit nové vstupy, jež těmto filtrům uniknou. Výzkumníci volají po deterministických bezpečnostních bariérách – pevných, vynutitelných omezeních toho, co AI agent smí dělat, bez ohledu na to, jak interpretuje instrukce . Příklady zahrnují:
Dokud takové deterministické kontroly nebudou existovat, třída chyb PleaseFix ukazuje, že agentní prohlížeče mohou být použity jako zbraně proti vlastním uživatelům pouhým zveřejněním obyčejně vypadajícího webového obsahu .