To nie był pojedynczy błąd. Była to najbardziej spektakularna demonstracja wcześniej nieudokumentowanej klasy luk, którą Zenity nazwało „PleaseFix” – rodziny podatności typu zero-click, które dotknęły każdą komercyjną agentową przeglądarkę, jaką zbadali naukowcy .
Atak proof-of-concept Zenity ominął trójstopniowy system bezpieczeństwa OpenAI przy użyciu trzech technik :
Ten sam łańcuch exploitów mógł zostać użyty do dokonywania nieautoryzowanych zakupów na Amazon, co pokazuje szersze możliwości przejęcia kont . Szyfrowanie end-to-end WhatsApp nie zostało złamane – agent AI po prostu działał w ramach uwierzytelnionej sesji użytkownika .
Zenity Labs ujawniło PleaseFix jako rodzinę luk typu zero-click, które dotykają każdą główną komercyjną agentową przeglądarkę, jaką zbadali . Podatności zademonstrowano w:
Łącznie Zenity znalazło 20 odrębnych luk na tych platformach . Główny problem ma charakter architektoniczny: agentowe przeglądarki są zaprojektowane tak, aby autonomicznie czytać treści internetowe, wykonywać instrukcje i podejmować działania w imieniu użytkownika – a ta właśnie autonomia stanowi powierzchnię ataku . Atakujący przejmują agentów poprzez zwykłe treści i oczekiwane działania, bez użycia złośliwego oprogramowania, exploitów i bez wymogu kliknięcia ze strony ofiary .
Zademonstrowane skutki ataków obejmowały :
Eksperci ds. bezpieczeństwa argumentują, że obecne podejście – nakładanie filtrów bezpieczeństwa i ograniczników na poziomie promptów na wysoce autonomiczne agenty AI – jest strukturalnie niewystarczające . Badania Zenity pokazały, że każdą agentową przeglądarkę można skompromitować, stosując tę samą fundamentalną technikę: dostarczenie agentowi złośliwych treści, które został zaprojektowany do przetwarzania .
Główny problem polega na tym, że probabilistyczne filtry bezpieczeństwa AI (które zgadują, czy dane działanie jest bezpieczne) nie są w stanie niezawodnie zatrzymać atakującego, który może tworzyć nowatorskie dane wejściowe, wymykające się tym filtrom. Badacze wzywają do wprowadzenia deterministycznych barier bezpieczeństwa – twardych, egzekwowalnych ograniczeń tego, co agent AI może zrobić, niezależnie od tego, jak interpretuje instrukcje . Przykłady obejmują:
Dopóki takie deterministyczne mechanizmy kontroli nie zostaną wprowadzone, klasa luk PleaseFix pokazuje, że agentowe przeglądarki mogą być uzbrojone przeciwko własnym użytkownikom – po prostu poprzez opublikowanie zwykle wyglądającej treści internetowej .