To jednak tylko najbardziej spektakularny przykład. Zenity ujawniło całą rodzinę ataków określaną jako PleaseFix, obejmującą około 20 podatności w pięciu dużych przeglądarkach i agentach AI . Ich wspólnym mianownikiem jest sposób działania tych narzędzi: agent czyta treści ze stron, wiadomości e-mail, dokumentów czy zaproszeń kalendarzowych, a następnie potrafi wykonywać działania w imieniu użytkownika. Problem pojawia się wtedy, gdy potraktuje instrukcje atakującego jako część legalnego zadania .
OpenAI Atlas był przeglądarką opartą na Chromiumie, uruchomioną w październiku 2025 roku. Wyposażono ją w agenta AI, który potrafił przeglądać internet i realizować zadania na polecenie użytkownika .
W demonstracji Zenity łańcuch ataku wyglądał następująco :
Jeśli odbiorca takiej wiadomości również korzystał z Atlasa i wykonał podobne zadanie, atak mógł się powtarzać. W ten sposób demonstracja przypominała samorozprzestrzeniającego się robaka.
Badacze pokazali także, że Atlas mógł zostać nakłoniony do dodania adresu dostawy na zalogowanym koncie Amazon, umieszczenia produktów w koszyku, a następnie zlecenia zakupu asystentowi zakupowemu Rufus — bez wiedzy i zgody użytkownika .
Istotne jest to, że WhatsApp nie został w tym scenariuszu zhakowany. Szyfrowanie end-to-end komunikatora pozostało nienaruszone. Słabość tkwiła w sposobie, w jaki agent przeglądarki interpretował treści i korzystał z już uwierzytelnionych sesji .
PleaseFix nie oznacza jednej konkretnej usterki. Zenity używa tej nazwy wobec klasy podatności, które umożliwiają przejęcie agenta poprzez zwykłą treść przetwarzaną podczas rutynowych działań . Dotyczyło to następujących produktów:
| Przeglądarka lub agent | Firma |
|---|---|
| ChatGPT Atlas | OpenAI |
| Claude in Chrome | Anthropic |
| Gemini in Chrome | |
| Copilot Edge | Microsoft |
| Perplexity Comet | Perplexity AI |
Ataki mogły prowadzić do kradzieży danych, przejęcia poświadczeń, przejęcia kont, a nawet zdalnej kontroli nad urządzeniem . Nie wymagały przy tym klasycznego malware ani wykorzystywania luki w systemie operacyjnym. Wystarczała odpowiednio przygotowana treść, którą agent i tak miał przeczytać .
Skutki przedstawione przez Zenity wykraczały daleko poza wysyłanie spamu:
Pierwszą część badań nad PleaseFix Zenity ujawniło w marcu 2026 roku. Wtedy firma opisała atak na Perplexity Comet, w którym spreparowane zaproszenie w Kalendarzu Google mogło doprowadzić do wykradzenia lokalnych plików i danych z 1Password bez pojedynczego kliknięcia użytkownika .
Spośród testowanych narzędzi Atlas miał najwięcej warstw ochrony: klasyfikator bezpieczeństwa oparty na AI, ograniczoną piaskownicę oraz monity wymagające udziału człowieka przy wrażliwych działaniach . Zenity pokazało jednak, że wszystkie te mechanizmy można było ominąć .
To właśnie jest sedno problemu: agent nie musi zostać „złamany” w tradycyjnym sensie. Może wykonać dokładnie to, do czego został zaprojektowany, ale na podstawie instrukcji pochodzącej od niewłaściwej osoby.
OpenAI poinformowało 9 lipca 2026 roku, że Atlas przestanie działać 9 sierpnia — zaledwie cztery dni po prezentacji na Black Hat . Firma wycofywała samodzielną przeglądarkę, przenosząc jej możliwości agentowe do aplikacji desktopowej ChatGPT, integracji z Chrome, ChatGPT Work oraz Codex .
Zgodnie ze stroną pomocy OpenAI po 9 sierpnia Atlas mógł już nie otwierać stron, nie przeglądać internetu ani nie obsługiwać funkcji przeglądarkowych. Produkt nie miał też otrzymywać dalszych aktualizacji bezpieczeństwa . OpenAI przekazało również, że wdrożyło poprawki dotyczące konkretnych problemów pokazanych przez badaczy .
Wcześniej, po skoordynowanym ujawnieniu podatności Cometa, Perplexity udostępniło poprawki przed marcową publikacją szczegółów . Podczas Black Hat Zenity przedstawiło szersze wyniki po współpracy z firmami objętymi odpowiedzialnym procesem ujawniania podatności .
Najważniejszy wniosek Zenity jest szerszy niż lista błędów w konkretnych produktach. Zdaniem badaczy klasyfikatory bezpieczeństwa oparte wyłącznie na AI są strukturalnie niewystarczające jako główna ochrona agentowych przeglądarek . Same są bowiem modelami podatnymi na zmianę języka, zaciemnianie treści i prompt injection — czyli techniki wykorzystywane w ataku .
Badacze apelują o deterministyczne bariery bezpieczeństwa, których nie da się obejść manipulacją modelem . W praktyce mogłyby one obejmować:
Michael Bargury, CTO Zenity, ujął problem następująco: „Nie da się rozwiązać deterministycznego problemu bezpieczeństwa probabilistycznym klasyfikatorem AI” .
PleaseFix pokazuje wadę konstrukcyjną modelu, w którym agent ufa treściom odczytywanym podczas wykonywania zadania i może na ich podstawie podejmować działania . Podatne okazały się wszystkie główne testowane przeglądarki AI. Nawet Atlas, wyposażony w najsilniejszy zestaw zabezpieczeń, przegrał z połączeniem zmiany języka, zderzenia intencji i nadmiernego zaufania do własnych uprawnień.
Jeśli agenci AI mają bezpiecznie działać na dużą skalę, zabezpieczenia muszą wykraczać poza kolejne filtry i klasyfikatory. Kluczowe będą twarde reguły na poziomie przeglądarki, systemu operacyjnego i sprzętu — takie, których sam model nie może „przekonać”, by je ominął .