Lo scenario partiva da un’azione apparentemente normale: chiedere ad Atlas di iscriversi a una newsletter tramite un link pubblicato su X, l’ex Twitter. Nella pagina erano però nascoste istruzioni malevole scritte in ebraico. La scelta della lingua puntava a eludere i classificatori di sicurezza di OpenAI, addestrati soprattutto sull’inglese, mentre il modello AI riusciva comunque a interpretare il comando .
Dopo aver elaborato la pagina, Atlas apriva in background WhatsApp Web, già autenticato nell’account della vittima, e inviava un messaggio preimpostato a tutti i contatti. Il link poteva così propagarsi: ogni altro utente di Atlas che lo avesse aperto avrebbe potuto ripetere la stessa sequenza . La dimostrazione non sfruttava una falla di WhatsApp: la crittografia end-to-end del servizio non era stata violata. Il problema riguardava il modo in cui l’agente AI legge i contenuti e agisce all’interno delle sessioni già aperte .
I ricercatori hanno inoltre mostrato che Atlas poteva essere manipolato per aggiungere un indirizzo di spedizione a un account Amazon già autenticato, inserire prodotti nel carrello e lasciare che l’assistente AI per lo shopping Rufus completasse l’acquisto, senza il consenso consapevole dell’utente .
La dimostrazione su Atlas rappresenta solo il caso più spettacolare di una famiglia più ampia di vulnerabilità che Zenity ha chiamato PleaseFix. L’indagine riguarda circa 20 difetti distribuiti tra cinque browser o assistenti agentici :
| Browser o assistente | Azienda |
|---|---|
| ChatGPT Atlas | OpenAI |
| Claude in Chrome | Anthropic |
| Gemini in Chrome | |
| Copilot Edge | Microsoft |
| Perplexity Comet | Perplexity AI |
A differenza di un browser tradizionale, un browser agentico non si limita a visualizzare una pagina: interpreta istruzioni e può eseguire attività tra siti e applicazioni. Proprio questa capacità diventa il punto debole. Un aggressore può inserire comandi in un’email, in una pagina web, in un documento o in un invito di calendario, sapendo che l’agente li leggerà durante una normale attività .
In molti casi non servono malware, codice eseguibile o una seconda conferma della vittima. È sufficiente che l’agente elabori un contenuto predisposto per confondere la richiesta legittima dell’utente con quella dell’attaccante .
Secondo Zenity, le catene di attacco analizzate potevano avere conseguenze molto più serie del semplice spam:
Il primo caso pubblico della famiglia PleaseFix era emerso nel marzo 2026 proprio con Comet. In quella dimostrazione, un invito di Google Calendar apparentemente ordinario poteva indurre l’agente a esfiltrare file locali e sottrarre credenziali di 1Password senza che l’utente facesse clic su un link malevolo .
Tra i browser analizzati, Atlas disponeva del maggior numero di livelli di protezione: un classificatore di sicurezza basato sull’AI, un sandbox con esecuzione limitata e richieste di conferma umana per le operazioni sensibili . Zenity ha sostenuto di essere riuscita ad aggirarli tutti .
Il punto centrale è che l’agente non ha dovuto “rompere” il sistema: ha usato permessi che possedeva già, ma per uno scopo diverso da quello immaginato dall’utente.
OpenAI aveva annunciato il 9 luglio 2026 che Atlas avrebbe smesso di funzionare il 9 agosto, appena quattro giorni dopo la presentazione di Black Hat . L’azienda ha deciso di abbandonare Atlas come browser indipendente e di spostare le capacità agentiche legate alla navigazione nell’app desktop di ChatGPT, nell’integrazione con Chrome, in ChatGPT Work e in Codex .
Nella sua pagina di assistenza, OpenAI ha avvertito che dopo il 9 agosto Atlas potrebbe non essere più in grado di aprire pagine, navigare o supportare le funzioni basate sul browser e non riceverebbe ulteriori aggiornamenti di sicurezza . L’azienda ha inoltre dichiarato di aver distribuito correzioni per gli specifici problemi mostrati dai ricercatori .
Gli altri fornitori hanno partecipato al processo di divulgazione coordinata. Perplexity aveva corretto le vulnerabilità di Comet prima della divulgazione pubblica del marzo 2026 . A Black Hat, Zenity ha poi presentato i risultati estesi dopo aver lavorato con le aziende interessate attraverso procedure di divulgazione responsabile .
La conclusione di Zenity è netta: un classificatore AI non può essere l’unica barriera di sicurezza di un agente che ha accesso a account, file e strumenti di pagamento . Un classificatore è a sua volta un modello probabilistico e può essere influenzato da lingue, formati o istruzioni progettate per eluderlo .
I ricercatori chiedono quindi barriere deterministiche, cioè controlli rigidi che non possano essere aggirati semplicemente manipolando il modello. Tra le misure indicate figurano:
Il messaggio attribuito al CTO di Zenity Michael Bargury riassume il problema: «Non si può risolvere un problema di sicurezza deterministico con un classificatore AI probabilistico» .
PleaseFix non descrive semplicemente una serie di bug da correggere. Secondo Zenity, mette in luce un difetto strutturale: i browser agentici devono leggere contenuti non affidabili, ma spesso non riescono a separare le istruzioni dell’utente da quelle nascoste nei contenuti .
Il fatto che siano risultati esposti prodotti di OpenAI, Google, Anthropic, Microsoft e Perplexity indica che il rischio non dipende da un singolo fornitore. Finché un agente potrà usare automaticamente sessioni autenticate e interpretare il web come una fonte di comandi, anche una pagina apparentemente innocua potrà diventare un’istruzione operativa. Per rendere sicura l’adozione su larga scala, la protezione dovrà quindi essere incorporata nell’architettura del browser e del sistema operativo, non affidata soltanto a un altro modello AI .