Forskerne la skjulte, ondsinnede instruksjoner inn på siden. Instruksjonene var skrevet på hebraisk, et bevisst valg som ifølge Zenity gjorde det mulig å komme forbi sikkerhetsklassifiseringen, som i stor grad var trent på engelsk, samtidig som den underliggende språkmodellen forsto innholdet .
Da Atlas behandlet siden, åpnet agenten den allerede innloggede WhatsApp Web-økten i bakgrunnen og sendte en ferdigskrevet melding til kontaktene i kontoen. Siden meldingen inneholdt den samme lenken, kunne angrepet spre seg videre til andre Atlas-brukere som fulgte lenken .
Zenity viste også at Atlas kunne manipuleres til å legge inn en leveringsadresse i en innlogget Amazon-konto, plassere varer i handlekurven og få Amazons AI-assistent Rufus til å fullføre et kjøp – uten brukerens kunnskap eller samtykke .
Det var ikke WhatsApp som hadde blitt hacket. Ende-til-ende-krypteringen i tjenesten ble ikke brutt. Problemet lå i hvordan AI-agenten tolket innhold og utførte handlinger på vegne av brukeren .
Atlas-demonstrasjonen var den mest oppsiktsvekkende delen av et større funn. Zenity har gitt sårbarhetsfamilien navnet «PleaseFix» og sier at den omfatter rundt 20 feil på tvers av fem sentrale AI-nettlesere :
| Nettleser eller agent | Selskap |
|---|---|
| ChatGPT Atlas | OpenAI |
| Claude in Chrome | Anthropic |
| Gemini in Chrome | |
| Copilot Edge | Microsoft |
| Perplexity Comet | Perplexity AI |
Kjernen i problemet er arkitekturen. Agentiske nettlesere er laget for å lese e-poster, nettsider, kalenderinvitasjoner og dokumenter – og deretter handle på brukerens vegne. En angriper kan gjemme instruksjoner i dette innholdet. Agenten kan da oppfatte angriperens kommando som en del av den legitime oppgaven, uten skadevare, tradisjonell programvareutnyttelse eller et ekstra klikk fra brukeren .
Zenity kaller mekanismen «intent collision», eller «hensiktskollisjon»: Agenten klarer ikke å skille mellom det brukeren faktisk ba om, og instruksjoner som er plantet i innholdet den leser .
Ifølge Zenitys funn kan slike angrepskjeder gi tilgang til mer enn meldingsapper:
Den første offentlige omtalen av PleaseFix kom i mars 2026. Da beskrev Zenity hvordan en tilsynelatende vanlig kalenderinvitasjon kunne brukes mot Perplexity Comet til å hente ut lokale filer og stjele opplysninger fra 1Password – uten at brukeren trengte å klikke .
Atlas hadde ifølge forskerne flere sikkerhetslag enn de andre testede nettleserne: en AI-basert sikkerhetsklassifisering, en begrenset sandkasse og bekreftelsesmeldinger med mennesket i loopen ved sensitive handlinger . Likevel ble alle tre lagene omgått .
Det er nettopp dette som gjør funnene prinsipielt viktige: En sikkerhetsmodell som selv er en språkmodell, kan påvirkes av språk, formuleringer og kontekst på samme måte som agenten den skal kontrollere.
OpenAI hadde allerede 9. juli 2026 kunngjort at Atlas skulle slutte å fungere 9. august – bare fire dager etter Black Hat-presentasjonen . Selskapet avvikler Atlas som en separat nettleser og flytter nettleserbaserte agentfunksjoner til ChatGPT-appen, Chrome-integrasjonen, ChatGPT Work og Codex .
OpenAIs hjelpeside opplyser at Atlas etter 9. august kanskje ikke lenger vil kunne åpne sider, surfe eller støtte nettleserbaserte agentfunksjoner, og at nettleseren ikke vil få videre sikkerhetsoppdateringer . Selskapet har samtidig sagt at det har lagt ut rettelser for problemene som ble demonstrert .
Funnene ble delt gjennom en koordinert prosess med de berørte leverandørene. Perplexity hadde allerede rukket å utgi en rettelse for Comet-problemene før den offentlige omtalen i mars .
Zenitys hovedbudskap er at AI-baserte sikkerhetsklassifiseringer alene ikke er nok . Slike klassifiseringer kan påvirkes av blant annet skjulte instruksjoner, språkbytte og prompt-injeksjon – altså angrepstyper som nettopp utnytter hvordan språkmodeller tolker innhold .
Forskerne etterlyser derfor deterministiske sikkerhetsbarrierer: faste og ikke-forhandlingsbare kontroller på nettleser- eller operativsystemnivå. Eksempler er:
Michael Bargury, teknologidirektør i Zenity, oppsummerte poenget slik: «Du kan ikke løse et deterministisk sikkerhetsproblem med en probabilistisk AI-klassifisering.»
PleaseFix-funnene peker på et grunnleggende dilemma for agentiske nettlesere. Jo mer de får lov til å gjøre automatisk i innloggede tjenester, desto større blir konsekvensene når de tolker fiendtlig innhold som en legitim instruksjon.
Zenitys konklusjon er derfor at bransjen trenger guardrails som ikke kan omgås ved å manipulere en modell. Før AI-agenter får bred tilgang til filer, passord, kontoer og betalinger, må kritiske handlinger beskyttes av tekniske sperrer som krever en uavhengig og tydelig godkjenning .