Adversa kertoi testanneensa menetelmää Grok 4.5 Fast -mallilla grok.com-palvelussa. Erillisen testiraportin mukaan hyökkäys onnistui 40 prosentissa eli kahdeksassa 20 yrityksestä kesäkuun ja elokuun 2026 välillä. Tulos kuvaa tutkijoiden testiympäristöä, eikä tarkoita, että jokainen yritys tai jokainen Grok-istunto olisi vaarantunut.
Raportoitu hyökkäysketju koostuu useasta vaiheesta:
Verkkosivulle piilotetaan hyötykuorma. Hyökkääjä lisää sivulle salattua dataa, purkuohjeet ja avainmateriaalin. Sivun muu sisältö voi näyttää tavalliselta. Raportoidussa toteutuksessa käytettiin PBKDF2-pohjaista avainten johdantaa ja AES-256-GCM-salausta.
Ensimmäinen tarkistus ei näe komentoa. Grokin suodattimet voivat tarkastella sivun näkyvää sisältöä, mutta vaarallinen ohje on salattu. Malli ei pysty tulkitsemaan plaintext-komentoa eli selkokielistä alkuperäisohjetta ensimmäisen tarkistuksen aikana.
Agentti purkaa salauksen. Kun käyttäjä pyytää Grokia tiivistämään tai analysoimaan sivun, agentti seuraa sivun ohjeita ja suorittaa purkuprosessin koodinsuoritusympäristössään.
Purettu komento palaa agentin kontekstiin. Purettu teksti esitetään työkalutoiminnon tuloksena. Näin hyökkääjän hallitsema sisältö siirtyy epäluotettavalta verkkosivulta ympäristöön, jonka agentti saattaa tulkita toiminnalliseksi tai luotettavaksi tulokseksi.
Grok hakee istunnon yksityisiä tietoja. Adversan proof of concept -esimerkissä purettu ohje käski Grokia etsimään saatavilla olevasta keskustelukontekstista esimerkiksi käyttäjän nimen, karkean sijainnin, tilaustason ja keskustelun kehotteita.
Selainpyyntö lähettää tiedot ulos. Grok avasi hyökkääjän hallitseman URL-osoitteen ja sijoitti kerätyt tiedot sen kyselyparametreihin. Tutkijoiden esittelyssä siirto onnistui ilman uutta vahvistusta tai näkyvää varoitusta.
Tärkeä rajaus koskee vuodon laajuutta. Saatavilla oleva näyttö tukee sitä, että agentti pystyi käsittelemään aktiivisessa istunnossa sille tarjottuja kehotteita ja kontekstia. Mainintaa ”koko chat-historiasta” ei pidä automaattisesti tulkita niin, että hyökkäys olisi antanut pääsyn kaikkiin käyttäjän tilille tallennettuihin keskusteluihin.
Adversan mukaan ongelmasta ilmoitettiin xAI:lle HackerOne-haavoittuvuuksien ilmoitusohjelman kautta 3. kesäkuuta 2026. Tutkijat lähettivät asiasta koordinointia koskevat seurantaviestit 4. ja 10. elokuuta.
19. elokuuta 2026 Adversa kertoi, ettei ollut saanut merkittävää vastausta ja että hyökkäys oli edelleen toistettavissa Grokissa. Tuolloin julkaistujen tietojen mukaan korjausta ei ollut otettu käyttöön, haavoittuvuudella ei ollut julkista CVE-tunnistetta eikä käyttäjille ollut tarjolla kiertoratkaisua.
Tämä tilannekuva perustuu tutkijoiden ja median raportointiin, ei xAI:n omaan julkiseen tietoturvatiedotteeseen. Saatavilla olevat lähteet eivät myöskään osoita, että menetelmää olisi käytetty oikeisiin käyttäjiin tutkijoiden esittelyjen ulkopuolella.
Perinteiset prompt-injektion torjuntamenetelmät etsivät usein epäilyttävää kieltä sisällöstä, jonka tekoälyjärjestelmä hakee. Cryptographic Context Injection siirtää vaarallisen ohjeen myöhempään käsittelyvaiheeseen.
Mallin ei tarvitse ymmärtää haitallista komentoa silloin, kun se ensimmäisen kerran tarkistaa sivun. Sen tarvitsee vain seurata näennäisen hyödyllistä ohjetta, kuten purkurutiinin suorittamista, sille annetussa koodiajoympäristössä. Komento muuttuu luettavaksi vasta suoritusvaiheen jälkeen — tilanteessa, jossa agentilla voi jo olla pääsy yksityiseen keskustelukontekstiin ja oikeus käyttää selain- tai verkkotyökaluja.
Siksi ongelmaa on hyödyllisempää tarkastella agentin arkkitehtuurin riskinä kuin pelkkänä epäonnistuneena avainsanasuodattimena. Kun agentti voi lukea ulkoista sisältöä, suorittaa koodia, käyttää istuntotietoja ja tehdä verkkopyyntöjä, haitallinen ohje voi muuttaa nämä ominaisuudet tiedonvuotokanavaksi.
Grokia koskeva raportti sopii laajempaan kehityskulkuun, jossa epäluotettava sisältö manipuloi avustajia, joilla on pääsy arkaluonteisiin tietoihin tai tehokkaisiin työkaluihin.
Yhteinen nimittäjä on se, ettei hyökkääjän välttämättä tarvitse murtautua suoraan malliin tai käyttöjärjestelmään. Hyökkääjä tarjoaa agentin luettavaksi sisältöä ja hyödyntää sitten agentin omia oikeuksia tietojen hakemiseen, työkalujen kutsumiseen, tilan muuttamiseen tai verkkopyynnön tekemiseen.
Raportoitu hyökkäys osoittaa, että agenttien turvallisuus vaatii muutakin kuin tehokkaampia prompt-injektiosuodattimia. Keskeisiä suojauksia ovat:
Keskeinen opetus on yksinkertainen: agentin ei pidä pitää sisältöä luotettavana vain siksi, että työkalu tuotti sen. Grokin tapauksessa hyökkäys perustui verkkosivun muuttamiseen salauksenpurku- ja suoritusketjuksi — ja agentin omien oikeuksien käyttämiseen yksityisen kontekstin siirtämiseksi istunnon ulkopuolelle.