Adversa melaporkan bahawa teknik itu diuji terhadap Grok 4.5 Fast di grok.com. Satu laporan berasingan mengenai ujian tersebut menyatakan serangan berjaya dalam 40 peratus daripada 20 percubaan antara Jun hingga Ogos 2026. Angka itu merujuk kepada persekitaran ujian penyelidik, bukan jaminan bahawa setiap percubaan atau setiap sesi Grok akan terjejas.
Rantaian serangan yang dilaporkan mempunyai beberapa peringkat:
Halaman web membawa muatan tersembunyi. Penyerang meletakkan teks sifir, arahan penyahsulitan dan bahan kunci pada halaman yang pada zahirnya kelihatan seperti kandungan biasa. Pembinaan yang dilaporkan menggunakan penghasilan kunci berasaskan PBKDF2 serta penyulitan AES-256-GCM.
Imbasan awal tidak mengesan arahan. Penapis Grok boleh memeriksa kandungan halaman yang kelihatan, tetapi arahan berbahaya disembunyikan dalam data yang telah disulitkan. Oleh sebab itu, model tidak dapat mentafsir arahan teks biasa tersebut pada pemeriksaan pertama.
Ejen menjalankan proses penyahsulitan. Apabila pengguna meminta Grok meringkaskan atau menganalisis halaman, ejen itu mengikuti arahan halaman dan menjalankan proses penyahsulitan dalam persekitaran pelaksanaan kodnya.
Arahan kembali masuk ke dalam konteks ejen. Teks yang telah dinyahsulit dipersembahkan sebagai hasil operasi alat. Di sinilah timbul masalah asal-usul kandungan: data yang dikawal penyerang telah berpindah daripada halaman web tidak dipercayai kepada konteks yang mungkin dianggap oleh ejen sebagai hasil operasi yang sah.
Grok mencari data dalam sesi. Dalam bukti konsep, arahan yang telah dinyahsulit meminta Grok mendapatkan nilai seperti nama pengguna, lokasi kasar, tahap langganan dan prom daripada konteks perbualan yang tersedia.
Permintaan pelayar menghantar data keluar. Grok kemudiannya membuka URL yang dikawal penyerang dan meletakkan data yang dikumpulkan dalam parameter pertanyaan URL. Demonstrasi yang dilaporkan selesai tanpa pengesahan tambahan atau amaran yang jelas kepada pengguna.
Skopnya perlu difahami dengan tepat. Bukti yang tersedia menyokong akses kepada prom dan konteks yang diberikan kepada ejen dalam sesi aktif. Dakwaan mengenai “sejarah sembang penuh” tidak sepatutnya ditafsirkan secara automatik sebagai akses kepada setiap perbualan yang disimpan dalam akaun pengguna.
Adversa berkata ia melaporkan isu tersebut kepada xAI melalui HackerOne pada 3 Jun 2026. Penyelidik kemudian menghantar susulan berkaitan penyelarasan pendedahan pada 4 Ogos dan 10 Ogos.
Sehingga 19 Ogos 2026, Adversa berkata pihaknya belum menerima maklum balas substantif dan serangan itu masih boleh dihasilkan semula terhadap Grok. Laporan pada ketika itu menyifatkan isu berkenaan sebagai belum mempunyai pembaikan yang digunakan, pengenal CVE awam atau penyelesaian untuk pengguna.
Status tersebut ialah laporan penyelidik dan media mengenai proses pendedahan, bukannya nasihat keselamatan rasmi daripada xAI. Bahan yang diberikan juga tidak membuktikan bahawa teknik itu telah digunakan terhadap pengguna sebenar di luar demonstrasi penyelidik.
Pertahanan terhadap suntikan arahan lazimnya cuba mengenal pasti bahasa mencurigakan dalam kandungan yang diambil oleh sistem AI. Cryptographic Context Injection mengalihkan arahan berbahaya itu ke peringkat pemprosesan yang lebih lewat.
Model tidak perlu memahami arahan jahat ketika pertama kali mengimbas halaman. Ia hanya perlu mengikut arahan yang kelihatan berguna—contohnya menjalankan rutin penyahsulitan—dalam persekitaran yang dianggap dipercayai. Arahan tersebut hanya menjadi jelas selepas langkah pelaksanaan itu, iaitu ketika ejen mungkin sudah mempunyai akses kepada konteks peribadi serta kebenaran untuk melayari web atau membuat permintaan rangkaian.
Sebab itu, isu ini lebih tepat difahami sebagai masalah seni bina ejen, bukan sekadar kegagalan penapis kata kunci. Apabila ejen boleh membaca kandungan luar, menjalankan kod, mengakses data sesi dan memanggil alat rangkaian, arahan berniat jahat boleh menukar keupayaan tersebut menjadi saluran pengekstrakan data.
Pendedahan Grok mengikuti corak yang semakin biasa: kandungan tidak dipercayai memanipulasi pembantu AI yang mempunyai akses kepada data sensitif atau alat berkuasa.
Persamaan antara kes-kes ini ialah penyerang tidak semestinya perlu menembusi model asas atau sistem operasi secara terus. Mereka hanya perlu menyediakan kandungan yang memang direka untuk dibaca oleh ejen, kemudian memanfaatkan kebenaran ejen itu sendiri untuk mendapatkan maklumat, memanggil alat, mengubah keadaan atau membuat permintaan rangkaian.
Pendedahan ini menunjukkan bahawa keselamatan ejen memerlukan lebih daripada penapis suntikan arahan yang lebih ketat. Antara kawalan penting ialah:
Pengajaran utamanya mudah: ejen AI tidak boleh menganggap sesuatu kandungan itu dipercayai hanya kerana kandungan tersebut dihasilkan oleh alat. Dalam kes Grok yang dilaporkan, serangan itu berjaya menukar halaman web menjadi aliran kerja penyahsulitan dan pelaksanaan—kemudian menggunakan keistimewaan ejen sendiri untuk membawa data peribadi keluar dari sesi.