Bersama-sama, kerentanan ini telah memberikan bukti forensik baru dalam kontroversi yang sedang berlangsung tentang apakah sistem AI China seperti Kimi K3 milik Moonshot dibangun dengan menyuling (distilling) model-model proprietary Amerika.
Reasoning Exposure Prompting (REP) — Dipublikasikan pada 30 Mei 2026 dalam makalah "Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs" (arXiv:2606.00642), para peneliti Lu, Tsai, Tsai, Popa, dan Yu menunjukkan bahwa bahkan ketika penyedia sengaja menyembunyikan penalaran alur pemikiran, teknik prompting in-konteks yang ringan dapat menarik penalaran tersembunyi itu kembali ke keluaran yang terlihat oleh pengguna. Metode ini, yang disebut shadow-model prompting, menggunakan demonstrasi dari model yang lebih kecil dan tidak dibatasi yang dibungkus dalam format tambahan seperti kode untuk mengekstrak jejak internal dari model korban. Jejak yang dipulihkan cukup detail untuk menyuling model yang lebih kecil .
Serangan Replay 'Stolen Thoughts' — Dipublikasikan pada 10-11 Agustus 2026 dalam makalah "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867), para peneliti Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping, dan Andriushchenko menemukan cacat arsitektural yang kritis. Blok 'berpikir' terenkripsi yang dikembalikan Anthropic, OpenAI, dan Google kepada klien API tidak disegel dengan benar ke sumbernya. Blok-blok ini dapat diangkat dari satu percakapan dan 'diputar ulang' ke model saudara yang lebih lemah dan kurang dijaga dari penyedia yang sama, yang kemudian mencetak penalaran tersembunyi dari model terdepan dalam teks biasa . Serangan ini berhasil lintas sesi, lintas akun pengguna, dan lintas model dalam ekosistem penyedia yang sama . Para peneliti mengkonfirmasi bahwa teknik ini berhasil pada setiap perusahaan AI terdepan besar yang mereka uji, dan panjang penalaran yang dipulihkan cocok hampir 1:1 dengan jumlah token berpikir tersembunyi yang dilaporkan oleh API .
Jejak penalaran yang diekstrak menyediakan sinyal pelatihan berkualitas tinggi untuk distilasi model — praktik menggunakan keluaran model yang lebih kuat untuk melatih model pesaing yang lebih kecil dan lebih murah . Teknik ini berada di pusat kontroversi sengit yang melibatkan laboratorium AI China:
Namun, bukti tersebut tidak bersifat definitif. Para peneliti termasuk Braden Hancock (Laude Institute) dan Nathan Lambert (Allen Institute for AI) berpendapat bahwa distilasi saja tidak dapat menjelaskan kemampuan penuh Kimi K3. Sebuah PDF yang tersebar luas yang mengaku sebagai bukti distilasi alur pemikiran (chain-of-thought) dikritik karena menggabungkan eksperimen terbatas dengan klaim yang tidak didukung .
Cacat ini menimbulkan beberapa risiko konkrit di luar pencurian kekayaan intelektual:
Ketiga perusahaan dihubungi oleh para peneliti 'Stolen Thoughts' sebelum publikasi. Menurut laporan, OpenAI, Anthropic, dan Google memblokir serangan penalaran lintas model setelah diberitahu. Detail spesifik dari mitigasi mereka tidak diungkapkan sepenuhnya dalam sumber yang dipublikasikan, tetapi kerentanan tersebut dikonfirmasi ada di semua API ketiga penyedia sebelum ditambal . Fakta bahwa serangan itu 'diblokir' menunjukkan bahwa perusahaan-perusahaan tersebut menerapkan perbaikan di sisi server — kemungkinan membatasi penggunaan kembali blok penalaran terenkripsi di berbagai konteks model atau akun .
Anthropic sebelumnya telah secara terbuka melawan distilasi dalam skala besar, melaporkan 24.000 akun curang dan 16 juta pertukaran yang digunakan oleh laboratorium China untuk mengekstrak keluaran Claude .
Pelajaran inti dari makalah REP dan Stolen Thoughts adalah bahwa menyembunyikan atau mengenkripsi jejak penalaran adalah strategi keamanan yang pada dasarnya rapuh — jika penalaran itu ada dalam bobot model, maka penalaran itu dapat dimunculkan .