Reasoning Exposure Prompting (REP) — Diterbitkan pada 30 Mei 2026 dalam kertas kerja "Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs" (arXiv:2606.00642), penyelidik Lu, Tsai, Tsai, Popa, dan Yu menunjukkan bahawa walaupun pembekal sengaja menyembunyikan pemikiran 'rantai pemikiran', teknik 'prompting' yang ringan boleh menarik pemikiran tersembunyi kembali ke dalam output yang boleh dilihat. Kaedah yang dipanggil 'shadow-model prompting' ini menggunakan demonstrasi daripada model yang lebih kecil dan tidak terhad yang dibalut dalam format seperti kod untuk mengekstrak jejak dalaman model mangsa. Jejak yang dipulihkan adalah cukup terperinci untuk melatih (distill) model yang lebih kecil .
Serangan 'Stolen Thoughts' — Diterbitkan pada 10-11 Ogos 2026 dalam kertas kerja "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867), penyelidik Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping, dan Andriushchenko menemui kelemahan seni bina yang kritikal. Blok 'pemikiran' yang disulitkan yang dikembalikan oleh API Anthropic, OpenAI, dan Google kepada pelanggan tidak dimeteraikan dengan betul kepada sumbernya. Blok-blok ini boleh diambil dari satu perbualan dan dimainkan semula ke dalam model lain yang lebih lemah daripada pembekal yang sama, yang kemudiannya mencetak pemikiran tersembunyi model peringkat hadapan dalam teks biasa . Serangan ini berfungsi merentas sesi, merentas akaun pengguna, dan merentas model dalam ekosistem pembekal yang sama . Penyelidik mengesahkan teknik ini berfungsi pada setiap syarikat AI peringkat hadapan utama yang mereka uji, dan panjang pemikiran yang dipulihkan sepadan hampir 1:1 dengan kiraan token pemikiran tersembunyi yang dilaporkan oleh API .
Jejak pemikiran yang diekstrak menyediakan isyarat latihan berkualiti tinggi untuk distilasi model — amalan menggunakan output model yang lebih kuat untuk melatih model pesaing yang lebih kecil dan lebih murah . Teknik ini berada di tengah-tengah kontroversi hangat mengenai makmal AI China:
Walau bagaimanapun, bukti itu tidak muktamad. Penyelidik termasuk Braden Hancock (Institut Laude) dan Nathan Lambert (Institut AI Allen) berpendapat bahawa distilasi sahaja tidak dapat menjelaskan keupayaan penuh Kimi K3. PDF yang tersebar luas mendakwa bukti distilasi 'rantai pemikiran' dikritik kerana menggabungkan eksperimen terhad dengan tuntutan yang tidak disokong .
Kelemahan ini memperkenalkan pelbagai risiko konkrit di luar kecurian harta intelek:
Ketiga-tiga syarikat telah dihubungi oleh penyelidik 'Stolen Thoughts' sebelum penerbitan. Menurut laporan, OpenAI, Anthropic, dan Google telah menyekat serangan pemikiran rentas model selepas diberitahu. Butiran khusus mengenai langkah mitigasi mereka tidak didedahkan sepenuhnya dalam sumber yang diterbitkan, tetapi kerentanan itu disahkan wujud di seluruh API ketiga-tiga pembekal sebelum pembaikan . Serangan yang 'disekat' menunjukkan syarikat melaksanakan pembaikan di sisi pelayan — mungkin menyekat penggunaan semula blok pemikiran yang disulitkan merentas konteks atau akaun model yang berbeza .
Anthropic sebelum ini telah pun bertempur secara terbuka dengan distilasi berskala besar, melaporkan 24,000 akaun penipuan dan 16 juta pertukaran yang digunakan oleh makmal China untuk mengekstrak output Claude .
Pelajaran teras daripada kedua-dua kertas kerja REP dan Stolen Thoughts adalah bahawa menyembunyikan atau menyulitkan jejak pemikiran adalah strategi keselamatan yang pada asasnya rapuh — jika pemikiran itu wujud dalam pemberat model, ia boleh dikeluarkan .