Apabila pengguna membuat pertanyaan kepada model peringkat hadapan seperti Claude Opus 4.8 atau GPT-5.6 Sol melalui API, model tersebut melakukan penaakulan langkah demi langkah dalaman—'rantaian pemikiran'nya—dan mengembalikan penaakulan itu kepada klien sebagai blok teks yang disulitkan. Pada panggilan seterusnya, klien menghantar semula blok ini kepada API, membolehkan model meneruskan penaakulannya tanpa penyedia menyimpan keadaan perantaraan di bahagian pelayan .
Apa yang ditemui oleh penyelidik ialah blok-blok yang disulitkan ini tidak terikat pada sesi, pengguna, atau model tertentu. Ia berkongsi satu kunci penyulitan global tunggal merentas semua sesi dan pengguna . Ini bermakna blok yang ditangkap daripada satu perbualan boleh dimainkan semula dalam konteks lain. Intinya: suapkan blok daripada model peringkat hadapan yang dikawal ketat ke dalam model 'adik' yang lebih lemah dan kurang selaras daripada penyedia yang sama (contohnya, Claude Haiku), dan model yang lebih lemah—yang mempunyai kurang benteng penolakan—akan menyahkod dan mengeluarkan kandungan blok tersebut secara verbatim
.
Hanya dua panggilan API diperlukan untuk melaksanakan serangan ini: satu untuk menangkap blok yang disulitkan dan satu lagi untuk menyuapkannya kepada model yang lebih lemah. Penyelidik menunjukkan bahawa serangan itu berfungsi secara berskala .
Serangan itu bukan sahaja mendedahkan penaakulan model peringkat hadapan—ia juga memberikan bukti baharu dalam perdebatan berterusan sama ada syarikat AI China, Moonshot AI, melatih model Kimi K3 dengan menyuling (pada asasnya menyalin) penaakulan model AS.
Selepas mengekstrak jejak penaakulan daripada Claude Opus 4.8 dan GPT-5.6 Sol, penyelidik membandingkannya dengan output model berat terbuka, termasuk Kimi K3. Mereka mendapati bahawa output Kimi K3 mempamerkan apa yang mereka gambarkan sebagai 'fenomena kebarangkalian abnormal' yang hampir sama dengan corak yang terdapat dalam jejak penaakulan Claude dan GPT .
Bukti ini bersifat keadaan, bukan muktamad. Penyelidik bebas mengatakan penemuan ini 'memberikan beberapa bukti—walaupun bukan bukti konklusif—bahawa model China tertentu mungkin telah dilatih dengan menyuling maklumat penaakulan daripada model AS' . Penemuan tambahan yang menunjukkan: apabila diminta untuk mengenal pasti diri, Kimi K3 pada mulanya dikenal pasti sebagai 'Claude' oleh Anthropic, menambah bahan api kepada tuduhan
.
Kimi K3 ialah model berat terbuka dengan 2.8 trilion parameter yang dikeluarkan oleh Moonshot AI pada 16 Julai 2026. Ia mengatasi Claude Opus 4.8 pada beberapa penanda aras, tetapi ia bukanlah peneraju yang tidak jelas. Pada Indeks Kecerdasan Analisis Buatan bebas, K3 mendapat skor 57 berbanding 60 Claude Fable 5 dan 59 GPT-5.6 Sol. Moonshot sendiri agak jujur bahawa K3 masih ketinggalan di belakang GPT-5.6 Sol dan Claude Fable 5 secara keseluruhan .
Tuduhan penyulingan bukanlah perkara baharu—kedua-dua Anthropic dan OpenAI sebelum ini menuduh firma China menyuling model mereka secara sistematik. Semakan kertas akademik dan paten China mendedahkan penyelidik tentera China menggunakan output daripada model OpenAI dan Anthropic untuk melatih sistem AI domestik bagi keupayaan pertahanan .
Pelancaran Kimi K3 mencetuskan kontroversi serta-merta. Dalam beberapa jam selepas dikeluarkan pada 16 Julai, Anthropic menuduh Moonshot membina K3 dengan menyuling Claude, dan dakwaan itu sampai ke Rumah Putih, menimbulkan prospek sekatan .
Walau bagaimanapun, pengkritik dakwaan penyulingan menunjukkan masalah garis masa. Claude Opus 4.8 dikeluarkan tidak lama sebelum pelancaran Kimi K3. Penyelidik bebas mengatakan garis masa menjadikan penyalinan terus 'tidak munasabah' kerana sememangnya tidak ada masa yang cukup untuk melatih model 2.8 trilion parameter menggunakan penyulingan daripada model yang baru sahaja dikeluarkan . Moonshot berhujah K3 dibina daripada penyelidikan bebas
.
Kelemahan seni bina yang sama mendedahkan kelemahan keselamatan praktikal. Kerana model peringkat hadapan kadangkala menggabungkan bukti kelayakan dan data peribadi ke dalam proses penaakulan mereka, blok alasan yang disulitkan yang dikongsi oleh pemaju secara terbuka—dalam log sesi ejen, sebagai contoh—mengandungi maklumat sensitif yang boleh dibaca oleh sesiapa sahaja yang mengetahui helah tersebut.
Dengan mengimbas kira-kira 7,000 log sesi ejen yang dikongsi secara terbuka yang diterbitkan sebelum Ogos 2026, penyelidik menemui 62 kunci API langsung, 33 kata laluan, dan data pengguna sensitif lain—jumlah 704 artifak privasi—tersembunyi di dalam blok alasan yang disulitkan . Mana-mana pemaju yang menerbitkan log ejen mentah mungkin telah secara tidak sedar mendedahkan kunci API, kata laluan, dan maklumat pengenalan peribadi di dalam blok yang mereka percaya tidak boleh dibaca oleh sesiapa
. Ini termasuk log yang disimpan di repositori GitHub awam .
Penyelidik mengenal pasti empat laluan penyalahgunaan berbeza yang dimungkinkan oleh kelemahan ini: pembinaan semula penaakulan tersembunyi, pemulihan rahsia yang tertanam dalam jejak ejen, suntikan arahan melalui saluran yang tidak boleh diperiksa, dan main semula silang sesi bagi blok yang belum tamat tempoh .
Ketiga-tiga syarikat menggunakan tampung bahagian pelayan selepas pasukan penyelidik mengikut prosedur pendedahan bertanggungjawab .
Penyelidik mendedahkan penemuan mereka kepada OpenAI, Anthropic, Google, Microsoft, dan Hugging Face. Selepas penyedia melaksanakan perubahan, pemeriksaan kebolehulangan mengesahkan teknik pengekstrakan utama tidak lagi berjaya terhadap binaan API semasa . Dokumentasi kini menasihatkan menanggalkan blok penaakulan sebelum berkongsi log atau menukar model di tengah-tengah perbualan
.
Menariknya, penyelidik kriptografi Matthew Green telah secara berasingan melaporkan kelemahan main semula silang sesi kepada kedua-dua OpenAI dan Anthropic melalui program ganjaran pepijat mereka pada Mei 2026, tetapi menerima respons yang mengetepikan sebelum kertas akademik diterbitkan .
Tampung telah berkuat kuasa mulai Ogos 2026, tetapi log sesi sejarah dengan blok penaakulan yang telah dinyahkod yang telah dikikis dari web awam masih boleh diakses .
Serangan 'fikiran dicuri' mendedahkan ketegangan asas dalam reka bentuk API AI moden. Penyedia mahu melepaskan keadaan penaakulan kepada klien untuk kebolehskalaan dan kependaman, tetapi pengikatan kriptografi yang diperlukan untuk memastikan keadaan itu selamat merentas sesi, pengguna, dan model memerlukan reka bentuk yang teliti. Pendekatan kunci penyulitan global tunggal yang digunakan oleh Anthropic, OpenAI, dan Google adalah jalan pintas yang mencipta kelemahan keselamatan dan privasi yang menjejaskan setiap pengguna dan pemaju yang berinteraksi dengan API ini.
Serangan itu juga terletak di tengah-tengah konflik AS-China yang semakin memuncak mengenai penyulingan AI. Walaupun bukti mengenai Kimi K3 bersifat keadaan, ia memberikan bukti teknikal terkuat setakat ini bahawa penyulingan mungkin berlaku secara berskala, dan ia memberikan penggubal dasar dan penyelidik alat baharu untuk menyiasat asal usul model AI.