Det kreves bare to API-kall for å utføre angrepet, og forskerne viste at det fungerer i stor skala .
Angrepet avslørte ikke bare resonnementet til toppmodellene – det ga også nytt brennstoff til debatten om hvorvidt det kinesiske AI-selskapet Moonshot AI har trent modellen Kimi K3 ved å destillere (i praksis kopiere) resonnementet fra amerikanske modeller.
Etter å ha hentet ut resonnement-spor fra Claude Opus 4.8 og GPT-5.6 Sol, sammenlignet forskerne dem med utdataene fra åpne vektmodeller, inkludert Kimi K3. De fant at Kimi K3s utdata viste det de beskriver som «unormale sannsynlighetsfenomener» som tett matchet mønstre i Claude- og GPT-resonnementet .
Bevisene er indisielle, ikke endelige. Uavhengige forskere sier funnene «gir noen bevis – men ikke avgjørende bevis – på at visse kinesiske modeller kan ha blitt trent ved å destillere resonnementinformasjon fra amerikanske modeller» . Et annet mistenkelig tegn: da Kimi K3 ble bedt om å identifisere seg selv, svarte den først «Claude av Anthropic»
.
Kimi K3 er en åpen vektmodell med 2,8 billioner parametere, lansert av Moonshot AI 16. juli 2026. Den slår Claude Opus 4.8 på flere tester, men er ikke en entydig leder. På den uavhengige Artificial Analysis Intelligence Index scorer K3 57, mot Claude Fable 5s 60 og GPT-5.6 Sols 59. Moonshot har selv vært uvanlig ærlige på at K3 fortsatt ligger bak GPT-5.6 Sol og Claude Fable 5 totalt sett .
Destilleringsanklagen er ikke ny – både Anthropic og OpenAI har tidligere anklaget kinesiske selskaper for systematisk å destillere modellene deres. En gjennomgang av kinesiske forskningsartikler og patenter viste at kinesiske militærforskere brukte utdata fra OpenAI- og Anthropic-modeller til å trene innenlandske AI-systemer til forsvarsformål .
Lanseringen av Kimi K3 utløste umiddelbar kontrovers. Innen få timer etter lanseringen 16. juli anklaget Anthropic Moonshot for å ha bygget K3 ved å destillere Claude, og påstanden nådde Det hvite hus, noe som økte utsiktene til sanksjoner .
Kritikere av destilleringspåstanden peker imidlertid på et tidsproblem. Claude Opus 4.8 ble lansert like før Kimi K3. Uavhengige forskere sier tidslinjen gjør direkte kopiering «usannsynlig», fordi det rett og slett ikke var nok tid til å trene en modell med 2,8 billioner parametere via destillering fra en modell som nylig hadde blitt lansert . Moonshot hevder K3 er bygget på uavhengig forskning
.
Den samme arkitektoniske svakheten avslørte en praktisk sikkerhetssårbarhet. Fordi toppmodeller noen ganger inkorporerer passord og personopplysninger i resonnementet sitt, inneholdt de krypterte resonnementblokkene som utviklere delte offentlig – i for eksempel agentlogg-filer – sensitiv informasjon som hvem som helst kunne lese dersom de kjente til trikset.
Ved å skanne omtrent 7 000 offentlig delte agentlogg-filer publisert før august 2026 fant forskerne 62 levende API-nøkler, 33 passord og andre sensitive brukerdata – totalt 704 personvernartefakter – gjemt inne i de krypterte resonnementblokkene . Enhver utvikler som publiserte rå agentlogger, kan uforvarende ha eksponert API-nøkler, passord og personidentifiserbar informasjon inne i blokker de trodde ingen kunne lese
. Dette inkluderte logger lagret på offentlige GitHub-repositorier .
Forskerne identifiserte fire misbruksveier som sårbarheten muliggjorde: rekonstruksjon av skjult resonnement, gjenfinning av hemmeligheter innebygget i agentspor, injeksjon av instruksjoner gjennom en kanal som ikke kunne inspiseres, og replay på tvers av økter av blokker som ikke var utløpt .
Alle tre selskapene rullet ut serverbaserte oppdateringer etter at forskerteamet fulgte prosedyrer for ansvarlig varsling .
Forskerne varslet OpenAI, Anthropic, Google, Microsoft og Hugging Face om funnene. Etter at leverandørene gjennomførte endringer, bekreftet reproduserbarhetstester at hovedutvinningsmetoden ikke lenger fungerer mot nåværende API-er . Dokumentasjonen anbefaler nå å fjerne resonnementblokker før man deler logger eller bytter modell midt i en samtale
.
Kryptografiforsker Matthew Green hadde for øvrig rapportert replaysårbarheten på tvers av økter til både OpenAI og Anthropic via deres bug bounty-program i mai 2026, men fikk avvisende svar før den akademiske artikkelen ble publisert .
Oppdateringene er i live fra august 2026, men historiske øktlogger med avkodede resonnementblokker som allerede er hentet ut fra det offentlige nettet, forblir tilgjengelige .
«Stjålne tanker»-angrepet avslører en grunnleggende spenning i utformingen av moderne AI-API-er. Leverandører ønsker å laste resonnementstatus over til klienten for skalerbarhet og lav ventetid, men den kryptografiske bindingen som trengs for å holde denne statusen sikker på tvers av økter, brukere og modeller, krever omhyggelig design. Tilnærmingen med én global krypteringsnøkkel, som Anthropic, OpenAI og Google brukte, var en snarvei som skapte en sikkerhets- og personvernsårbarhet som berørte alle brukere og utviklere som samhandlet med disse API-ene.
Angrepet kommer også midt i en eskalert US-Kina-konflikt om AI-destillering. Selv om bevisene knyttet til Kimi K3 er indisielle, gir de de sterkeste tekniske indikasjonene til dags dato på at destillering kan foregå i stor skala, og gir beslutningstakere og forskere et nytt verktøy for å etterforske opprinnelsen til AI-modeller.