‘Stolen Thoughts’-replay-angrepet – Publisert 10.–11. august 2026 i artikkelen "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867) oppdaget forskerne Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping og Andriushchenko en kritisk arkitektonisk feil. De krypterte ‘tenkeblokkene’ som Anthropic, OpenAI og Google returnerer til API-klienter, er ikke ordentlig forseglet til kilden sin. Disse blokkene kan løftes ut av én samtale og spilles inn i en svakere, mindre beskyttet søskenmodell fra samme leverandør, som deretter skriver ut frontlinjemodellens skjulte resonnement i ren tekst . Angrepet fungerer på tvers av økter, brukerkontoer og modeller innenfor samme leverandørs økosystem . Forskerne bekreftet at teknikken fungerer på alle store frontlinje-KI-selskaper de testet, og lengden på det gjenopprettede resonnementet matcher nesten 1:1 med antall skjulte tenketokener API-et rapporterer .
De utvunnede resonnementsporene gir treningssignaler av høy kvalitet for modell-destillering – praksisen med å bruke en sterkere modells output til å trene en mindre, billigere konkurrerende modell . Denne teknikken står i sentrum av en opphetet kontrovers rundt kinesiske KI-laboratorier:
Bevisene er imidlertid ikke endelige. Forskere som Braden Hancock (Laude Institute) og Nathan Lambert (Allen Institute for AI) argumenterer for at destillering alene ikke kan forklare Kimi K3s fulle kapabiliteter. En mye spredt PDF som hevdet å bevise kjede-av-tanke-destillering, ble kritisert for å kombinere et begrenset eksperiment med udokumenterte påstander .
Feilen introduserer flere konkrete risikoer utover tyveri av immaterielle rettigheter:
Alle tre selskapene ble kontaktet av ‘Stolen Thoughts’-forskerne før publisering. Ifølge rapportering blokkerte OpenAI, Anthropic og Google angrepet på tvers av modeller etter å ha blitt varslet. Spesifikke detaljer om tiltakene deres ble ikke fullt ut oppgitt i publiserte kilder, men sårbarheten ble bekreftet å eksistere i alle tre leverandørenes API-er før lapping . At angrepet ble ‘blokkert’, tyder på at selskapene implementerte serverfikser – sannsynligvis ved å begrense gjenbruk av krypterte resonnementblokker på tvers av forskjellige modellkontekster eller kontoer .
Anthropic hadde allerede offentlig kjempet mot destillering i stor skala og rapporterte om de 24 000 uredelige kontoene og 16 millionene utvekslingene som kinesiske laboratorier brukte for å hente ut Claude-outputs .
Kjernelærdommen fra både REP- og Stolen Thoughts-artiklene er at å skjule eller kryptere resonnementspor er en fundamentalt skjør sikkerhetsstrategi – hvis resonnementet finnes i modellvektene, kan det fremkalles .