'Stolen Thoughts' replay-angrebet — Offentliggjort den 10.-11. august 2026 i artiklen "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867). Forskerne Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping og Andriushchenko opdagede en kritisk arkitektonisk fejl. De krypterede 'tanke'-blokke, som Anthropic, OpenAI og Google returnerer til API-klienter, er ikke forsvarligt forseglet til deres kilde. Disse blokke kan løftes fra en samtale og afspilles i en svagere, mindre beskyttet søskendemodel fra samme udbyder, som derefter udskriver frontlinjemodellens skjulte ræsonnement i klartekst . Angrebet virker på tværs af sessioner, på tværs af brugerkonti og på tværs af modeller inden for samme udbyders økosystem . Forskerne bekræftede, at teknikken virker på alle større frontlinje-AI-virksomheder, de testede, og længden af det genvundne ræsonnement matcher næsten 1:1 med API'ens rapporterede antal af skjulte tanketegn .
De udtrukne ræsonnementspor giver træningssignaler af høj kvalitet til modeldestillation – praksissen med at bruge en stærkere models output til at træne en mindre, billigere konkurrerende model . Denne teknik er i centrum af en ophedet kontrovers omkring kinesiske AI-laboratorier:
Beviserne er dog ikke endelige. Forskere som Braden Hancock (Laude Institute) og Nathan Lambert (Allen Institute for AI) argumenterer for, at destillation alene ikke kan forklare Kimi K3's fulde kapaciteter. En udbredt PDF, der hævdede at være bevis for destillation af tankekæde, blev kritiseret for at kombinere et begrænset eksperiment med ubegrundede påstande .
Fejlen medfører flere konkrete risici ud over tyveri af intellektuel ejendom:
Alle tre virksomheder blev kontaktet af 'Stolen Thoughts'-forskerne forud for offentliggørelsen. Ifølge rapporteringen blokerede OpenAI, Anthropic og Google angrebet på tværs af modeller efter at være blevet underrettet. Specifikke detaljer om deres afhjælpende foranstaltninger blev ikke fuldt oplyst i de offentliggjorte kilder, men sårbarheden blev bekræftet at eksistere på tværs af alle tre udbyderes API'er før lappning . At angrebet blev 'blokeret' tyder på, at virksomhederne implementerede rettelser på serversiden – sandsynligvis ved at begrænse genbrug af krypterede ræsonnementsblokke på tværs af forskellige modelkontekster eller konti .
Anthropic havde allerede offentligt bekæmpet destillation i stor skala og rapporterede om de 24.000 svigagtige konti og 16 millioner udvekslinger, som kinesiske laboratorier brugte til at udtrække Claude-outputs .
Den grundlæggende lærestreg fra både REP- og Stolen Thoughts-artiklerne er, at det at skjule eller kryptere ræsonnementsspor er en grundlæggende skrøbelig sikkerhedsstrategi – hvis ræsonnementet findes i modelvægtene, kan det fremkaldes .