De 'Gestolen Gedachten' Replay-aanval — Gepubliceerd op 10-11 augustus 2026 in het paper "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867), ontdekten onderzoekers Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping en Andriushchenko een kritieke architectuurfout. De versleutelde 'denkblokken' die Anthropic, OpenAI en Google aan API-klanten retourneren, zijn niet correct aan hun bron gebonden. Deze blokken kunnen uit een gesprek worden gehaald en worden 'afgespeeld' in een zwakker, minder beveiligd zustermodel van dezelfde provider, dat vervolgens de verborgen redenering van het topmodel in platte tekst uitprint . De aanval werkt over verschillende sessies, gebruikersaccounts en modellen binnen het ecosysteem van dezelfde provider . De onderzoekers bevestigden dat de techniek werkt op elk groot AI-bedrijf dat ze testten , en de lengte van de teruggevonden redenering komt bijna 1:1 overeen met het aantal verborgen 'denktokens' dat door de API wordt gerapporteerd .
De geëxtraheerde redeneersporen vormen hoogwaardige trainingssignalen voor modeldistillatie — de praktijk waarbij de output van een sterker model wordt gebruikt om een kleiner, goedkoper concurrerend model te trainen . Deze techniek staat centraal in een verhitte controverse rond Chinese AI-labs:
Het bewijs is echter niet definitief . Onderzoekers zoals Braden Hancock (Laude Institute) en Nathan Lambert (Allen Institute for AI) beargumenteren dat distillatie alleen niet de volledige mogelijkheden van Kimi K3 kan verklaren. Een veelgedeelde PDF die zogenaamd bewijs leverde voor distillatie van de denkketen, werd bekritiseerd omdat het een beperkt experiment combineerde met ongefundeerde beweringen .
De fout brengt meerdere concrete risico's met zich mee, naast diefstal van intellectueel eigendom:
Alle drie de bedrijven werden voorafgaand aan de publicatie door de 'Gestolen Gedachten'-onderzoekers gecontacteerd. Volgens berichtgeving hebben OpenAI, Anthropic en Google de cross-model redeneeraanval geblokkeerd nadat ze op de hoogte waren gesteld. Specifieke details van hun oplossingen werden niet volledig bekendgemaakt in de gepubliceerde bronnen, maar de kwetsbaarheid werd bevestigd te bestaan in de API's van alle drie de providers voordat deze werd verholpen . Het feit dat de aanval 'geblokkeerd' is, suggereert dat de bedrijven server-side fixes hebben doorgevoerd — waarschijnlijk door het hergebruik van versleutelde denkblokken in verschillende modelcontexten of accounts te beperken .
Anthropic was al publiekelijk in de strijd tegen distillatie op grote schaal en rapporteerde de 24.000 frauduleuze accounts en 16 miljoen interacties die Chinese labs gebruikten om Claude-outputs te extraheren .
De kernles uit zowel de REP- als de Gestolen Gedachten-papers is dat het verbergen of versleutelen van redeneersporen een fundamenteel fragiele beveiligingsstrategie is — als de redenering in de modelgewichten bestaat, kan deze worden opgeroepen .