”Stolen Thoughts” – Replay-attacken – Publicerad den 10–11 augusti 2026 i artikeln ”Stealing Reasoning Traces from Proprietary LLM APIs” (arXiv:2608.09867). Forskarna Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping och Andriushchenko upptäckte en kritisk arkitektonisk svaghet. De krypterade ”tanke”-block som Anthropic, OpenAI och Google returnerar till API-klienter är inte ordentligt förseglade till sin källa. Dessa block kan lyftas ur en konversation och spelas upp i en svagare, mindre skyddad syskonmodell från samma leverantör, som sedan skriver ut frontmodellens dolda resonemang i klartext . Attacken fungerar över sessioner, över användarkonton och över modeller inom samma leverantörs ekosystem . Forskarna bekräftade att tekniken fungerar på varje större frontlinje-AI-företag de testade, och längden på de återvunna resonemangen matchar nästan 1:1 det antal dolda tanke-token som API:et rapporterar .
De extraherade resonemangsspåren utgör högkvalitativa träningssignaler för modelldestillering – metoden att använda en starkare modells utdata för att träna en mindre, billigare konkurrentmodell . Denna teknik står i centrum för en het kontrovers kring kinesiska AI-labb:
Bevisen är dock inte definitiva. Forskare som Braden Hancock (Laude Institute) och Nathan Lambert (Allen Institute for AI) argumenterar att destillering ensamt inte kan förklara Kimi K3:s fulla kapacitet. En vida spridd PDF som påstod sig bevisa destillering av chain-of-thought kritiserades för att kombinera ett begränsat experiment med ogrundade påståenden .
Felet medför flera konkreta risker utöver stöld av immateriella rättigheter:
Alla tre företagen kontaktades av ”Stolen Thoughts”-forskarna inför publiceringen. Enligt rapporteringen blockerade OpenAI, Anthropic och Google attacken som utnyttjar korsmodellsresonemang efter att de informerats. Specifika detaljer om deras åtgärder avslöjades inte fullt ut i publicerade källor, men sårbarheten bekräftades finnas i alla tre leverantörernas API:er innan den åtgärdades . Att attacken ”blockerades” tyder på att företagen implementerade åtgärder på serversidan – troligen för att begränsa återanvändningen av krypterade resonemangsblock i olika modellkontexter eller konton .
Anthropic hade redan tidigare offentligen bekämpat destillering i stor skala och rapporterat om de 24 000 bedrägliga kontona och de 16 miljoner konversationerna som kinesiska labb använt för att extrahera Claude-utdata .
Kärnlärdomen från både REP- och Stolen Thoughts-artiklarna är att dölja eller kryptera resonemangsspår är en fundamentalt bräcklig säkerhetsstrategi – om resonemanget finns i modellens vikter kan det framkallas .