Der „Stolen Thoughts“-Replay-Angriff — Veröffentlicht am 10.–11. August 2026 in der Arbeit „Stealing Reasoning Traces from Proprietary LLM APIs“ (arXiv:2608.09867), entdeckten die Forscher Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping und Andriushchenko eine kritische architektonische Schwachstelle. Die verschlüsselten „Denkblöcke“, die Anthropic, OpenAI und Google an API-Clients zurückgeben, sind nicht ausreichend an ihre Quelle gebunden. Diese Blöcke können aus einem Gespräch entnommen und in ein schwächeres, weniger geschütztes Schwestermodell desselben Anbieters eingespielt werden, welches dann die versteckte Argumentation des Spitzenmodells im Klartext ausgibt . Der Angriff funktioniert über Sitzungen, Benutzerkonten und Modelle hinweg innerhalb des Ökosystems desselben Anbieters . Die Forscher bestätigten, dass die Technik bei jedem getesteten großen KI-Spitzenunternehmen funktioniert und die Länge der extrahierten Argumentation fast 1:1 mit der vom API gemeldeten Anzahl versteckter Denk-Token übereinstimmt .
Die extrahierten Argumentationsabläufe liefern hochwertige Trainingssignale für die Modelldestillation – die Praxis, die Ausgaben eines stärkeren Modells zu nutzen, um ein kleineres, günstigeres Konkurrenzmodell zu trainieren . Diese Technik steht im Mittelpunkt einer hitzigen Kontroverse um chinesische KI-Labore:
Die Beweise sind jedoch nicht endgültig. Forscher wie Braden Hancock (Laude Institute) und Nathan Lambert (Allen Institute for AI) argumentieren, dass Destillation allein Kimi K3s vollständige Fähigkeiten nicht erklären kann. Ein weit verbreitetes PDF, das einen Beweis für die Destillation der Gedankenkette behauptete, wurde kritisiert, weil es ein begrenztes Experiment mit unbelegten Behauptungen kombinierte .
Die Schwachstelle birgt mehrere konkrete Risiken, die über den Diebstahl geistigen Eigentums hinausgehen:
Alle drei Unternehmen wurden vor der Veröffentlichung von den „Stolen Thoughts“-Forschern kontaktiert. Berichten zufolge haben OpenAI, Anthropic und Google den modellübergreifenden Argumentationsangriff nach der Benachrichtigung blockiert. Einzelheiten zu ihren Gegenmaßnahmen wurden in den veröffentlichten Quellen nicht vollständig offengelegt, aber die Schwachstelle wurde vor der Behebung als in den APIs aller drei Anbieter bestehend bestätigt . Dass der Angriff „blockiert“ wurde, deutet auf serverseitige Korrekturen hin – wahrscheinlich eine Einschränkung der Wiederverwendung verschlüsselter Denkblöcke in verschiedenen Modellkontexten oder Konten .
Anthropic hatte bereits öffentlich gegen die Destillation im großen Stil gekämpft und dabei die 24.000 betrügerischen Konten und 16 Millionen Austausche gemeldet, die chinesische Labore zur Extraktion von Claude-Ausgaben nutzten .
Die grundlegende Lehre aus sowohl den REP- als auch den Stolen-Thoughts-Arbeiten ist, dass das Verstecken oder Verschlüsseln von Argumentationsabläufen eine grundlegend fragile Sicherheitsstrategie ist – wenn die Argumentation in den Modellgewichten existiert, kann sie hervorgerufen werden .