L'Attacco 'Stolen Thoughts' — Pubblicato il 10-11 agosto 2026 nel paper 'Stealing Reasoning Traces from Proprietary LLM APIs' (arXiv:2608.09867), i ricercatori Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping e Andriushchenko hanno scoperto un difetto architetturale critico. I blocchi di 'pensiero' crittografati che Anthropic, OpenAI e Google restituiscono ai client API non sono adeguatamente legati alla loro fonte. Questi blocchi possono essere prelevati da una conversazione e 'reindirizzati' (replay) a un modello 'fratello' più debole e meno protetto dello stesso fornitore, che poi stampa il ragionamento nascosto del modello avanzato in testo chiaro . L'attacco funziona tra sessioni diverse, tra account utente diversi e tra modelli diversi all'interno dello stesso ecosistema del fornitore . I ricercatori hanno confermato che la tecnica funziona su tutte le principali aziende di IA di frontiera testate, e la lunghezza del ragionamento recuperato corrisponde quasi 1:1 al conteggio dei token di pensiero nascosti segnalato dall'API .
Le tracce di ragionamento estratte forniscono segnali di addestramento di alta qualità per la distillazione del modello — la pratica di usare gli output di un modello più forte per addestrarne uno più piccolo ed economico . Questa tecnica è al centro di un'accesa controversia che coinvolge i laboratori di IA cinesi:
Tuttavia, le prove non sono definitive. Ricercatori come Braden Hancock (Laude Institute) e Nathan Lambert (Allen Institute for AI) sostengono che la sola distillazione non può spiegare tutte le capacità di Kimi K3. Un PDF ampiamente diffuso che sosteneva di provare la distillazione della catena di pensiero è stato criticato per aver combinato un esperimento limitato con affermazioni non supportate .
Il difetto introduce rischi concreti che vanno oltre il furto di proprietà intellettuale:
Tutte e tre le aziende sono state contattate dai ricercatori di 'Stolen Thoughts' prima della pubblicazione. Secondo quanto riportato, OpenAI, Anthropic e Google hanno bloccato l'attacco di ragionamento tra modelli dopo essere state avvisate. I dettagli specifici delle loro mitigazioni non sono stati completamente divulgati nelle fonti pubblicate, ma è stato confermato che la vulnerabilità esisteva nelle API di tutti e tre i fornitori prima della correzione . Il fatto che l'attacco sia stato 'bloccato' suggerisce che le aziende hanno implementato correzioni lato server, probabilmente limitando il riutilizzo dei blocchi di ragionamento crittografati in diversi contesti di modello o account .
Anthropic stava già combattendo pubblicamente la distillazione su larga scala, segnalando i 24.000 account fraudolenti e i 16 milioni di scambi utilizzati dai laboratori cinesi per estrarre gli output di Claude .
La lezione fondamentale sia dal paper REP che da 'Stolen Thoughts' è che nascondere o crittografare le tracce di ragionamento è una strategia di sicurezza fondamentalmente fragile: se il ragionamento esiste nei pesi del modello, può essere sollecitato .