Ricercatori hanno scoperto una vulnerabilità nelle API di Anthropic, OpenAI e Google: i blocchi di ragionamento crittografati possono essere 'replayati' su modelli più deboli della stessa famiglia per decodificarli in... L'attacco, che richiede solo due chiamate API, ha permesso di estrarre dati sensibili come passw...
Research answer

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Nell'agosto del 2026, un team di ricercatori dell'Università di Tubinga, del Max Planck Institute for Intelligent Systems, di MATS Research, dell'ELLIS Institute Tubinga e dell'azienda di sicurezza Snyk ha pubblicato un articolo che descrive un attacco sorprendentemente semplice alle tracce di ragionamento crittografate dei modelli di IA più avanzati . L'attacco ha funzionato su tutti e tre i principali fornitori — Anthropic, OpenAI e Google — e non ha richiesto alcun 'jailbreak' diretto dei modelli di punta
.
Quando un utente interroga un modello di frontiera come Claude Opus 4.8 o GPT-5.6 Sol tramite API, il modello esegue un ragionamento interno passo dopo passo (la sua 'catena di pensiero') e restituisce questo ragionamento al client come un blocco opaco di testo crittografato . La particolarità è che questi blocchi crittografati non sono legati a una specifica sessione, utente o modello. Condividono una singola chiave di crittografia globale
.
L'intuizione chiave dei ricercatori è stata la seguente: prendere un blocco di ragionamento da un modello di punta e re-inoltrarlo ('replay') a un modello 'fratello' più debole e meno allineato (ad esempio, Claude Haiku). Il modello più debole, avendo meno guardrail di rifiuto, decodifica e restituisce il contenuto del blocco in chiaro .
Per eseguire l'attacco bastano due chiamate API: una per catturare il blocco crittografato e una per inviarlo al modello più debole. I ricercatori hanno dimostrato che l'attacco funziona su larga scala .
L'attacco non ha solo esposto il ragionamento dei modelli di frontiera, ma ha anche fornito nuovi elementi nel dibattito in corso se l'azienda cinese Moonshot AI abbia addestrato il suo modello Kimi K3 'distillando' (di fatto, copiando) il ragionamento dei modelli statunitensi .
Dopo aver estratto le tracce di ragionamento da Claude Opus 4.8 e GPT-5.6 Sol, i ricercatori le hanno confrontate con gli output di modelli open-weight, incluso Kimi K3. Hanno scoperto che gli output di Kimi K3 mostravano quelli che hanno definito 'fenomeni di probabilità anomali' che corrispondono strettamente ai pattern trovati nelle tracce di Claude e GPT .
La prova è indiziaria, non definitiva. Ricercatori indipendenti affermano che i risultati 'forniscono alcune prove — sebbene non conclusive — che alcuni modelli cinesi possano essere stati addestrati distillando informazioni di ragionamento da modelli statunitensi' . Un altro indizio suggestivo: quando gli è stato chiesto di auto-identificarsi, Kimi K3 si è inizialmente presentato come 'Claude' di Anthropic
.
Kimi K3 è un modello open-weight da 2,8 trilioni di parametri rilasciato da Moonshot AI il 16 luglio 2026. Su diversi benchmark supera Claude Opus 4.8, ma non è un leader indiscusso. Nell'Artificial Analysis Intelligence Index indipendente, K3 ottiene un punteggio di 57, contro il 60 di Claude Fable 5 e il 59 di GPT-5.6 Sol. Moonshot stessa è stata insolitamente onesta nell'ammettere che K3 è ancora in generale inferiore a GPT-5.6 Sol e Claude Fable 5 .
L'accusa di distillazione non è nuova — sia Anthropic che OpenAI hanno già accusato le aziende cinesi di distillare sistematicamente i loro modelli. Una revisione di articoli accademici e brevetti cinesi ha rivelato che ricercatori militari cinesi hanno utilizzato gli output dei modelli OpenAI e Anthropic per addestrare sistemi di IA domestici per capacità di difesa .
Il lancio di Kimi K3 ha scatenato una controversia immediata. Poche ore dopo la sua uscita il 16 luglio, Anthropic ha accusato Moonshot di aver costruito K3 distillando Claude, e la notizia è arrivata alla Casa Bianca, sollevando la possibilità di sanzioni .
Tuttavia, i critici dell'accusa di distillazione sottolineano un problema di tempistica. Claude Opus 4.8 è stato rilasciato poco prima del lancio di Kimi K3. Ricercatori indipendenti affermano che la tempistica rende una copia diretta 'implausibile' perché semplicemente non c'è stato abbastanza tempo per addestrare un modello da 2,8 trilioni di parametri usando la distillazione da un modello rilasciato solo di recente . Moonshot sostiene che K3 sia stato costruito su ricerca indipendente
.
La stessa debolezza architetturale ha esposto una vulnerabilità di sicurezza pratica. Scansionando circa 7.000 log di sessioni di agenti pubblicati prima di agosto 2026, i ricercatori hanno trovato 62 chiavi API attive, 33 password e altri dati sensibili degli utenti — per un totale di 704 artefatti di privacy — nascosti all'interno dei blocchi di ragionamento crittografati . Qualsiasi sviluppatore che avesse pubblicato log grezzi di agenti potrebbe aver esposto involontariamente chiavi API, password e informazioni personali all'interno di blocchi che si credeva fossero illeggibili
.
I ricercatori hanno identificato quattro percorsi di abuso distinti resi possibili dalla vulnerabilità: ricostruzione del ragionamento nascosto, recupero di segreti incorporati nelle tracce degli agenti, iniezione di istruzioni tramite un canale non ispezionabile e replay cross-sessione di blocchi non scaduti .
Tutte e tre le aziende hanno implementato mitigazioni lato server dopo che il team di ricerca ha seguito le procedure di divulgazione responsabile .
I ricercatori hanno segnalato le loro scoperte a OpenAI, Anthropic, Google, Microsoft e Hugging Face. Dopo che i fornitori hanno implementato le modifiche, le verifiche di riproducibilità hanno confermato che la tecnica di estrazione principale non ha più successo contro le attuali build API . La documentazione ora consiglia di rimuovere i blocchi di ragionamento prima di condividere i log o cambiare modello a metà conversazione
.
È interessante notare che il crittografo Matthew Green aveva segnalato separatamente la vulnerabilità di replay cross-sessione sia a OpenAI che ad Anthropic tramite i loro programmi bug bounty nel maggio 2026, ma aveva ricevuto risposte di scarso interesse prima che l'articolo accademico fosse pubblicato .
Le patch sono state implementate ad agosto 2026, ma i log di sessione storici con blocchi di ragionamento decodificati che sono già stati estratti dal web pubblico rimangono accessibili .
L'attacco 'Stolen Thoughts' rivela una tensione fondamentale nella progettazione delle moderne API di IA. I fornitori vogliono scaricare lo stato di ragionamento sul client per scalabilità e latenza, ma il legame crittografico necessario per mantenere sicuro quello stato tra sessioni, utenti e modelli richiede una progettazione attenta. L'approccio con un'unica chiave di crittografia globale utilizzato da Anthropic, OpenAI e Google è stata una scorciatoia che ha creato una vulnerabilità di sicurezza e privacy che ha colpito ogni utente e sviluppatore che interagiva con queste API .
L'attacco cade anche nel mezzo di un conflitto crescente tra Stati Uniti e Cina sulla distillazione dell'IA. Sebbene le prove relative a Kimi K3 siano indiziarie, forniscono la prova tecnica più forte fino ad oggi che la distillazione potrebbe avvenire su larga scala e offrono a politici e ricercatori un nuovo strumento per indagare sulla provenienza dei modelli di IA .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ricercatori hanno scoperto una vulnerabilità nelle API di Anthropic, OpenAI e Google: i blocchi di ragionamento crittografati possono essere 'replayati' su modelli più deboli della stessa famiglia per decodificarli in...
Ricercatori hanno scoperto una vulnerabilità nelle API di Anthropic, OpenAI e Google: i blocchi di ragionamento crittografati possono essere 'replayati' su modelli più deboli della stessa famiglia per decodificarli in... L'attacco, che richiede solo due chiamate API, ha permesso di estrarre dati sensibili come password e API key da log pubblici di sessioni, esponendo 704 artefatti di privacy.
Lo studio ha rilevato 'fenomeni di probabilità anomali' nelle risposte di Kimi K3 di Moonshot AI, fornendo prove indiziarie (ma non conclusive) di una possibile distillazione dai modelli americani Claude Opus 4.8 e GP...