Útok „Stolen Thoughts“ (přepadový útok s přehráním) – Publikováno 10.–11. srpna 2026 v článku „Stealing Reasoning Traces from Proprietary LLM APIs“ (arXiv:2608.09867). Výzkumníci Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping a Andriushchenko objevili kritickou architektonickou chybu. Zašifrované „myšlenkové“ bloky, které Anthropic, OpenAI a Google vracejí svým API klientům, nejsou správně svázány se svým zdrojem. Tyto bloky lze vyzvednout z jedné konverzace a „přehrát“ je do slabšího, méně střeženého sesterského modelu od stejného poskytovatele. Tento slabší model pak skryté úvahy špičkového modelu vypíše v čitelném textu . Útok funguje napříč relacemi, uživatelskými účty i modely v rámci ekosystému jednoho poskytovatele . Výzkumníci potvrdili, že technika funguje na všech hlavních testovaných společnostech a délka získaných úvah se téměř 1:1 shoduje s počtem tokenů, které API nahlásilo jako „myšlenkové“ .
Získané stopy uvažování poskytují vysoce kvalitní tréninkové signály pro model distillation (destilaci modelů) – tedy praxi, kdy se výstupy silnějšího modelu používají k trénování menšího a levnějšího konkurenčního modelu . Tato technika je jádrem ostré kontroverze kolem čínských AI laboratoří:
Důkazy však nejsou definitivní. Výzkumníci včetně Bradena Hancocka (Laude Institute) a Nathana Lamberta (Allen Institute for AI) argumentují, že samotná destilace nemůže vysvětlit plné schopnosti modelu Kimi K3. Jeden široce šířený PDF dokument, který měl být důkazem destilace myšlenkových řetězců, byl kritizován za to, že kombinuje omezený experiment s nepodloženými tvrzeními .
Tato chyba s sebou nese několik konkrétních rizik, která jdou nad rámec krádeže duševního vlastnictví:
Všechny tři společnosti byly výzkumníky „Stolen Thoughts“ kontaktovány ještě před zveřejněním. Podle dostupných zpráv OpenAI, Anthropic a Google po upozornění útok založený na přehrávání mezi modely zablokovaly . Konkrétní podrobnosti jejich opatření nebyla v publikovaných zdrojích plně zveřejněna, ale zranitelnost byla před opravou potvrzena u všech tří poskytovatelů . Zablokování útoku naznačuje, že společnosti provedly zásahy na straně serveru – pravděpodobně omezily možnost znovupoužití zašifrovaných myšlenkových bloků v různých kontextech modelů nebo napříč účty .
Společnost Anthropic již dříve veřejně bojovala s rozsáhlou destilací a nahlásila 24 000 podvodných účtů a 16 milionů interakcí, které čínské laboratoře použily k extrakci výstupů z modelu Claude .
Základním ponaučením z prací o REP i Stolen Thoughts je, že skrývání nebo šifrování stop uvažování je ze své podstaty křehká bezpečnostní strategie – pokud uvažování existuje ve vahách modelu, lze jej vylákat .