Když uživatel zašle dotaz modelu nejvyšší úrovně, jako je Claude Opus 4.8 nebo GPT-5.6 Sol, prostřednictvím API, model provede interní krok za krokem uvažování (svůj "chain of thought") a toto uvažování vrátí klientovi jako neprůhledný blok zašifrovaného textu. Při následných voláních klient tento blok opětovně pošle API, což modelu umožňuje pokračovat v uvažování, aniž by poskytovatel musel ukládat mezistav na serveru .
Co výzkumníci zjistili, je, že tyto zašifrované bloky nejsou vázány na konkrétní relaci, uživatele ani model. Sdílejí jeden globální šifrovací klíč napříč všemi relacemi a uživateli . To znamená, že blok zachycený v jedné konverzaci lze přehrát v jiném kontextu. Klíčový poznatek: vložte blok z pečlivě střeženého modelu nejvyšší úrovně do slabšího, méně ošetřeného sourozeneckého modelu od stejného poskytovatele (např. Claude Haiku), a slabší model – který má méně bezpečnostních zábran – dekóduje a doslovně vypíše obsah bloku
.
K provedení útoku stačí dvě volání API: jedno k zachycení zašifrovaného bloku a druhé k jeho vložení do slabšího modelu. Výzkumníci demonstrovali, že útok funguje ve velkém měřítku .
Útok neodhalil pouze myšlenkové pochody modelů nejvyšší úrovně – poskytl také nové důkazy v probíhající debatě o tom, zda čínská AI společnost Moonshot AI trénovala svůj model Kimi K3 pomocí destilace (v podstatě kopírování) myšlenek z amerických modelů.
Po extrahování myšlenkových pochodů z Claude Opus 4.8 a GPT-5.6 Sol je výzkumníci porovnali s výstupy modelů s otevřenými váhami, včetně Kimi K3. Zjistili, že výstupy Kimi K3 vykazovaly to, co popsali jako "abnormální pravděpodobnostní jevy", které se úzce shodovaly se vzorci nalezenými v myšlenkových pochodech Claude a GPT .
Důkazy jsou nepřímé, nikoli průkazné. Nezávislí výzkumníci uvádějí, že zjištění "poskytují určité důkazy – i když ne průkazné – že některé čínské modely mohly být trénovány destilací myšlenkových informací z amerických modelů" . Dalším sugestivním zjištěním bylo, že když byl Kimi K3 požádán, aby se sám identifikoval, nejprve se označil jako "Claude od Anthropicu", což přililo olej do ohně obvinění
.
Kimi K3 je model s otevřenými váhami o 2,8 bilionech parametrů, vydaný společností Moonshot AI 16. července 2026. V několika benchmarkách překonává Claude Opus 4.8, není však jednoznačným lídrem. Na nezávislém Artificial Analysis Intelligence Index získává K3 skóre 57 oproti 60 u Claude Fable 5 a 59 u GPT-5.6 Sol . Moonshot sám byl neobvykle upřímný v tom, že K3 celkově stále zaostává za GPT-5.6 Sol a Claude Fable 5
.
Obvinění z destilace není nové – Anthropic i OpenAI již dříve obvinily čínské firmy ze systematické destilace jejich modelů. Přezkum čínských akademických článků a patentů odhalil, že čínští vojenští výzkumníci používají výstupy z modelů OpenAI a Anthropic k trénování domácích AI systémů pro obranné účely .
Uvedení Kimi K3 na trh okamžitě vyvolalo kontroverzi. Během několika hodin od jeho vydání 16. července Anthropic obvinil Moonshot z toho, že postavil K3 destilací Clauda, a toto tvrzení se dostalo až do Bílého domu, což vyvolalo hrozbu sankcí .
Kritici tvrzení o destilaci však poukazují na problém s načasováním. Claude Opus 4.8 byl vydán krátce před uvedením Kimi K3. Nezávislí výzkumníci tvrdí, že časová osa činí přímé kopírování "nepravděpodobným", protože prostě nebyl dostatek času na trénování modelu s 2,8 biliony parametrů pomocí destilace z modelu, který byl vydán teprve nedávno . Moonshot argumentuje, že K3 byl postaven na základě nezávislého výzkumu
.
Stejná architektonická chyba odhalila praktickou bezpečnostní zranitelnost. Protože modely nejvyšší úrovně někdy začleňují do svého myšlenkového procesu přihlašovací údaje a osobní údaje, zašifrované myšlenkové bloky, které vývojáři veřejně sdíleli – například v logách agentních relací – obsahovaly citlivé informace, které mohl přečíst každý, kdo znal trik.
Prohledáním zhruba 7 000 veřejně sdílených logů agentních relací zveřejněných před srpnem 2026 našli výzkumníci 62 živých API klíčů, 33 hesel a další citlivá uživatelská data – celkem 704 soukromých artefaktů – skrytých uvnitř zašifrovaných myšlenkových bloků . Každý vývojář, který zveřejnil surové logy agenta, mohl nevědomky odhalit API klíče, hesla a osobně identifikovatelné informace v blocích, o kterých se domníval, že je nikdo nepřečte
. To zahrnovalo logy uložené na veřejných repozitářích GitHub .
Výzkumníci identifikovali čtyři různé cesty zneužití, které tato zranitelnost umožňuje: rekonstrukci skrytého uvažování, obnovu tajemství vložených do stop agenta, vkládání instrukcí prostřednictvím nekontrolovatelného kanálu a mezirelační přehrávání neprošlých bloků .
Všechny tři společnosti nasadily opatření na straně serveru poté, co výzkumný tým dodržel postupy odpovědného zveřejnění .
Výzkumníci nahlásili svá zjištění OpenAI, Anthropicu, Googlu, Microsoftu a Hugging Face. Poté, co poskytovatelé implementovali změny, kontrolní testy reproducibility potvrdily, že hlavní extrakční technika již proti současným sestavením API nefunguje . Dokumentace nyní doporučuje odstranit myšlenkové bloky před sdílením logů nebo přepínáním modelů uprostřed konverzace
.
Je pozoruhodné, že kryptograf Matthew Green nahlásil zranitelnost mezirelačního přehrávání OpenAI i Anthropicu prostřednictvím jejich programů pro odměny za nalezení chyb již v květnu 2026, ale před zveřejněním akademického článku se mu dostalo odmítavých odpovědí .
Záplaty jsou v provozu od srpna 2026, ale historické logy relací s dekódovanými myšlenkovými bloky, které již byly extrahovány z veřejného webu, zůstávají přístupné .
Útok "ukradené myšlenky" odhaluje zásadní napětí v návrhu moderních AI API. Poskytovatelé chtějí přenášet stav uvažování na klienta kvůli škálovatelnosti a nízké latenci, ale kryptografické svázání potřebné k udržení tohoto stavu v bezpečí napříč relacemi, uživateli a modely vyžaduje pečlivý návrh. Přístup s jediným globálním šifrovacím klíčem používaný společnostmi Anthropic, OpenAI a Google byl zkratkou, která vytvořila bezpečnostní a soukromí zranitelnost postihující každého uživatele a vývojáře, který s těmito API interagoval.
Útok také zapadá do středu eskalujícího konfliktu mezi USA a Čínou ohledně AI destilace. Zatímco důkazy týkající se Kimi K3 jsou nepřímé, poskytují dosud nejsilnější technický důkaz, že k destilaci může docházet ve velkém měřítku, a dávají tvůrcům politik a výzkumníkům nový nástroj pro zkoumání původu AI modelů.