Do wykonania ataku potrzebne są tylko dwa wywołania API: jedno, by przechwycić blok, i drugie, by przekazać go słabszemu modelowi. Badacze wykazali, że atak działa na dużą skalę .
Atak nie tylko ujawnił rozumowanie czołowych modeli – dostarczył też nowych dowodów w trwającej debacie, czy chińska firma Moonshot AI wytrenowała swój model Kimi K3, destylując (a więc właściwie kopiując) rozumowanie amerykańskich modeli.
Po wydobyciu śladów rozumowania z Claude Opus 4.8 i GPT-5.6 Sol badacze porównali je z wynikami modeli open-weight, w tym Kimi K3. Odkryli, że wyniki Kimi K3 wykazywały „nienormalne zjawiska prawdopodobieństwa”, które ściśle odpowiadały wzorcom znalezionym w śladach Claude i GPT .
Dowody mają charakter poszlakowy, a nie rozstrzygający. Niezależni badacze twierdzą, że wyniki „dostarczają pewnych dowodów – choć nie są rozstrzygającym dowodem – że niektóre chińskie modele mogły być trenowane poprzez destylację informacji o rozumowaniu z amerykańskich modeli” . Dodatkowo, poproszony o autoidentyfikację, Kimi K3 początkowo określił się jako „Claude” od Anthropic, co dolało oliwy do ognia
.
Kimi K3 to model o 2,8 biliona parametrów, udostępniony jako open-weight przez Moonshot AI 16 lipca 2026 roku. Wyprzedza on Claude Opus 4.8 w kilku benchmarkach, ale nie jest jednoznacznym liderem. W niezależnym Indeksie Inteligencji Artificial Analysis K3 uzyskuje 57 punktów wobec 60 dla Claude Fable 5 i 59 dla GPT-5.6 Sol. Co ciekawe, samo Moonshot jest niezwykle szczere, przyznając, że K3 wciąż pozostaje w tyle za GPT-5.6 Sol i Claude Fable 5 pod wieloma względami .
Oskarżenia o destylację nie są nowe – zarówno Anthropic, jak i OpenAI wcześniej oskarżały chińskie firmy o systematyczne przejmowanie ich modeli. Przegląd chińskich prac naukowych i patentów ujawnił, że chińscy badacze wojskowi wykorzystywali wyniki modeli OpenAI i Anthropic do szkolenia krajowych systemów AI na potrzeby obronności .
Premiera Kimi K3 natychmiast wywołała kontrowersje. W ciągu kilku godzin od premiery 16 lipca Anthropic oskarżył Moonshot o zbudowanie K3 poprzez destylację Claude, a sprawa trafiła do Białego Domu, co groziło sankcjami .
Krytycy tezy o destylacji wskazują jednak na problem z harmonogramem. Claude Opus 4.8 został wydany na krótko przed premierą Kimi K3. Niezależni badacze twierdzą, że prosta kopia jest „nieprawdopodobna”, ponieważ po prostu nie było wystarczająco dużo czasu, aby wytrenować model o 2,8 biliona parametrów przy użyciu destylacji z modelu, który został wydany zaledwie chwilę wcześniej . Moonshot utrzymuje, że K3 został zbudowany w oparciu o niezależne badania
.
Ta sama architektoniczna wada ujawniła praktyczną lukę w zabezpieczeniach. Ponieważ modele czasami włączają poświadczenia i dane osobowe do swojego procesu rozumowania, zaszyfrowane bloki, które programiści publicznie udostępniali – na przykład w logach sesji agentów – zawierały wrażliwe informacje, które każdy znający tę sztuczkę mógł odczytać.
Skanując około 7000 publicznie udostępnionych logów sesji agentów opublikowanych przed sierpniem 2026 roku, badacze znaleźli 62 aktywne klucze API, 33 hasła i inne wrażliwe dane użytkowników – łącznie 704 artefakty prywatności – ukryte w zaszyfrowanych blokach rozumowania . Każdy programista, który opublikował surowe logi agenta, mógł nieświadomie ujawnić klucze API, hasła i dane osobowe w blokach, które, jak sądził, są nieczytelne
. Dotyczy to również logów przechowywanych w publicznych repozytoriach GitHub .
Badacze zidentyfikowali cztery odrębne ścieżki nadużyć umożliwione przez tę lukę: rekonstrukcję ukrytego rozumowania, odzyskiwanie tajemnic osadzonych w śladach agentów, wstrzykiwanie instrukcji przez kanał podlegający inspekcji oraz odtwarzanie między sesjami niewygasłych bloków .
Wszystkie trzy firmy wdrożyły łagodzenie po stronie serwera po tym, jak zespół badawczy postąpił zgodnie z procedurami odpowiedzialnego ujawniania .
Badacze ujawnili swoje odkrycia OpenAI, Anthropic, Google, Microsoft i Hugging Face. Po wdrożeniu zmian przez dostawców, kontrole powtarzalności potwierdziły, że główna technika ekstrakcji nie działa już na obecnych wersjach API . Dokumentacja obecnie zaleca usuwanie bloków rozumowania przed udostępnianiem logów lub zmianą modeli w trakcie rozmowy
.
Co istotne, kryptograf Matthew Green niezależnie zgłosił lukę dotyczącą odtwarzania między sesjami zarówno OpenAI, jak i Anthropic za pośrednictwem ich programów bug bounty w maju 2026 roku, ale przed publikacją pracy naukowej otrzymał lekceważące odpowiedzi .
Łatki są aktywne od sierpnia 2026 roku, ale historyczne logi sesji z odszyfrowanymi blokami rozumowania, które zostały już zeskrapowane z publicznej sieci, pozostają dostępne .
Atak „skradzionych myśli” ujawnia fundamentalne napięcie w projektowaniu nowoczesnych API AI. Dostawcy chcą przenieść stan rozumowania do klienta ze względu na skalowalność i opóźnienia, ale kryptograficzne powiązanie niezbędne do zabezpieczenia tego stanu między sesjami, użytkownikami i modelami wymaga starannego projektu. Pojedynczy globalny klucz szyfrowania używany przez Anthropic, OpenAI i Google był skrótem, który stworzył lukę w zabezpieczeniach i prywatności dotykającą każdego użytkownika i programistę wchodzącego w interakcję z tymi API.
Atak wpisuje się również w eskalację konfliktu USA–Chiny dotyczącego destylacji AI. Podczas gdy dowody dotyczące Kimi K3 są poszlakowe, stanowią one najsilniejszy jak dotąd techniczny dowód na to, że destylacja może mieć miejsce na dużą skalę, i dają decydentom i badaczom nowe narzędzie do badania pochodzenia modeli AI.