Reasoning Exposure Prompting (REP) — Opublikowany 30 maja 2026 roku w pracy „Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs” (arXiv:2606.00642), naukowcy Lu, Tsai, Tsai, Popa i Yu wykazali, że nawet gdy dostawcy celowo ukrywają rozumowanie krok po kroku, lekka technika promptowania w kontekście może wyciągnąć ukryte rozumowanie z powrotem do widocznego wyniku. Metoda, nazwana shadow-model prompting, wykorzystuje demonstracje z mniejszego, niczym nieograniczonego modelu, owinięte w pomocnicze formaty przypominające kod, aby wydobyć wewnętrzne ślady z modelu-ofiary. Odtworzone ślady są na tyle szczegółowe, że umożliwiają wytrenowanie mniejszego modelu .
Atak „Skradzione Myśli” (Stolen Thoughts) — Opublikowany 10–11 sierpnia 2026 roku w pracy „Stealing Reasoning Traces from Proprietary LLM APIs” (arXiv:2608.09867), naukowcy Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping i Andriushchenko odkryli krytyczną wadę architektoniczną. Zaszyfrowane bloki „myślenia”, które Anthropic, OpenAI i Google zwracają klientom API, nie są odpowiednio przypisane do swojego źródła. Bloki te można przenieść z jednej konwersacji i odtworzyć w słabszym, słabiej chronionym modelu pochodzącym od tego samego dostawcy, który następnie wypisuje ukryte rozumowanie modelu w zwykłym tekście . Atak działa między sesjami, kontami użytkowników i modelami w obrębie ekosystemu jednego dostawcy . Naukowcy potwierdzili, że technika działa na każdej głównej firmie zajmującej się modelami AI, którą testowali, a długość odzyskanego rozumowania prawie 1:1 odpowiada liczbie ukrytych tokenów myślenia zgłaszanej przez API .
Wyodrębnione ślady rozumowania stanowią wysokiej jakości sygnały treningowe dla destylacji modeli — praktyki używania wyników silniejszego modelu do trenowania mniejszego, tańszego modelu konkurencyjnego . Ta technika znajduje się w centrum gorącej kontrowersji wokół chińskich laboratoriów AI:
Jednak dowody nie są rozstrzygające. Naukowcy, w tym Braden Hancock (Laude Institute) i Nathan Lambert (Allen Institute for AI), argumentują, że sama destylacja nie może wyjaśnić pełnych możliwości Kimi K3. Powszechnie rozpowszechniony plik PDF rzekomo dowodzący destylacji łańcucha myśli został skrytykowany za łączenie ograniczonego eksperymentu z niepopartymi twierdzeniami .
Wada wprowadza kilka konkretnych zagrożeń wykraczających poza kradzież własności intelektualnej:
Wszystkie trzy firmy zostały skontaktowane przez badaczy „Skradzionych Myśli” przed publikacją. Według doniesień, OpenAI, Anthropic i Google zablokowały atak na rozumowanie między modelami po otrzymaniu zgłoszenia. Szczegóły ich działań naprawczych nie zostały w pełni ujawnione w opublikowanych źródłach, ale potwierdzono, że podatność istniała we wszystkich interfejsach API tych trzech dostawców przed załataniem . Fakt, że atak został „zablokowany”, sugeruje, że firmy wdrożyły poprawki po stronie serwera – prawdopodobnie ograniczając ponowne użycie zaszyfrowanych bloków rozumowania w różnych kontekstach modeli lub kontach .
Anthropic już wcześniej publicznie walczył z destylacją na dużą skalę, zgłaszając 24 000 fałszywych kont i 16 milionów interakcji wykorzystywanych przez chińskie laboratoria do wyodrębniania wyników Claude .
Główna lekcja płynąca zarówno z prac REP, jak i „Skradzionych Myśli” jest taka, że ukrywanie lub szyfrowanie śladów rozumowania jest z natury kruchą strategią bezpieczeństwa – jeśli rozumowanie istnieje w wagach modelu, można je wywołać .