Replay-атака «Вкрадені думки» (Stolen Thoughts) — опублікована 10–11 серпня 2026 року в статті "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867). Дослідники Панфілов, Шмотц, Шумайлов, Бойрер-Келлнер, Шеффер, Прабху, Гайпінг та Андрющенко виявили критичний архітектурний недолік. Зашифровані блоки «роздумів», які Anthropic, OpenAI і Google повертають клієнтам API, належним чином не прив'язані до свого джерела. Ці блоки можна вилучити з однієї розмови та відтворити в слабшій, менш захищеній дочірній моделі того самого провайдера, яка потім виводить приховані міркування передової моделі звичайним текстом . Атака працює між сесіями, між обліковими записами користувачів і між моделями в екосистемі одного провайдера . Дослідники підтвердили, що техніка працює на кожній великій передовій ШІ-компанії, яку вони тестували, а довжина відновлених міркувань майже 1:1 збігається з кількістю прихованих токенів роздумів, про які повідомляє API .
Витягнуті сліди міркувань забезпечують високоякісні навчальні сигнали для дистиляції моделі — практики використання вихідних даних сильнішої моделі для навчання меншої, дешевшої моделі-конкурента . Ця техніка знаходиться в центрі палкої суперечки навколо китайських ШІ-лабораторій:
Однак докази не є остаточними. Дослідники, зокрема Брейден Хенкок (Laude Institute) та Натан Ламберт (Allen Institute for AI), стверджують, що дистиляція сама по собі не може пояснити всіх можливостей Kimi K3. Широко розповсюджений PDF-файл, який нібито доводив дистиляцію ланцюжка міркувань, піддався критиці за поєднання обмеженого експерименту з необґрунтованими твердженнями .
Недолік створює кілька конкретних ризиків, окрім крадіжки інтелектуальної власності:
Усі три компанії були повідомлені дослідниками «Вкрадених думок» до публікації. Згідно зі звітами, OpenAI, Anthropic та Google заблокували крос-модельну атаку на міркування після отримання повідомлення. Конкретні деталі їхніх пом'якшувальних заходів не були повністю розкриті в опублікованих джерелах, але підтверджено, що вразливість існувала в API всіх трьох провайдерів до виправлення . Той факт, що атаку «заблоковано», свідчить про те, що компанії впровадили виправлення на стороні сервера — ймовірно, обмеживши повторне використання зашифрованих блоків міркувань у різних контекстах моделей або облікових записах .
Anthropic вже публічно боролася з дистиляцією в масштабах, повідомляючи про 24 000 шахрайських акаунтів та 16 мільйонів обмінів, використаних китайськими лабораторіями для вилучення результатів Claude .
Основний урок як зі статей REP, так і Stolen Thoughts полягає в тому, що приховування або шифрування слідів міркувань є фундаментально хиткою стратегією безпеки — якщо міркування існують у вагах моделі, їх можна викликати .