Атака повторного воспроизведения «Украденные мысли» — опубликована 10–11 августа 2026 года в статье «Stealing Reasoning Traces from Proprietary LLM APIs» (arXiv:2608.09867). Исследователи Панфилов, Шмотц, Шумайлов, Бойрер-Келлнер, Шеффер, Прабху, Гейпинг и Андрющенко обнаружили критический архитектурный недостаток. Зашифрованные «мыслительные» блоки, которые Anthropic, OpenAI и Google возвращают API-клиентам, не были должным образом привязаны к своему источнику. Эти блоки можно извлечь из одного разговора и воспроизвести в более слабой, менее защищенной родственной модели от того же провайдера, которая затем выводит скрытые рассуждения фронтальной модели в виде обычного текста . Атака работает между сессиями, между учетными записями пользователей и между моделями внутри экосистемы одного провайдера . Исследователи подтвердили, что метод работает на каждой крупной передовой ИИ-компании, которую они тестировали, а длина восстановленных рассуждений почти 1:1 соответствует количеству скрытых мыслительных токенов, сообщаемых API .
Извлеченные следы рассуждений предоставляют высококачественные сигналы для обучения методом дистилляции модели — практики использования выходных данных более сильной модели для обучения меньшей и более дешевой модели-конкурента . Этот метод находится в центре ожесточенного спора вокруг китайских ИИ-лабораторий:
Однако доказательства не являются окончательными. Исследователи, включая Брэдена Хэнкока (Институт Лауде) и Натана Ламберта (Институт ИИ Аллена), утверждают, что одной дистилляцией нельзя объяснить все возможности Kimi K3. Широко распространенный PDF-файл, якобы доказывающий дистилляцию цепочки рассуждений, подвергся критике за объединение ограниченного эксперимента с необоснованными утверждениями .
Недостаток создает несколько конкретных рисков, помимо кражи интеллектуальной собственности:
Все три компании были связаны с исследователями «Украденных мыслей» до публикации. Согласно сообщениям, OpenAI, Anthropic и Google заблокировали атаку с перекрестным воспроизведением рассуждений после уведомления. Конкретные детали их мер по смягчению последствий не были полностью раскрыты в опубликованных источниках, но подтверждено, что уязвимость существовала в API всех трех провайдеров до исправления . Тот факт, что атака была «заблокирована», позволяет предположить, что компании внедрили серверные исправления, вероятно, ограничивающие повторное использование зашифрованных блоков рассуждений в разных контекстах моделей или учетных записях .
Anthropic уже вела публичную борьбу с дистилляцией в больших масштабах, сообщив о 24 000 мошеннических аккаунтах и 16 миллионах обменов, используемых китайскими лабораториями для извлечения выходных данных Claude .
Ключевой урок как из статей REP, так и «Украденных мыслей» заключается в том, что скрытие или шифрование следов рассуждений — это фундаментально хрупкая стратегия безопасности: если рассуждения существуют в весах модели, их можно извлечь .