Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
В августе 2026 года группа исследователей из Университета Тюбингена, Института интеллектуальных систем Макса Планка, MATS Research, ELLIS Institute Tübingen и компании по кибербезопасности Snyk опубликовала статью, в которой описала на удивление простую атаку на зашифрованные цепочки рассуждений передовых ИИ-моделей. Атака сработала против всех трёх основных провайдеров — Anthropic, OpenAI и Google, — и ей не требовалось взламывать ни одну из флагманских моделей. Вместо этого она эксплуатировала фундаментальный архитектурный выбор: эти компании возвращают клиенту API зашифрованные «блоки рассуждений», а не хранят их на сервере, и эти блоки переносимы между сессиями, пользователями и даже разными моделями одного провайдера . Исследователи просто взяли зашифрованный блок рассуждений от флагманской модели и «воспроизвели» его в более слабой «младшей» модели того же провайдера, которая и декодировала содержимое в открытый текст
. Этот метод, названный в статье «джейлбрейком дешифровки», подробно описан в препринте Stealing Reasoning Traces from Proprietary LLM APIs, опубликованном на arXiv 10 августа 2026 года
.
Когда пользователь отправляет запрос флагманской модели (например, Claude Opus 4.8 или GPT-5.6 Sol) через API, модель выполняет внутренние пошаговые рассуждения («цепочку мыслей») и возвращает их клиенту в виде непрозрачного зашифрованного текста. При последующих вызовах клиент снова передаёт этот блок в API, что позволяет модели продолжать свои рассуждения, не храня промежуточное состояние на сервере .
Исследователи обнаружили, что эти зашифрованные блоки не привязаны к конкретной сессии, пользователю или даже модели. Все они используют один глобальный ключ шифрования для всех сессий и пользователей . Это означает, что блок, захваченный из одного диалога, можно воспроизвести в другом контексте. Ключевой момент: подайте блок от сильно защищённой флагманской модели более слабой и менее «выровненной» модели-сиблингу от того же провайдера (например, Claude Haiku), и более слабая модель — у которой меньше защитных механизмов — декодирует и выведет содержимое блока дословно
.
Для выполнения атаки требуется всего два вызова API: один для получения зашифрованного блока и один для его передачи слабой модели. Исследователи продемонстрировали, что атака работает в масштабе .
Атака не только раскрыла логику флагманских моделей — она также предоставила новые доказательства в продолжающемся споре о том, не использовала ли китайская компания Moonshot AI дистилляцию (по сути, копирование) рассуждений американских моделей для обучения своей модели Kimi K3.
После извлечения цепочек рассуждений из Claude Opus 4.8 и GPT-5.6 Sol исследователи сравнили их с выходами моделей с открытыми весами, включая Kimi K3. Они обнаружили, что выходы Kimi K3 демонстрируют «аномальные вероятностные явления», которые очень близки к паттернам, найденным в логах Claude и GPT .
Доказательства являются косвенными, а не окончательными. Независимые исследователи отмечают, что результаты «предоставляют некоторые доказательства — хотя и не окончательные — того, что определённые китайские модели могли быть обучены путём дистилляции информации о рассуждениях из американских моделей» . Ещё один показательный факт: когда Kimi K3 попросили идентифицировать себя, она сначала представилась как «Claude от Anthropic», что подлило масла в огонь обвинений
.
Kimi K3 — это модель с открытыми весами на 2,8 триллиона параметров, выпущенная Moonshot AI 16 июля 2026 года. Она превосходит Claude Opus 4.8 по нескольким тестам, но не является однозначным лидером. В независимом Индексе ИИ по версии Artificial Analysis Kimi K3 набирает 57 баллов против 60 у Claude Fable 5 и 59 у GPT-5.6 Sol. Сама Moonshot необычно откровенно признала, что K3 в целом всё ещё уступает GPT-5.6 Sol и Claude Fable 5 .
Обвинение в дистилляции не ново — и Anthropic, и OpenAI ранее обвиняли китайские фирмы в систематической дистилляции своих моделей. Обзор китайских академических статей и патентов показал, что китайские военные исследователи использовали выходные данные моделей OpenAI и Anthropic для обучения внутренних ИИ-систем для оборонных целей .
Запуск Kimi K3 сразу же вызвал споры. В течение нескольких часов после выхода 16 июля Anthropic обвинил Moonshot в том, что K3 построена на дистилляции Claude, и это обвинение дошло до Белого дома, что вызвало угрозу санкций .
Однако критики версии о дистилляции указывают на проблему со сроками. Claude Opus 4.8 была выпущена незадолго до запуска Kimi K3. Независимые исследователи называют прямое копирование «маловероятным», потому что просто не хватило бы времени, чтобы обучить модель на 2,8 триллиона параметров с помощью дистилляции модели, выпущенной совсем недавно . Moonshot утверждает, что K3 создана на основе независимых исследований
.
Этот же архитектурный изъян обернулся практической уязвимостью. Поскольку флагманские модели иногда включают учётные данные и личную информацию в свои рассуждения, зашифрованные блоки рассуждений, которые разработчики публиковали в открытом доступе (например, в логах агентов), содержали конфиденциальную информацию, которую мог прочитать любой, кто знал трюк.
Просканировав около 7000 публично доступных логов сессий агентов, опубликованных до августа 2026 года, исследователи обнаружили 62 действующих API-ключа, 33 пароля и другие конфиденциальные данные пользователей — всего 704 артефакта конфиденциальности, — спрятанные внутри зашифрованных блоков рассуждений . Любой разработчик, публиковавший «сырые» логи агентов, мог неосознанно раскрыть API-ключи, пароли и личную информацию в блоках, которые, как он считал, никто не сможет прочитать
. Это включало логи, хранящиеся в публичных репозиториях GitHub .
Исследователи определили четыре основных пути злоупотребления, которые открывала эта уязвимость: восстановление скрытых рассуждений, извлечение секретов, встроенных в трассы агентов, внедрение инструкций через непроверяемый канал и межсессионное воспроизведение незаблокированных блоков .
Все три компании развернули исправления на стороне сервера после того, как исследовательская группа соблюла процедуру ответственного раскрытия уязвимости .
Исследователи сообщили о своих находках в OpenAI, Anthropic, Google, Microsoft и Hugging Face. После того как провайдеры внедрили изменения, проверки на воспроизводимость подтвердили, что основной метод извлечения больше не работает против текущих версий API . Документация теперь рекомендует удалять блоки рассуждений перед публикацией логов или сменой модели в середине диалога
.
Примечательно, что криптограф Мэттью Грин ранее независимо сообщал об уязвимости межсессионного воспроизведения в OpenAI и Anthropic через программы bug bounty в мае 2026 года, но получил пренебрежительные ответы до публикации академической статьи .
Исправления действуют по состоянию на август 2026 года, но исторические логи сессий с декодированными блоками рассуждений, которые уже были скачаны из открытого веба, остаются доступными .
Атака «кража мыслей» выявила фундаментальное противоречие в дизайне современных ИИ-API. Провайдеры стремятся перенести состояние рассуждений на сторону клиента для масштабируемости и уменьшения задержек, но криптографическая привязка, необходимая для защиты этого состояния между сессиями, пользователями и моделями, требует тщательного проектирования. Использование единого глобального ключа шифрования, которое применяли Anthropic, OpenAI и Google, было компромиссным решением, создавшим уязвимость для безопасности и конфиденциальности, затронувшую каждого пользователя и разработчика, работавшего с этими API.
Атака также оказалась в центре эскалирующего американо-китайского конфликта вокруг дистилляции ИИ. Хотя доказательства относительно Kimi K3 являются косвенными, они предоставляют самые сильные технические свидетельства на сегодняшний день того, что дистилляция может происходить в масштабе, и дают политикам и исследователям новый инструмент для изучения происхождения ИИ-моделей.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Команда из Университета Тюбингена, Института Макса Планка, MATS Research и Snyk разработала атаку воспроизведения, которая извлекает скрытые цепочки рассуждений из Claude Opus 4.8, GPT 5.6 Sol и Gemini через их API —...
Команда из Университета Тюбингена, Института Макса Планка, MATS Research и Snyk разработала атаку воспроизведения, которая извлекает скрытые цепочки рассуждений из Claude Opus 4.8, GPT 5.6 Sol и Gemini через их API —... Уязвимость позволила прочитать пароли и API ключи в 704 случаях из примерно 7000 публичных логов сессий; Anthropic, OpenAI и Google закрыли брешь после ответственного раскрытия, но старые логи остались расшифрованными.
Сравнение «мыслей» Claude и GPT с ответами Kimi K3 выявило «аномальные вероятностные явления» — косвенное, но весомое свидетельство возможной дистилляции американских моделей китайской Moonshot AI.