独チュービンゲン大学、マックスプランク研究所、MATS Research、Snykの研究チームが発表した新たなリプレイ攻撃は、Anthropic、OpenAI、GoogleのフロンティアAIモデル(Claude Opus 4.8、GPT 5.6 Sol、Gemini)が返す暗号化された「推論ブロック」を、同じ提供元の低性能でガードレールの緩い姉妹モデルに流し込み、その推論過程を平文で出力させるもの。 攻撃により抽出されたClaudeやGPTの推論パターンを中国Moonshot AIの「Kimi K3」の出力と比較したところ、Kimi K3が「異常な確率現象」を示し、Claudeの推論過程と強い統計的類似性が確認された。これは決...
研究の答え

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年8月、ドイツ・チュービンゲン大学(University of Tübingen)、マックスプランク知能システム研究所(Max Planck Institute for Intelligent Systems)、MATS Research、ELLIS Institute Tübingen、そしてセキュリティ企業Snykの研究チームは、フロンティアAIモデルの暗号化された推論過程を、驚くほどシンプルな方法で引き出す攻撃手法を発表しました。この攻撃は、Anthropic、OpenAI、Googleの3大プロバイダーのすべてに有効で、フロンティアモデルそのものをジェイルブレイク(ガードレールの無効化)する必要は一切ありませんでした。研究チームは、あるフロンティアモデルの暗号化推論ブロックを取得し、それを同じ提供元のより弱い姉妹モデルに「リプレイ」するだけで、そのブロックを復号させ、推論過程を平文で出力させることに成功したのです。このテクニックは、論文『Stealing Reasoning Traces from Proprietary LLM APIs』(arXivに2026年8月10日提出)で「復号ジェイルブレイク(decryption jailbreak)」として詳述されています
。
ユーザーがClaude Opus 4.8やGPT-5.6 SolのようなフロンティアモデルにAPI経由でクエリを投げると、モデルは内部でステップバイステップの推論(いわゆる「思考の連鎖」)を行い、その過程を暗号化されたテキストのブロックとしてクライアントに返します。その後の呼び出しでは、クライアントがこのブロックをAPIに送り返すことで、プロバイダー側で中間状態をサーバーに保存することなく、モデルが推論を継続できる仕組みになっています。
研究チームが発見したのは、これらの暗号化ブロックが特定のセッションやユーザー、さらにはモデルにすら紐づいていないという事実です。全セッション、全ユーザーで単一のグローバル暗号鍵が共有されていたのです。つまり、ある会話から取得したブロックを、全く別のコンテキストでリプレイすることが可能でした。肝心なのは、Claude Opus 4.8のような厳重なガードレールを持つフロンティアモデルのブロックを、同じAnthropicの低性能モデル(例:Claude Haiku)に流し込むと、ガードレールの弱い姉妹モデルがそのブロックの内容をそのまま復号して出力する点です
。
この攻撃を実行するのに必要なAPIコールはわずか2回。1回は暗号化ブロックの取得、もう1回はそれを弱いモデルに流し込むためです。研究チームは、この攻撃が大規模に機能することを実証しました。
この攻撃はフロンティアモデルの推論過程を暴露しただけでなく、中国のAI企業Moonshot AIが自社モデル「Kimi K3」をアメリカのモデルの蒸留(実質的なコピー)によって訓練したのではないかという、長年にわたる議論に新たな証拠を提供しました。
研究チームはClaude Opus 4.8とGPT-5.6 Solから抽出した推論過程を、Kimi K3を含むオープンウェイトモデルの出力と比較しました。その結果、Kimi K3の出力には、ClaudeやGPTの推論過程と非常に密接に一致する「異常な確率現象」が見られたのです。
この証拠は状況証拠であり、決定的なものではありません。独立した研究者は、この発見は「ある中国モデルが米国モデルから推論情報を蒸留して訓練された可能性を示す、決定的ではないにせよ、一定の証拠を提供する」と述べています。さらに、Kimi K3に自己紹介をさせたところ、最初に「AnthropicのClaudeです」と名乗ったという示唆に富む事例も報告されています
。
Kimi K3は、2026年7月16日にMoonshot AIがリリースした2.8兆パラメータのオープンウェイトモデルです。いくつかのベンチマークではClaude Opus 4.8を上回る性能を示していますが、無条件のリーダーというわけではありません。独立した評価機関「Artificial Analysis Intelligence Index」では、K3はスコア57で、Claude Fable 5の60、GPT-5.6 Solの59に及ばないという結果が出ています。Moonshot社自身も、K3はまだGPT-5.6 SolやClaude Fable 5に全体的に及ばないと、異例の正直さで認めています。
蒸留疑惑は今に始まったものではありません。AnthropicとOpenAIは以前から、中国企業が組織的に自社モデルを蒸留していると非難してきました。中国の軍関係の研究論文や特許のレビューでは、中国人民解放軍の研究者がOpenAIやAnthropicのモデルの出力を国防目的の国内AIシステム訓練に使用していたことが明らかになっています。
Kimi K3のリリースは即座に論争を巻き起こしました。7月16日のリリースから数時間以内にAnthropicはMoonshotを非難し、その主張はホワイトハウスにまで届き、制裁の可能性が取り沙汰されました。
しかし、この蒸留主張には批判もあります。Claude Opus 4.8がリリースされたのはKimi K3の発表のごく最近のことです。独立研究者は、このタイムラインを考えると、単純なコピーは「あり得ない」と指摘します。なぜなら、リリースされたばかりのモデルから蒸留によって2.8兆パラメータのモデルを訓練するには、単に時間が足りなすぎるからです。Moonshot社は、K3は独自の研究から構築されたと主張しています
。
同じアーキテクチャ上の欠陥は、現実的なセキュリティ脆弱性も露呈させました。フロンティアモデルは推論プロセスに資格情報や個人データを組み込むことがあるため、開発者が公開したエージェントセッションログ(その仕組みを知る者にとって)には、暗号化された推論ブロック内に機密情報が丸見えの状態で含まれていたのです。
2026年8月以前に公開された約7,000のエージェントセッションログを調査したところ、研究チームは62個の有効なAPIキー、33個のパスワード、その他の機密ユーザーデータ、合計704件のプライバシーアーティファクトを、これらの暗号化ブロック内から発見しました。GitHubなどの公開リポジトリに生のログを保存していた開発者は誰でも、誰にも読めないと思っていたブロックの中に、APIキーやパスワード、個人を特定できる情報を無自覚にさらしていた可能性があるのです。
研究者らは、この脆弱性によって可能となる4つの悪用経路を特定しています。隠された推論の再構築、エージェントトレースに埋め込まれた秘密の回復、検査不能なチャネルを介した命令の注入、そして期限切れでないブロックのクロスセッションリプレイです。
3社はすべて、研究チームが責任ある開示手続きを経た後、サーバーサイドでの軽減策を展開しました。研究チームはOpenAI、Anthropic、Google、Microsoft、Hugging Faceに調査結果を開示。各社が変更を実施した後、再現性確認テストにより、現在のAPIビルドでは主要な抽出テクニックがもはや成功しないことが確認されています
。現在のドキュメントでは、ログを共有する前、または会話の途中でモデルを切り替える前に、推論ブロックを取り除くようアドバイスしています
。
注目すべき点として、暗号研究者のMatthew Green氏が2026年5月に、このクロスセッションリプレイの脆弱性をOpenAIとAnthropicのバグ報奨金プログラムを通じて別途報告していましたが、今回の学術論文が発表されるまで、両社からは門前払いの対応を受けていたことが報じられています。
2026年8月時点でこれらのパッチは有効ですが、論文発表前に公開ウェブからすでに収集され、復号された推論ブロックを含む過去のセッションログは引き続きアクセス可能な状態にあります。
今回の「盗まれた思考」攻撃は、現代のAI API設計における根本的な緊張関係を浮き彫りにしました。プロバイダーはスケーラビリティとレイテンシー向上のために、推論状態の保存をクライアント側にオフロードしたいと考えますが、その状態をセッション、ユーザー、モデルをまたいで安全に保つための暗号学的なバインディングには、注意深い設計が必要です。Anthropic、OpenAI、Googleが採用した単一のグローバル暗号鍵によるアプローチは、近道であったがゆえに、これらのAPIとやり取りするすべてのユーザーと開発者に影響を及ぼすセキュリティとプライバシーの脆弱性を生み出したのです。
この攻撃はまた、エスカレートする米中AI蒸留をめぐる対立の只中に登場しました。Kimi K3に関する証拠は状況証拠に過ぎませんが、蒸留が大規模に行われている可能性を示すこれまでで最も強力な技術的証拠を提供し、政策立案者や研究者にAIモデルの出自を調査する新たなツールを与えました。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
独チュービンゲン大学、マックスプランク研究所、MATS Research、Snykの研究チームが発表した新たなリプレイ攻撃は、Anthropic、OpenAI、GoogleのフロンティアAIモデル(Claude Opus 4.8、GPT 5.6 Sol、Gemini)が返す暗号化された「推論ブロック」を、同じ提供元の低性能でガードレールの緩い姉妹モデルに流し込み、その推論過程を平文で出力させるもの。
独チュービンゲン大学、マックスプランク研究所、MATS Research、Snykの研究チームが発表した新たなリプレイ攻撃は、Anthropic、OpenAI、GoogleのフロンティアAIモデル(Claude Opus 4.8、GPT 5.6 Sol、Gemini)が返す暗号化された「推論ブロック」を、同じ提供元の低性能でガードレールの緩い姉妹モデルに流し込み、その推論過程を平文で出力させるもの。 攻撃により抽出されたClaudeやGPTの推論パターンを中国Moonshot AIの「Kimi K3」の出力と比較したところ、Kimi K3が「異常な確率現象」を示し、Claudeの推論過程と強い統計的類似性が確認された。これは決定的な証拠ではないものの、Kimi K3が米国モデルを蒸留して学習した可能性を示す状況証拠とされる。
同じアーキテクチャ上の欠陥により、公開された約7,000のエージェントセッションログから、62個の有効なAPIキー、33個のパスワードを含む計704件の機密データが、暗号化ブロック内から発見された。開発者は誰でも、知らず知らずのうちに秘密情報を公開していた可能性がある。