「Stolen Thoughts」リプレイ攻撃 — 2026年8月10日~11日、論文「Stealing Reasoning Traces from Proprietary LLM APIs」(arXiv:2608.09867)で発表。研究者のPanfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping、Andriushchenkoらは、Anthropic、OpenAI、GoogleがAPIクライアントに返す暗号化された「思考」ブロックが、そのソースに適切に紐づけられていないという重大なアーキテクチャ上の欠陥を発見しました。これらのブロックは、ある会話から持ち出され、同じプロバイダーのより弱い兄弟モデルに「再生」されると、その最先端モデルの隠された推論を平文で出力します。この攻撃は異なるセッション間、異なるユーザーアカウント間、そして同じプロバイダーのエコシステム内の異なるモデル間で機能します。研究者らは、この手法がテストしたすべての主要なフロンティアAI企業で有効であることを確認し、回収された推論の長さはAPIが報告する隠された思考トークン数とほぼ1:1で一致したと述べています。
抽出された推論過程は、モデル蒸留(より強力なモデルの出力を使って、より小さく安価な競合モデルを訓練する手法)のための高品質なトレーニング信号を提供します。この手法は、中国のAIラボを巡る激しい論争の中心にあります。
しかし、この証拠は決定的なものではありません。Braden Hancock(Laude Institute)やNathan Lambert(Allen Institute for AI)を含む研究者は、蒸留だけではKimi K3の全能力を説明できないと主張しています。また、広く拡散された、思考過程の蒸留の証拠とされるPDFは、限定的な実験と根拠のない主張を組み合わせたものとして批判されました。
この欠陥は、知的財産権の侵害以外にも、複数の具体的なリスクを引き起こします。
3社は全て、「Stolen Thoughts」の研究者から事前に連絡を受けていました。報道によると、OpenAI、Anthropic、Googleは通知を受けた後、クロスモデル推論攻撃をブロックしました。緩和策の具体的な詳細は公開された情報源では完全には開示されていませんが、この脆弱性は修正前に3社全てのAPIに存在することが確認されました。攻撃が「ブロックされた」ということは、各社がサーバーサイドの修正(暗号化された推論ブロックが異なるモデルコンテキストやアカウント間で再利用されるのを制限するなど)を実装したことを示唆しています。
Anthropicは、中国のラボがClaudeの出力を抽出するために使用した24,000の不正アカウントと1,600万のやり取りについて報告し、大規模な蒸留と公に戦っていました。
REPとStolen Thoughtsの両論文からの核心的な教訓は、推論過程を隠蔽したり暗号化したりすることは、本質的に脆弱なセキュリティ戦略であるということです。もし推論がモデルの重みの中に存在するならば、それは引き出されうるのです。