2026年、二つの研究チームが、OpenAI、Anthropic、Google製の最先端AIモデルがユーザーに隠している「思考過程」を抜き出す攻撃手法を独立に発表。この「Stolen Thoughts(盗まれた思考)」攻撃は、暗号化された推論ブロックをより弱いモデルに「再生」することで機能する。 引き出された推論データは、中国のAIラボ(Moonshot AIのKimi K3など)が米国製モデルを「蒸留(ディスティレーション)」して開発したとする疑惑の新たな証拠として注目されている。出力パターンの統計的な類似性が指摘される一方、決定的な証明には至っていない。

Create a landscape editorial hero image for this Studio Global article: How did researchers discover a method to extract hidden reasoning traces from leading AI models, what did it reveal about potential distilla. Article summary: ## How researchers discovered the extraction method. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年、2つの独立した研究チームが、最先端AIモデルの「隠された推論」の安全性を破る手法を発表しました。1つ目は「Reasoning Exposure Prompting (REP)」と呼ばれるプロンプト技術で、モデルの隠された思考過程(チェーン・オブ・ソート)をユーザーに見える出力に引き出します。2つ目は「Stolen Thoughts(盗まれた思考)」と名付けられたリプレイ攻撃で、OpenAI、Anthropic、GoogleのAPIが返す暗号化された推論ブロックの構造的な欠陥を利用します。これらの脆弱性は、中国のAIシステム、特にMoonshot社のKimi K3が米国のプロプライエタリなモデルを蒸留(ディスティレーション)して構築されたという継続的な論争に、新たな法科学的証拠を提供しています。
Reasoning Exposure Prompting (REP) — 2026年5月30日、論文「Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs」(arXiv:2606.00642)で発表。研究者のLu、Tsai、Tsai、Popa、Yuらは、プロバイダーが意図的に思考過程を隠蔽していても、軽量なインコンテキスト・プロンプト技術(シャドウモデル・プロンプティング)を用いることで、隠された推論をユーザー可視の出力に引き出せることを示しました。回収された推論過程は、小型モデルを蒸留するのに十分な詳細さを持っています。
「Stolen Thoughts」リプレイ攻撃 — 2026年8月10日~11日、論文「Stealing Reasoning Traces from Proprietary LLM APIs」(arXiv:2608.09867)で発表。研究者のPanfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping、Andriushchenkoらは、Anthropic、OpenAI、GoogleがAPIクライアントに返す暗号化された「思考」ブロックが、そのソースに適切に紐づけられていないという重大なアーキテクチャ上の欠陥を発見しました。これらのブロックは、ある会話から持ち出され、同じプロバイダーのより弱い兄弟モデルに「再生」されると、その最先端モデルの隠された推論を平文で出力します。この攻撃は異なるセッション間、異なるユーザーアカウント間、そして同じプロバイダーのエコシステム内の異なるモデル間で機能します
。研究者らは、この手法がテストしたすべての主要なフロンティアAI企業で有効であることを確認し、回収された推論の長さはAPIが報告する隠された思考トークン数とほぼ1:1で一致したと述べています
。
抽出された推論過程は、モデル蒸留(より強力なモデルの出力を使って、より小さく安価な競合モデルを訓練する手法)のための高品質なトレーニング信号を提供します。この手法は、中国のAIラボを巡る激しい論争の中心にあります。
しかし、この証拠は決定的なものではありません。Braden Hancock(Laude Institute)やNathan Lambert(Allen Institute for AI)を含む研究者は、蒸留だけではKimi K3の全能力を説明できないと主張しています。また、広く拡散された、思考過程の蒸留の証拠とされるPDFは、限定的な実験と根拠のない主張を組み合わせたものとして批判されました。
この欠陥は、知的財産権の侵害以外にも、複数の具体的なリスクを引き起こします。
3社は全て、「Stolen Thoughts」の研究者から事前に連絡を受けていました。報道によると、OpenAI、Anthropic、Googleは通知を受けた後、クロスモデル推論攻撃をブロックしました。緩和策の具体的な詳細は公開された情報源では完全には開示されていませんが、この脆弱性は修正前に3社全てのAPIに存在することが確認されました。攻撃が「ブロックされた」ということは、各社がサーバーサイドの修正(暗号化された推論ブロックが異なるモデルコンテキストやアカウント間で再利用されるのを制限するなど)を実装したことを示唆しています
。
Anthropicは、中国のラボがClaudeの出力を抽出するために使用した24,000の不正アカウントと1,600万のやり取りについて報告し、大規模な蒸留と公に戦っていました。
REPとStolen Thoughtsの両論文からの核心的な教訓は、推論過程を隠蔽したり暗号化したりすることは、本質的に脆弱なセキュリティ戦略であるということです。もし推論がモデルの重みの中に存在するならば、それは引き出されうるのです。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
2026年、二つの研究チームが、OpenAI、Anthropic、Google製の最先端AIモデルがユーザーに隠している「思考過程」を抜き出す攻撃手法を独立に発表。この「Stolen Thoughts(盗まれた思考)」攻撃は、暗号化された推論ブロックをより弱いモデルに「再生」することで機能する。
2026年、二つの研究チームが、OpenAI、Anthropic、Google製の最先端AIモデルがユーザーに隠している「思考過程」を抜き出す攻撃手法を独立に発表。この「Stolen Thoughts(盗まれた思考)」攻撃は、暗号化された推論ブロックをより弱いモデルに「再生」することで機能する。 引き出された推論データは、中国のAIラボ(Moonshot AIのKimi K3など)が米国製モデルを「蒸留(ディスティレーション)」して開発したとする疑惑の新たな証拠として注目されている。出力パターンの統計的な類似性が指摘される一方、決定的な証明には至っていない。
この脆弱性により、推論過程内に埋め込まれたAPIキーやパスワードなどの認証情報が漏洩するリスクが確認された。また、有害な振る舞いを誘発する推論パターンが転写される危険性も報告されている。