德國圖賓根大學、馬克斯·普朗克研究所、MATS Research與資安公司Snyk共同發表論文,發現Anthropic、OpenAI和Google的AI模型加密推理區塊共用同一把全球金鑰,可跨會話、跨使用者、跨模型重放。 攻擊者只需兩次API呼叫:一次從前沿模型(如Claude Opus 4.8)捕捉加密推理區塊,另一次將其餵給同一提供商防護較弱的兄弟模型,後者會直接以明文輸出隱藏思考過程。
研究答案

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年8月,一支來自德國圖賓根大學(University of Tübingen)、馬克斯·普朗克智慧系統研究所(Max Planck Institute for Intelligent Systems)、MATS Research、ELLIS Institute Tübingen 以及資安公司 Snyk 的研究團隊,發表了一篇論文,展示了一種令人驚訝的簡單攻擊手法,能破解前沿AI模型的加密推理軌跡。這項攻擊同時影響了三大AI供應商——Anthropic、OpenAI 和 Google——而且完全不需要對任何前沿模型進行越獄(jailbreaking)。
研究團隊發現,這些公司並非將推理過程儲存在伺服器端,而是將加密的「推理區塊」(reasoning blocks)回傳給API客戶端。更關鍵的是,這些加密區塊可以在不同會話、不同使用者,甚至同一供應商的不同模型之間完全互通。研究人員只需將從前沿模型(如 Claude Opus 4.8)捕捉到的加密推理區塊,重放(replay)給同一供應商下防護較弱的兄弟模型(如 Claude Haiku),後者便會直接將軌跡以明文解碼輸出
。這篇名為《從專有LLM API中竊取推理軌跡》(Stealing Reasoning Traces from Proprietary LLM APIs)的預印本,於2026年8月10日提交至arXiv平台
。
當使用者透過API查詢像 Claude Opus 4.8 或 GPT-5.6 Sol 這樣的前沿模型時,模型會先進行內部的逐步推理(即「鏈式思考」),然後將這個推理過程以一段不透明的加密文字區塊回傳給客戶端。後續每次請求時,客戶端會將這個區塊再次傳回API,讓模型可以接續推理,而供應商無需在伺服器端儲存中間狀態。
研究人員發現,這些加密區塊並未綁定特定的會話、使用者或模型。它們共用一把全域加密金鑰。這意味著,從一場對話中捕捉到的區塊,可以在完全不同的情境下重複使用。關鍵在於:將一個來自高度保護的前沿模型的加密區塊,餵給同一供應商下、防護較弱的兄弟模型(例如 Claude Haiku),這個較弱的模型——因其拒絕機制較少——會直接將區塊內容一字不漏地解碼輸出
。
執行這個攻擊只需要兩次API呼叫:一次捕捉加密區塊,一次將其餵給較弱的模型。研究人員證實,這種攻擊可以大規模執行。
這項攻擊不僅曝光了前沿模型的推理過程,也為一場持續已久的爭論提供了新證據:中國AI公司 Moonshot AI 是否透過蒸餾(distillation,實質上就是複製)美國模型的推理過程來訓練其 Kimi K3 模型?
研究人員在從 Claude Opus 4.8 和 GPT-5.6 Sol 提取出推理軌跡後,將其與包括 Kimi K3 在內的開放權重模型的輸出進行比較。他們發現,Kimi K3 的輸出表現出所謂的「異常機率現象」(abnormal probability phenomena),與 Claude 和 GPT 的推理軌跡模式高度吻合。
這些證據是間接的,並非決定性證據。獨立研究人員表示,這些發現「提供了一些證據——儘管不是結論性證據——表明某些中國模型可能是透過蒸餾美國模型的推理資訊來訓練的」。另外一個引人注目的發現是:當 Kimi K3 被要求自我介紹時,它最初曾自稱是 Anthropic 的「Claude」,這進一步加劇了外界的指控
。
Kimi K3 是 Moonshot AI 於2026年7月16日發布的2.8兆參數開放權重模型。它在多項基準測試中超越了 Claude Opus 4.8,但並非毫無爭議的領先者。在獨立的 Artificial Analysis Intelligence Index 上,K3 得分為57,低於 Claude Fable 5 的60分和 GPT-5.6 Sol 的59分。Moonshot 本身也罕見地坦承,K3 總體上仍落後於 GPT-5.6 Sol 和 Claude Fable 5。
關於蒸餾的指控並非新鮮事——Anthropic 和 OpenAI 此前都曾指責中國企業系統性地蒸餾其模型。一份對中國學術論文和專利的審查顯示,中國軍事研究人員使用 OpenAI 和 Anthropic 模型的輸出,來訓練用於國防的國內AI系統。
Kimi K3 的發布立即引發爭議。在其7月16日發布後的幾小時內,Anthropic 就指控 Moonshot 透過蒸餾 Claude 來打造 K3,這項指控甚至驚動了白宮,引發了制裁的討論。
然而,對蒸餾指控持批評意見的人士指出了時間線上的問題。Claude Opus 4.8 是在 Kimi K3 發布前不久才推出的。獨立研究人員表示,從時間上來看,直接複製「難以令人信服」,因為根本沒有足夠的時間,利用一個剛發布不久的模型來蒸餾訓練一個2.8兆參數的模型。Moonshot 則主張 K3 是建立在獨立研究的基礎上
。
同樣的架構缺陷也暴露了一個實際的安全漏洞。由於前沿模型有時會將憑證和個人資料納入其推理過程,開發者公開分享的、包含加密推理區塊的代理會話日誌(例如在 GitHub 上的日誌),實際上含有敏感資訊,任何知道這個訣竅的人都能讀取。
透過掃描2026年8月前發布的約7000個公開代理會話日誌,研究人員在這些加密推理區塊中發現了62組有效API金鑰、33組密碼以及其他敏感的使用者資料——總共704個隱私資料。任何發布了原始代理日誌的開發者,可能都在無意中將API金鑰、密碼和個人識別資訊暴露在他們認為無人能讀取的區塊中
。其中包括儲存在公開 GitHub 儲存庫中的日誌。
研究人員確定了這個漏洞所能實現的四種不同濫用路徑:重建隱藏推理、恢復嵌入在代理軌跡中的機密、透過不可檢查的通道注入指令,以及跨會話重放未過期的區塊。
在研究團隊遵循負責任揭露程序後,三家廠商都部署了伺服器端緩解措施。
研究人員將其發現告知了 OpenAI、Anthropic、Google、Microsoft 和 Hugging Face。在廠商實施了變更後,重現性檢查確認,主要的提取技術已無法在當前的API版本上成功執行。相關文件現在建議在分享日誌或於對話中切換模型前,先移除推理區塊
。
值得注意的是,密碼學研究員 Matthew Green 早在2026年5月就透過他們的漏洞獎勵計畫,分別向 OpenAI 和 Anthropic 報告了跨會話重放的漏洞,但在這篇學術論文發表前,他收到了輕蔑的回應。
截至2026年8月,這些修補程式已經上線。然而,那些在修補前就已經從公開網路上抓取、並包含已解碼推理區塊的歷史會話日誌,仍然是可以存取的。
「思維盜取」攻擊揭示了現代AI API設計中的一個根本矛盾。供應商希望將推理狀態卸載到客戶端,以獲得更好的可擴展性和更低的延遲,但要確保這些狀態在跨會話、使用者和模型時的安全性,就需要精心的設計。Anthropic、OpenAI 和 Google 採用的單一全域加密金鑰方法是一種捷徑,它為所有與這些API互動的使用者和開發者創造了一個安全與隱私漏洞。
這項攻擊也恰逢中美之間因AI蒸餾問題而日益升高的緊張局勢。雖然關於 Kimi K3 的證據是間接的,但它提供了迄今為止最強烈的技術證據,表明大規模蒸餾可能正在發生,並為政策制定者和研究人員提供了一個調查AI模型來源的新工具。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
德國圖賓根大學、馬克斯·普朗克研究所、MATS Research與資安公司Snyk共同發表論文,發現Anthropic、OpenAI和Google的AI模型加密推理區塊共用同一把全球金鑰,可跨會話、跨使用者、跨模型重放。
德國圖賓根大學、馬克斯·普朗克研究所、MATS Research與資安公司Snyk共同發表論文,發現Anthropic、OpenAI和Google的AI模型加密推理區塊共用同一把全球金鑰,可跨會話、跨使用者、跨模型重放。 攻擊者只需兩次API呼叫:一次從前沿模型(如Claude Opus 4.8)捕捉加密推理區塊,另一次將其餵給同一提供商防護較弱的兄弟模型,後者會直接以明文輸出隱藏思考過程。
研究人員掃描約7000個公開代理日誌,從加密推理區塊中發現62組有效API金鑰、33組密碼等共704個隱私資料。