研究人員在2026年8月發現,OpenAI、Anthropic、Google等公司頂尖AI模型的加密「思維」區塊存在結構性漏洞,可被重播至較弱的同系列模型中,以明文形式還原其隱藏推理過程。 此漏洞為中國AI系統Kimi K3是否透過「模型蒸餾」技術,竊取Anthropic Claude等美國模型的推理能力,提供了新的法醫證據,但也引發學界對證據是否充分的辯論。

Create a landscape editorial hero image for this Studio Global article: How did researchers discover a method to extract hidden reasoning traces from leading AI models, what did it reveal about potential distilla. Article summary: ## How researchers discovered the extraction method. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年,兩個獨立研究團隊發表了突破頂尖AI模型隱藏推理安全性的方法。第一種是稱為推理暴露提示(Reasoning Exposure Prompting, REP) 的提示技術,能將模型隱藏的思維鏈拉回用戶可見的輸出中。第二種是稱為「偷走的思維」的重播攻擊,利用OpenAI、Anthropic與Google在API中回傳的加密推理區塊的結構性缺陷。這兩項漏洞共同為中國AI系統(如Moonshot的Kimi K3)是否透過蒸餾美國專有模型而建構的持續爭議,提供了新的法醫證據。
推理暴露提示(REP) — 於2026年5月30日發表在論文《隱藏思維並非秘密:大型語言模型中的推理軌跡暴露》(arXiv:2606.00642)中,研究人員Lu、Tsai、Tsai、Popa與Yu證明,即使供應商刻意隱藏思維鏈推理,一種輕量級的上下文提示技術仍可將隱藏推理拉回用戶可見的輸出中。這種方法稱為影子模型提示,利用來自較小、不受限制模型的示範,包裹在輔助代碼格式中,從受害模型中提取內部軌跡。恢復的軌跡細節足以蒸餾出一個較小的模型。
「偷走的思維」重播攻擊 — 於2026年8月10日至11日發表在論文《從專有LLM API竊取推理軌跡》(arXiv:2608.09867)中,研究人員Panfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping與Andriushchenko發現了一個關鍵的架構缺陷。Anthropic、OpenAI與Google回傳給API客戶端的加密「思維」區塊,並未與其來源正確密封。這些區塊可以從一次對話中取出,並重播到同一供應商較弱、防護較少的同系列模型中,後者便會以明文列印出前沿模型的隱藏推理。此攻擊可跨會話、跨用戶帳戶以及跨同一供應商生態系中的模型運作
。研究人員證實,此技術在他們測試的每一家主要前沿AI公司上皆能運作,且恢復的推理長度與API回報的隱藏思考令牌數量幾乎是1:1吻合
。
提取出的推理軌跡為模型蒸餾提供了高品質的訓練訊號——即利用較強模型的輸出,來訓練一個更小、更便宜的競爭對手模型。這項技術正處於圍繞中國AI實驗室的一場激烈爭議中心:
然而,證據並非決定性。包括Braden Hancock(Laude Institute)和Nathan Lambert(艾倫AI研究所)在內的研究人員認為,僅憑蒸餾無法解釋Kimi K3的全部能力。一份廣為流傳、聲稱證明思維鏈蒸餾的PDF,被批評為結合了有限的實驗與未經證實的主張。
該缺陷帶來了超越智慧財產權盜竊的多項具體風險:
所有三家公司在論文發表前都已接到「偷走的思維」研究團隊的通知。根據報導,OpenAI、Anthropic與Google在獲悉後封鎖了跨模型推理攻擊。他們具體的緩解措施細節並未在已發布來源中完整揭露,但該漏洞在修補前已確認存在於所有三家供應商的API中。攻擊被「封鎖」表明這些公司實施了伺服器端修復——很可能限制了加密推理區塊在不同模型上下文或帳戶間的重複使用
。
Anthropic在此之前已持續公開對抗大規模蒸餾,報告了中國實驗室用於提取Claude輸出的24,000個詐騙帳戶和1,600萬次互動。
REP和「偷走的思維」論文的核心教訓是,隱藏或加密推理軌跡從根本上來說是一種脆弱的資安策略——如果推理存在於模型權重中,它就可以被誘導出來。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
研究人員在2026年8月發現,OpenAI、Anthropic、Google等公司頂尖AI模型的加密「思維」區塊存在結構性漏洞,可被重播至較弱的同系列模型中,以明文形式還原其隱藏推理過程。
研究人員在2026年8月發現,OpenAI、Anthropic、Google等公司頂尖AI模型的加密「思維」區塊存在結構性漏洞,可被重播至較弱的同系列模型中,以明文形式還原其隱藏推理過程。 此漏洞為中國AI系統Kimi K3是否透過「模型蒸餾」技術,竊取Anthropic Claude等美國模型的推理能力,提供了新的法醫證據,但也引發學界對證據是否充分的辯論。
該漏洞還導致大量憑證與個資外洩,研究人員在31萬個推理區塊中發現367個個資與182組憑證,並可能被用於繞過反蒸餾保護、轉移有害行為。