「偷走的思維」重播攻擊 — 於2026年8月10日至11日發表在論文《從專有LLM API竊取推理軌跡》(arXiv:2608.09867)中,研究人員Panfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping與Andriushchenko發現了一個關鍵的架構缺陷。Anthropic、OpenAI與Google回傳給API客戶端的加密「思維」區塊,並未與其來源正確密封。這些區塊可以從一次對話中取出,並重播到同一供應商較弱、防護較少的同系列模型中,後者便會以明文列印出前沿模型的隱藏推理。此攻擊可跨會話、跨用戶帳戶以及跨同一供應商生態系中的模型運作。研究人員證實,此技術在他們測試的每一家主要前沿AI公司上皆能運作,且恢復的推理長度與API回報的隱藏思考令牌數量幾乎是1:1吻合。
提取出的推理軌跡為模型蒸餾提供了高品質的訓練訊號——即利用較強模型的輸出,來訓練一個更小、更便宜的競爭對手模型。這項技術正處於圍繞中國AI實驗室的一場激烈爭議中心:
然而,證據並非決定性。包括Braden Hancock(Laude Institute)和Nathan Lambert(艾倫AI研究所)在內的研究人員認為,僅憑蒸餾無法解釋Kimi K3的全部能力。一份廣為流傳、聲稱證明思維鏈蒸餾的PDF,被批評為結合了有限的實驗與未經證實的主張。
該缺陷帶來了超越智慧財產權盜竊的多項具體風險:
所有三家公司在論文發表前都已接到「偷走的思維」研究團隊的通知。根據報導,OpenAI、Anthropic與Google在獲悉後封鎖了跨模型推理攻擊。他們具體的緩解措施細節並未在已發布來源中完整揭露,但該漏洞在修補前已確認存在於所有三家供應商的API中。攻擊被「封鎖」表明這些公司實施了伺服器端修復——很可能限制了加密推理區塊在不同模型上下文或帳戶間的重複使用。
Anthropic在此之前已持續公開對抗大規模蒸餾,報告了中國實驗室用於提取Claude輸出的24,000個詐騙帳戶和1,600萬次互動。
REP和「偷走的思維」論文的核心教訓是,隱藏或加密推理軌跡從根本上來說是一種脆弱的資安策略——如果推理存在於模型權重中,它就可以被誘導出來。