「偷諗法」重演攻擊——2026年8月10至11日發表嘅論文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)入面,研究員Panfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping同Andriushchenko發現咗一個關鍵嘅架構缺陷。Anthropic、OpenAI同Google回傳俾API用戶嘅加密「思考」區塊,係冇同來源綁實嘅。呢啲區塊可以從一段對話抽起,然後重演落同一個供應商嘅弱啲兄弟模型度,跟住兄弟模型就會將旗艦模型嘅隱藏推理印返出嚟做明文。呢種攻擊跨越唔同對話、唔同用戶帳戶,甚至同一個供應商旗下嘅唔同模型都得。研究員確認呢個技巧喺佢哋測試嘅每一間頂尖AI公司都work到,而且還原出嚟嘅推理長度同API報稱嘅隱藏思考token數幾乎係1比1吻合。
提取出嚟嘅推理痕跡,為模型蒸餾——即係用強模型嘅輸出嚟訓練一個更平、更細嘅競爭對手模型——提供咗高質素嘅訓練訊號。呢個技術正正係圍繞中國AI實驗室嘅激烈爭議核心:
不過,證據唔係鐵證。包括Laude Institute嘅Braden Hancock同Allen Institute for AI嘅Nathan Lambert在內嘅研究員都話,齋靠蒸餾解釋唔到Kimi K3嘅全部能力。一份聲稱證明咗思考鏈蒸餾嘅廣傳PDF,就被批評係將有限嘅實驗同未經證實嘅主張夾埋一齊。
呢個缺陷帶嚟嘅具體風險遠超知識產權盜竊:
三間公司喺「偷諗法」論文發表之前都俾研究員通知咗。根據報導,OpenAI、Anthropic同Google收到通知之後已經封鎖咗呢種跨模型推理攻擊。具體嘅緩解措施細節冇喺公開來源全面披露,但漏洞喺修補之前確實存在於三間供應商嘅API。攻擊被「封鎖」意味住公司實施咗伺服器端嘅修正——好大機會係限制加密推理區塊喺唔同模型情境或用戶帳戶之間嘅重用。
Anthropic之前已經公開同大規模蒸餾抗爭,舉報咗中國實驗室用24,000個假帳戶同1,600萬次對話嚟提取Claude輸出。
無論係REP定係「偷諗法」論文,核心教訓都係一樣:隱藏或者加密推理痕跡,係一種根本上就好脆弱嘅安全策略——如果推理存在於模型權重入面,就一定會俾人誘導出嚟。