研究團隊發現API漏洞,可以將OpenAI、Anthropic、Google旗艦模型嘅加密「思考區塊」重演落弱啲嘅兄弟模型,還原隱藏推理內容。 提取出嚟嘅推理痕跡揭示Kimi K3等中國AI系統嘅思考模式同美國模型高度相似,成為蒸餾爭議嘅新證據。

Create a landscape editorial hero image for this Studio Global article: How did researchers discover a method to extract hidden reasoning traces from leading AI models, what did it reveal about potential distilla. Article summary: ## How researchers discovered the extraction method. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年,兩個獨立研究團隊先後公開破解咗頂尖AI模型嘅隱藏推理機制。第一個係叫做Reasoning Exposure Prompting(REP)嘅提示詞攻擊,可以將模型刻意隱藏嘅思考鏈扯返出嚟俾用戶睇到。第二個係叫「偷諗法」(Stolen Thoughts)嘅重演攻擊,專攻OpenAI、Anthropic同Google點樣加密API回傳嘅原始思考區塊嘅結構漏洞。兩個漏洞加埋,為中國AI系統好似Moonshot嘅Kimi K3係咪透過蒸餾偷取美國專有模型呢個爭議,提供咗全新嘅法證證據。
Reasoning Exposure Prompting (REP)——2026年5月30日發表嘅論文《Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs》(arXiv:2606.00642)入面,研究員Lu、Tsai、Tsai、Popa同Yu展示咗,即使供應商刻意隱藏思考鏈,一個輕量級嘅上文下理提示技巧都可以將隱藏推理扯返出嚟。呢個方法叫做影子模型提示(shadow-model prompting),係用一個較細、冇限制嘅模型產生示範,再用輔助代碼格式包裝,去從目標模型度提取內部痕跡。提取到嘅痕跡夠晒仔細,可以用嚟蒸餾一個細模型出嚟。
「偷諗法」重演攻擊——2026年8月10至11日發表嘅論文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)入面,研究員Panfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping同Andriushchenko發現咗一個關鍵嘅架構缺陷。Anthropic、OpenAI同Google回傳俾API用戶嘅加密「思考」區塊,係冇同來源綁實嘅。呢啲區塊可以從一段對話抽起,然後重演落同一個供應商嘅弱啲兄弟模型度,跟住兄弟模型就會將旗艦模型嘅隱藏推理印返出嚟做明文。呢種攻擊跨越唔同對話、唔同用戶帳戶,甚至同一個供應商旗下嘅唔同模型都得
。研究員確認呢個技巧喺佢哋測試嘅每一間頂尖AI公司都work到,而且還原出嚟嘅推理長度同API報稱嘅隱藏思考token數幾乎係1比1吻合
。
提取出嚟嘅推理痕跡,為模型蒸餾——即係用強模型嘅輸出嚟訓練一個更平、更細嘅競爭對手模型——提供咗高質素嘅訓練訊號。呢個技術正正係圍繞中國AI實驗室嘅激烈爭議核心:
不過,證據唔係鐵證。包括Laude Institute嘅Braden Hancock同Allen Institute for AI嘅Nathan Lambert在內嘅研究員都話,齋靠蒸餾解釋唔到Kimi K3嘅全部能力。一份聲稱證明咗思考鏈蒸餾嘅廣傳PDF,就被批評係將有限嘅實驗同未經證實嘅主張夾埋一齊。
呢個缺陷帶嚟嘅具體風險遠超知識產權盜竊:
三間公司喺「偷諗法」論文發表之前都俾研究員通知咗。根據報導,OpenAI、Anthropic同Google收到通知之後已經封鎖咗呢種跨模型推理攻擊。具體嘅緩解措施細節冇喺公開來源全面披露,但漏洞喺修補之前確實存在於三間供應商嘅API。攻擊被「封鎖」意味住公司實施咗伺服器端嘅修正——好大機會係限制加密推理區塊喺唔同模型情境或用戶帳戶之間嘅重用
。
Anthropic之前已經公開同大規模蒸餾抗爭,舉報咗中國實驗室用24,000個假帳戶同1,600萬次對話嚟提取Claude輸出。
無論係REP定係「偷諗法」論文,核心教訓都係一樣:隱藏或者加密推理痕跡,係一種根本上就好脆弱嘅安全策略——如果推理存在於模型權重入面,就一定會俾人誘導出嚟。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
研究團隊發現API漏洞,可以將OpenAI、Anthropic、Google旗艦模型嘅加密「思考區塊」重演落弱啲嘅兄弟模型,還原隱藏推理內容。
研究團隊發現API漏洞,可以將OpenAI、Anthropic、Google旗艦模型嘅加密「思考區塊」重演落弱啲嘅兄弟模型,還原隱藏推理內容。 提取出嚟嘅推理痕跡揭示Kimi K3等中國AI系統嘅思考模式同美國模型高度相似,成為蒸餾爭議嘅新證據。
漏洞同時導致超過300個PII資料同182組憑證(包括API密鑰同密碼)洩漏,而且有害行為轉移率高達80%。