“窃思”重放攻击 —— 该成果发表于2026年8月10日至11日的论文《从专有大语言模型API窃取推理痕迹》(arXiv:2608.09867)。研究人员Panfilov, Schmotz, Shumailov等人发现,Anthropic、OpenAI和谷歌返回给API客户端的加密“思考”模块与源会话的绑定不牢固。这些加密块可以被从一个对话中取出,然后“重放”到同一提供商的另一个防护较弱的兄弟模型中,该模型随后会将旗舰模型的隐藏推理以明文形式输出。攻击跨会话、跨用户账户,甚至跨同一生态系统内的不同模型都有效。研究人员确认,该技术在他们测试的每一家主要前沿AI公司上都奏效,且恢复的推理长度与API报告的隐藏思考令牌数量几乎达到1:1的匹配。
提取出的推理痕迹为模型蒸馏——即利用更强模型的输出来训练更小、更便宜的竞品模型——提供了高质量的训练信号。这项技术正是围绕中国AI实验室激烈争议的核心:
然而,证据并非铁证如山。包括Laude研究所的Braden Hancock和艾伦人工智能研究所的Nathan Lambert在内的研究人员认为,仅仅蒸馏不足以解释Kimi K3的全部能力。一份广为流传的、声称是思维链蒸馏证据的PDF被批评为结合了有限的实验和未经证实的声明。
该漏洞除了知识产权盗窃之外,还引入了多项具体风险:
在“窃思”研究论文发表前,所有三家公司都收到了通知。据相关报道,OpenAI、Anthropic和谷歌在接到通知后已阻止了跨模型推理攻击。具体缓解措施的细节未在公开来源中完全披露,但该漏洞在修补前被确认存在于所有三家提供商的API中。“已阻止”这一说法表明这些公司实施了服务器端修复——很可能限制了加密推理块在不同模型上下文或账户间的重复使用。
Anthropic此前一直在公开应对大规模的蒸馏行为,并报告了中国实验室用于提取Claude输出的24,000个欺诈账户和1600万次交互。
REP和“窃思”两篇论文的核心教训是,隐藏或加密推理痕迹是一种从根本上就脆弱的策略——如果推理存在于模型权重中,它就可以被诱导出来。