来自德国图宾根大学、马克斯·普朗克研究所、MATS Research及安全公司Snyk的研究人员开发了一种“回放攻击”,仅需两次API调用就能提取Anthropic、OpenAI和Google旗下模型的加密“思维链”。 该攻击暴露了一个严重安全漏洞:同一个全局加密密钥被用于所有会话,导致开发者在公开日志中泄露了62个活跃API密钥、33个密码等总计704个隐私信息。
研究答案

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年8月,由德国图宾根大学、马克斯·普朗克智能系统研究所、MATS Research、ELLIS研究所图宾根分院及安全公司Snyk组成的研究团队发布了一篇论文,详细介绍了一种针对前沿AI模型加密推理过程的攻击方法。令人惊讶的是,这个攻击不仅简单,而且同时影响了Anthropic、OpenAI和Google三大提供商的API。攻击者无需破解任何前沿模型本身,而是利用了一个根本性的架构选择:这些公司会将模型的“推理块”加密后返回给API客户端,而不是存储在服务器端。这些块在不同会话、用户甚至同一提供商的不同模型之间是通用的 。研究人员只需将一个来自强大前沿模型的加密推理块“喂”给其旗下的一个较弱模型,这个较弱模型便会解码并以明文形式输出其内容
。这项被论文称为“解密越狱”的技术,详细记录在2026年8月10日提交至arXiv的预印本《从专有LLM API窃取推理痕迹》中
。
当用户通过API查询Claude Opus 4.8或GPT-5.6 Sol这样的前沿模型时,模型会执行内部的逐步推理——即“思维链”——然后将这些推理过程作为一长串加密文本返回给客户端。在后续的调用中,客户端将这个加密块重新传给API,使模型能够继续推理,而提供商无需在服务器端存储中间状态 。
研究人员发现,这些加密块并未与特定的会话、用户甚至模型绑定,因为它们在所有会话和用户之间共享同一个全局加密密钥 。这意味着从一个对话中获取的加密块可以在另一个上下文中重放。关键在于:将来自安全级别极高的前沿模型的加密块,输入到同一提供商旗下安全性较弱的模型(例如Claude Haiku),这个较弱的模型由于缺少严格的护栏,会直接以明文输出块的内容
。
执行这个攻击只需要两次API调用:一次用于捕获加密块,另一次将其发送给较弱模型。研究人员证明了这种攻击可以大规模实施 。
这项攻击不仅仅暴露了前沿模型的推理过程,还为持续争论中的中国AI公司Moonshot AI是否通过“蒸馏”(即复制)美国模型的推理能力来训练其Kimi K3模型提供了新的证据。
在从Claude Opus 4.8和GPT-5.6 Sol中提取出推理痕迹后,研究人员将其与包括Kimi K3在内的开源模型的输出进行了比较。他们发现,Kimi K3的输出表现出所谓的“异常概率现象”,这些现象与在Claude和GPT推理痕迹中发现的模式高度吻合 。
这些证据是间接的,而非决定性的。独立研究人员表示,这些发现“提供了一些证据——尽管不是确凿的证据——表明某些中国模型可能通过蒸馏美国模型的推理信息进行训练” 。另一个值得注意的发现是:当被要求进行自我身份识别时,Kimi K3最初自称是“源于Anthropic的Claude”,这进一步加剧了对其“蒸馏”行为的指控
。
Kimi K3是Moonshot AI于2026年7月16日发布的一个拥有2.8万亿参数的开源模型。它在多个基准测试中超越了Claude Opus 4.8,但并未明确成为领先者。在独立的“人工智能分析智能指数”上,K3得分为57,而Claude Fable 5为60分,GPT-5.6 Sol为59分。Moonshot公司自己也坦诚表示,K3在整体性能上仍落后于GPT-5.6 Sol和Claude Fable 5 。
关于“蒸馏”的指控并不新鲜——Anthropic和OpenAI此前都曾公开指责中国公司系统性地蒸馏他们的模型。一项对中国学术论文和专利的审查发现,中国军方研究人员正在使用OpenAI和Anthropic模型的输出来训练本国的AI系统,以增强国防能力 。
Kimi K3的发布立即引发了争议。在其7月16日发布后的几小时内,Anthropic就指控Moonshot AI通过蒸馏Claude的方式构建K3,这一指控甚至传到了白宫,引发了可能实施制裁的讨论 。
然而,批评“蒸馏”指控的人指出存在一个时间问题。Claude Opus 4.8是在Kimi K3发布前不久才推出的。独立研究人员表示,时间线使得直接的“复制”变得“不可信”,因为根本没有足够的时间来通过蒸馏一个新近发布的模型来训练一个2.8万亿参数的模型 。Moonshot AI则坚称K3是基于独立研究开发的
。
同样的架构缺陷也暴露了一个实际的安全漏洞。由于前沿模型有时会将其凭证和个人数据整合到推理过程中,那些开发者公开分享的加密推理块(例如在代理会话日志中)包含了敏感的私人信息,任何了解这个把戏的人都能读取这些信息。
通过对2026年8月前公开分享的约7,000个代理会话日志进行扫描,研究人员发现了藏在加密推理块内部的62个活跃的API密钥、33个密码和其他敏感用户数据——共计704个隐私信息 。任何发布了原始代理日志的开发者,都可能无意中在其认为无人能读取的加密块中泄露了API密钥、密码和个人身份信息
。这包括存储在公共GitHub仓库中的日志 。
研究人员确定了由该漏洞引发的四种不同攻击路径:重建隐藏的推理过程、恢复嵌入在代理痕迹中的秘密、通过不可审查的通道注入指令,以及跨会话重放未过期块 。
在研究团队遵循负责任的披露程序后,所有三家公司都部署了服务器端缓解措施 。
研究人员向OpenAI、Anthropic、Google、Microsoft和Hugging Face披露了他们的发现。在提供商实施更改后,可重复性检查确认,针对当前API版本的主要提取技术已不再有效 。现在的官方文档建议开发者在共享日志或在对话中途切换模型前,先剥离其中的推理块
。
值得注意的是,密码学研究员Matthew Green曾在2026年5月通过漏洞奖励计划分别向OpenAI和Anthropic报告了跨会话重放的漏洞,但在该学术论文发表前,这两家公司都给出了敷衍了事的回应 。
这些补丁截至2026年8月已生效,但从公共网络上抓取的历史会话日志中,那些已被解码的推理块仍然可以被访问 。
“思维窃取”攻击揭示了现代AI API设计中一个根本性矛盾:提供商为了可扩展性和低延迟,希望将推理状态卸载到客户端,但要保证这些状态在不同会话、用户和模型间的安全,需要进行精心的加密绑定。Anthropic、OpenAI和Google使用的简单全局加密密钥方法,是一个为所有使用这些API的开发者及用户制造了安全和隐私漏洞的捷径。
此攻击也正好落在了中美之间关于AI蒸馏的日益激烈的冲突中。尽管关于Kimi K3的证据是间接的,但它为“蒸馏”行为可能正在大规模进行提供了迄今为止最强有力的技术证据,并为政策制定者和研究人员提供了一种调查AI模型来源的新工具。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
来自德国图宾根大学、马克斯·普朗克研究所、MATS Research及安全公司Snyk的研究人员开发了一种“回放攻击”,仅需两次API调用就能提取Anthropic、OpenAI和Google旗下模型的加密“思维链”。
来自德国图宾根大学、马克斯·普朗克研究所、MATS Research及安全公司Snyk的研究人员开发了一种“回放攻击”,仅需两次API调用就能提取Anthropic、OpenAI和Google旗下模型的加密“思维链”。 该攻击暴露了一个严重安全漏洞:同一个全局加密密钥被用于所有会话,导致开发者在公开日志中泄露了62个活跃API密钥、33个密码等总计704个隐私信息。
在对Kimi K3的输出进行分析时,研究人员发现了与Claude Opus 4.8和GPT 5.6 Sol推理模式高度吻合的“异常概率现象”,为“蒸馏指控”提供了最强的技术证据,尽管尚不能完全证实。