Anthropic 于 2026 年 9 月 10 日发布的威胁情报报告称,其团队在 2025 年 12 月至 2026 年 8 月的八个月内,识别并阻断了一批试图滥用 Claude 的活动。涉及的模型为 Claude Haiku、Sonnet 和 Opus,风险领域包括网络行动、影响力行动、监控、诈骗与欺诈、生物滥用、常规武器研发和非法模型蒸馏。
16
理解这份报告时,最重要的边界在于:它记录的是获取 AI 协助的尝试,并不等同于相关武器、监控或生物项目已在现实中部署,更不意味着这些项目已经成功。Anthropic 也将这些内容定位为具有代表性的案例,而不是 Claude 日常使用情况的统计样本。
16
报告传递的核心警示
Anthropic 的总体判断是,更强的模型可能压低有害活动所需的专业知识、人力和时间成本。在披露案例中,相关行为者尝试让模型协助完成研究、软件开发、目标材料整理和行动分析等任务。
1
16
武器与监控相关尝试
报告中较受关注的指控,涉及利用 Claude 支持常规武器和监控工作。有关披露的报道提到,相关尝试与自主单向攻击无人机软件、导弹导航系统以及军事用途有关,且涉事行为者被指与俄罗斯、伊朗、中国和也门存在关联。
1
案例材料还包括:试图通过 WhatsApp 和 Telegram 识别并锁定维吾尔族群体,以及在马里建设大规模电信监控系统。它们反映出一个更广泛的风险:模型的用途不止于生成代码,也可被用于研究、分类、分析和制作行动文件。
1
16
生物滥用尝试
Anthropic 识别出 5 起生物滥用案例。根据对报告的报道,其中一起与试图提高一种蚊媒病毒传播性有关。
1
公司还表示,一些用户在 Claude 拒绝敏感请求后,转向寻找其他 AI 系统。这并不能证明他们在其他平台取得成功,但说明了服务商层面防护的局限:一次拒答可以中断单一服务中的活动,却未必能让行为者放弃寻找替代渠道。
1
非法模型蒸馏行动
报告还讨论了非法模型蒸馏,即利用能力更强模型的输出,协助训练另一个模型。Anthropic 将相关行动归因于 7 家总部位于中国的实验室,其中点名阿里巴巴、月之暗面(Moonshot)和 DeepSeek;报告称,这些行动使用大量账号及转发式提示词,以获取可用于训练的模型输出或推理内容。
1
这类滥用与武器或监控不同,却同样是 AI 开发商的战略风险:模型访问权限可能被用来复刻能力,并在一定程度上绕过独立开发所需的成本。
涉及哪些 Claude 模型?
Anthropic 表示,已披露的滥用案例涉及 Claude Haiku、Sonnet 和 Opus。公司称,较新的 Fable 和 Mythos 模型类别没有出现在这些案例中,但有一个例外:非法蒸馏案例。
12
16
因此,“Fable 和 Mythos 完全没有出现在报告中”的说法并不准确。更严谨的结论是:除该蒸馏例外外,它们未被用于报告披露的滥用案例。
12
Anthropic 做了什么,证据又能说明什么?
Anthropic 称,其已阻断相关行动、封禁涉事账号、加强防御措施,并在适当情况下与主管部门及行业合作伙伴分享信息。
16
不过,这终究是一份企业基于自身平台观察所作的报告。它对于了解 Anthropic 检测到什么、如何应对具有参考价值,但不能被当作对每一名被指控行为者都已完成其计划的独立确认。Anthropic 自己也强调,这是一组值得关注的案例,并非所有滥用活动的代表性调查。
16
为什么报告之后出现“放缓前沿”主张?
报告发布两天后,Anthropic CEO 达里奥·阿莫代伊发表文章《We Must Pace the Frontier》(可译为“我们必须为前沿发展控速”)。他主张,AI 公司应有意识地放慢前沿模型能力提升的速度,同时继续推进技术进步,以便让对齐、安全防护和验证机制跟上。
25
这并不是要求停止训练。阿莫代伊提出的首项具体承诺是:Anthropic 将给予第三方评估机构长期、员工级别的系统访问权限,使其能够评估安全实践、报告事件,并在训练期间评估模型对齐情况。
18
25
他的三步方案还包括企业内部层面的监督、民主国家企业之间的协调,以及最终推动更广泛的国际协调。
23
25
已经得到支持的结论与尚无法证实的说法
这份报告所能支持的结论是:Anthropic 称其在上述期间发现并阻断了对较早 Claude 模型的恶意使用尝试,覆盖七类危害;这也构成该公司认为安全控制必须随模型能力同步演进的具体理由。
16
但现有报道不能证明,该报告直接导致了某项美国国会行动、结束美国众议院休会,或促成针对“超级智能”的特定立法禁令。AI 安全监管确实正面临更大的政治压力,阿莫代伊也主张政府应帮助维持能力与安全之间的平衡;但要建立这些具体的因果关系,仍需要本材料之外的证据。
25
27
更现实、也更关键的启示是:防止 AI 被滥用,不能只靠模型拒绝有害提示词。随着能力提升,还需要监测协同滥用、应对账号规避和蒸馏行为、共享威胁情报,并让安全评估具备可信度。
16
25