Anthropic于2026年6月9日发布了Claude Fable 5,号称是其面向公众的最强AI模型。但这次发布迅速激起了网络安全圈的强烈反弹。在公司将其包装成“负责任的发布”的同时,安全专家们却认为,内置的“安全护栏”太过激进,导致模型在合法的网络防御、安全研究领域也几乎成了摆设。
批评的焦点不在于护栏本身,而在于其实现的致命缺陷:它过滤得过于宽泛,且失败时会偷偷换上一个较弱的旧模型,完全不让用户知道。以下是对这场争议和技术细节的梳理:
最典型的声音来自IBM X-Force的知名研究员Valentina “Chompie” Palmiotti,她对TechCrunch说,Fable 5会拒绝“任何跟网络沾边的请求——哪怕只是读取一篇博客文章都算”。这意味着,不仅是恶意请求,连理解和研究基础网络安全知识都可能被拦下来。
这种“误杀率”之所以难以饶恕,还因为它对用户体验的影响。当一个查询被标记后,模型并不会直接拒绝,而是偷偷将请求转给一个更旧、性能更差的AI模型来生成回答,而用户完全被蒙在鼓里 。更糟的是,这种机制在发布时并未公开说明,而是被塞在一份长达319页的系统卡深处,直到被研究者挖出才引发众怒,批评者直指这是Anthropic的“暗箱破坏”
。
被限制的不仅是网安领域,还包括化学、生物学,以及一个极其敏感的领域:AI模型蒸馏。正是因为对AI蒸馏的控制,让Anthropic背上了另一重骂名:不少开发者指控其用“安全”当幌子,暗中阻碍其他AI开发者基于Fable 5训练新模型,这是典型的垄断行为 。
Claude Fable 5的安全系统不是一道简单的“拒绝门禁”,而是一套“静默路由”机制,旨在让你察觉不到它在限制你 。架构分三步走:
Anthropic声称这个分类系统平均仅在不到5%的会话中会被触发。公司发言人向Business Insider公开承认存在“误杀”,称这些措施“可能会将安全、中性甚至无害的请求也一并标记出来”,但坚持这是在将如此强大的底层模型公开化时的必要取舍。
面对质疑,Anthropic的立场很明确:这不是系统的Bug,而是一种刻意且负责任的“安全保守设计”。公司的理由是,Mythos级的底层模型在发现和利用软件漏洞方面能力过于强悍,如不加以限制就公开发布,将带来不可接受的巨大恶意利用风险 。
在他们看来,这套护栏是一种“设计妥协”——为公众提供最前沿的编程与创作能力,同时给最危险的底层能力加上一圈沙盒限制 。他们声称,过度过滤是快速发布强大模型必然要付出的短期代价,并承诺后续会优化分类器的精度
。
要理解Fable 5的争议,就不能脱离其与孪生兄弟Claude Mythos 5的二元发布策略,这正成为前沿AI部署的新行业标准 。
6月9日,Anthropic不仅发布了Fable 5,还同步发布了Claude Mythos 5。两者共享完全相同的底层架构与模型权重,本质上是同一个“大脑”。唯一的区别只在于安全配置。Mythos 5删除了所有上述领域的分类器,释放了全部、不受限制的能力。
但是,Mythos 5不对公众开放。它仅限一小部分经过严格审核的合作伙伴使用,其中包括美国政府机构、关键基础设施运营商,通过一个名为**“玻璃翅膀”项目(Project Glasswing)**的计划进行。 该项目最初由美国政府的支持,由AWS、谷歌、微软等12家科技巨头参与,旨在让防御方能利用AI在开源世界里大规模修复漏洞。
随着Mythos 5的发布,权限扩大至大约40家组织。
下面的表格清楚展现了这个根本性的割裂:
| 模型 | 开放程度 | 安全配置 | 用户体验 |
|---|---|---|---|
| Claude Fable 5 | 公众开放 | 开启严格分类器;敏感话题被静默路由到Claude Opus 4.8 | 在网安、生物、化学等领域体验极差,用户甚至不清楚发生了什么 |
| Claude Mythos 5 | 严格受限(仅限政府与关键伙伴) | 移除了分类器;释放全部Mythos级能力 | 无任何阻碍,但只有极少数通过安全审核的机构能用到 |
Anthropic这套“Fable / Mythos”的分裂发布,是能力分层部署最赤裸裸的例证。在这场新规则里,同一个顶尖AI不再是一个固定的产品。它的最强能力是一种特权,而不是标配,而“安全护栏”则充当了产品差异塑造与权限控制的工具。
这套策略并非Anthropic独创。包括OpenAI在内的其他领先AI公司,也都在用类似的方式,将最前沿的模型访问权限只留给国家安全与研究领域的特殊合作伙伴。 Claude Fable与Mythos的发布,清晰地指明了一个未来:最强大的AI能力,其大门不是由技术决定的,而是由你的资质审核状态决定的,“安全协议”成为隐形的门禁系统,这早已点燃了关于AI集权、公平性以及“公共安全”真实含义的激烈讨论。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
网安研究者痛批Claude Fable 5的“护栏”乱杀无辜:请求阅读一篇博客都能触发安全警报,连基础网络安全概念都被过滤。
网安研究者痛批Claude Fable 5的“护栏”乱杀无辜:请求阅读一篇博客都能触发安全警报,连基础网络安全概念都被过滤。 争议核心是一套“静默切换”机制:凡是涉网安、生物、化学、AI提取的请求,都被偷换成较弱的旧版本回答,且不给提示。
Anthropic同步释出公开“阉割版”Fable 5与仅供受信机构的“满血版”Mythos 5,这种按资质分层部署AI的模式成行业新常态。