GRAM(梯度路由辅助模块)是Anthropic与AE Studio提出的一种实验性预训练方法,通过将病毒学、网络安全等双用知识定向路由到大型语言模型内部的专用模块中,从而实现对特定能力模块的按需开关。 在包含四个双用类别的配置中,单个GRAM训练后的模型理论上可配置出2⁴=16种不同的能力组合,通过独立开关各模块实现。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic与AE Studio联合推出了一项名为GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的实验性技术,它为AI模型提供了一种针对危险知识的“颗粒度开关”。与为每一种安全配置单独训练一个模型不同,GRAM的目标是在单个模型中构建可移除的“知识隔间”,专门用于存放病毒学、网络安全和核物理等具有双重用途的能力R。需要强调的是,这是一项初步研究——Anthropic明确表示,该技术尚未应用于任何生产环境中的Claude模型R——但它代表了一种前景,有望让AI安全手段变得比当前“一刀切”的工具箱更加精细。
GRAM是一种预训练方法,旨在将双用知识(既能用于善途也能用于恶途的信息)隔离到语言模型内部可移除的神经模块中R。训练完成后,这些模块可以被打开或关闭,使操作者能够对模型保留哪些危险能力进行精细控制R。同样的方法还可以为不同用户设置不同的访问权限:研究人员可以启用病毒学知识,而面向公众的聊天机器人则将其禁用R。
GRAM在标准的Transformer架构上增加了小型辅助模块——本质上是在每一层都设置专用的神经元——这些模块旨在训练过程中捕获特定的双用能力RR。其关键机制是梯度路由:在反向传播过程中,加权掩码控制着哪些参数因哪些数据而更新OL。
训练完成后,可以移除或禁用单个模块以减少对特定能力的访问,或者保留这些模块用于允许使用该知识的部署场景R。由于每个双用类别都映射到自己的模块,一个训练了四个类别的GRAM模型理论上可以通过独立开关每个模块,配置出2⁴ = 16种不同的能力配置R。
研究人员在多种设置和模型规模下对GRAM进行了测试R:
GRAM研究的出现恰逢一个高风险的现实案例。2025年6月,特朗普政府以网络安全为由,对Anthropic的Claude Fable 5和Mythos 5模型实施出口管制,禁止任何外国公民访问——无论其在美国境内还是境外,甚至包括Anthropic的外国籍员工ACC。这项禁令持续了18天,之后美国商务部在国家安全审查后将其解除FA。
这一事件揭示了当前AI访问控制的状态:整个模型——连同其所有能力——被视为一个不可分割的整体。如果模型具有危险能力,目前唯一的办法就是封锁整个系统。GRAM提出了一种更精细的替代方案:无需锁定整个模型,一个系统可以根据部署环境允许或禁用特定类别的知识R。
Anthropic的研究人员明确表示GRAM是初步工作,并指出了几个局限性R:
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
GRAM(梯度路由辅助模块)是Anthropic与AE Studio提出的一种实验性预训练方法,通过将病毒学、网络安全等双用知识定向路由到大型语言模型内部的专用模块中,从而实现对特定能力模块的按需开关。
GRAM(梯度路由辅助模块)是Anthropic与AE Studio提出的一种实验性预训练方法,通过将病毒学、网络安全等双用知识定向路由到大型语言模型内部的专用模块中,从而实现对特定能力模块的按需开关。 在包含四个双用类别的配置中,单个GRAM训练后的模型理论上可配置出2⁴=16种不同的能力组合,通过独立开关各模块实现。
该技术的提出恰逢现实政策层面的激烈博弈:2025年6月,特朗普政府曾以网络安全为由对Anthropic的Claude Fable 5和Mythos 5模型实施出口管制,18天后才在国家安全审查后解除限制。