TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5] 最严重的攻击通常是隐蔽式越狱微调,尤其是竞争目标、后门和风格调制变体:这些方法主要使用良性数据,只混入少量有害训练成分。[2] 包括ReFAT和Circuit Breaking在内的防御增强模型同样存在漏洞;现有方法在部分场景下能提高抵抗力,却无法可靠阻止安全机制被移除。[2][5]
发布者图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
在ACM KDD ’26上发表的TamperBench研究,系统测试了21款开放权重大语言模型,包括Llama、Qwen3和Mistral系列,参数规模覆盖约6亿至80亿。研究结论相当直接:在评估的篡改威胁下,没有一款模型的安全防护足够稳健。每款模型都可以通过某种方式被调整为更愿意生成有害内容,同时保留相当一部分原有推理能力。2
5
这意味着,模型在开发者手中通过常规对齐测试,并不代表其权重一旦公开、被复制或重新微调后,仍能维持同等安全水平。研究作者因此认为,对于允许用户修改权重的模型,当前安全护栏还不能被视为可靠保证。2
5
TamperBench覆盖了九类权重空间微调和潜在表示篡改方法,既包括看似正常的微调,也包括明显以有害行为为目标的训练、隐蔽的投毒式越狱微调、多语言微调,以及针对嵌入或潜在表示的攻击。2
其中,隐蔽式越狱微调通常最为严重,特别是以下几类变体:
这些攻击的共同特点是,它们并不一定需要大规模的有害数据。部分变体主要使用良性数据,只加入少量有害成分,却仍可能显著降低模型拒绝有害请求的倾向。2
研究团队会针对每个“模型—攻击”组合进行超参数搜索,选择能够最大化有害回答得分、同时将MMLU-Pro推理准确率下降控制在未攻击模型10%以内的攻击结果。2换句话说,攻击目标不是简单地把模型“弄坏”,而是在尽量保留实用能力的情况下拆除安全限制。
现有材料没有提供Llama-3-8B-Instruct或Qwen3-8B-Instruct各自对应的精确有害性增幅,因此无法可靠给出这两款模型的具体数值。
研究还测试了包括ReFAT和Circuit Breaking变体在内的五款防御增强模型。结果显示,这些防御方法在部分设置下确实能提升抗篡改能力,但在整套攻击评估中,没有一种方法能够稳定阻止安全机制被移除。2
5
这一发现的关键背景在于:开放权重一旦发布,开发者通常无法继续控制下游用户如何复制、微调和再分发模型。与仍由服务商掌控部署环境的API模型不同,开放权重模型的安全策略可能在离开原始发布者的控制范围后被重新改写。2
研究团队并不是在否定开放权重模型的价值。开放性有助于学术研究、独立审计和公共问责;但研究结果表明,模型“公开可用”不应仅因为通过了常规发布前对齐测试,就被自动视为安全。5
如果模型在不明显损失能力的情况下失去安全护栏,潜在滥用就可能从个人手工作业扩大为可规模化操作,例如批量制造虚假信息、进行更复杂的钓鱼和诈骗,或生成有害技术指导。5
作者同时提醒,闭源商业模型或API服务也可能面对相关的篡改风险。不过,能够控制微调流程和部署环境的服务商,仍可在微调阶段或部署后采取防御措施;当开放权重被自由分发后,这类控制手段就不再由原始开发者掌握。2
5
因此,研究团队建议进一步发展抗篡改技术,在模型发布前引入TamperBench一类的标准化对抗评估,并以更多基于证据的安全测试支持AI采购和部署决策。对于医疗、反欺诈、教育及其他公共服务领域的AI系统,这类评估尤其重要。2
5
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5]
TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5] 最严重的攻击通常是隐蔽式越狱微调,尤其是竞争目标、后门和风格调制变体:这些方法主要使用良性数据,只混入少量有害训练成分。[2]
包括ReFAT和Circuit Breaking在内的防御增强模型同样存在漏洞;现有方法在部分场景下能提高抵抗力,却无法可靠阻止安全机制被移除。[2][5]
TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5] 最严重的攻击通常是隐蔽式越狱微调,尤其是竞争目标、后门和风格调制变体:这些方法主要使用良性数据,只混入少量有害训练成分。[2] 包括ReFAT和Circuit Breaking在内的防御增强模型同样存在漏洞;现有方法在部分场景下能提高抵抗力,却无法可靠阻止安全机制被移除。[2][5]
发布者图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
在ACM KDD ’26上发表的TamperBench研究,系统测试了21款开放权重大语言模型,包括Llama、Qwen3和Mistral系列,参数规模覆盖约6亿至80亿。研究结论相当直接:在评估的篡改威胁下,没有一款模型的安全防护足够稳健。每款模型都可以通过某种方式被调整为更愿意生成有害内容,同时保留相当一部分原有推理能力。2
5
这意味着,模型在开发者手中通过常规对齐测试,并不代表其权重一旦公开、被复制或重新微调后,仍能维持同等安全水平。研究作者因此认为,对于允许用户修改权重的模型,当前安全护栏还不能被视为可靠保证。2
5
TamperBench覆盖了九类权重空间微调和潜在表示篡改方法,既包括看似正常的微调,也包括明显以有害行为为目标的训练、隐蔽的投毒式越狱微调、多语言微调,以及针对嵌入或潜在表示的攻击。2
其中,隐蔽式越狱微调通常最为严重,特别是以下几类变体:
这些攻击的共同特点是,它们并不一定需要大规模的有害数据。部分变体主要使用良性数据,只加入少量有害成分,却仍可能显著降低模型拒绝有害请求的倾向。2
研究团队会针对每个“模型—攻击”组合进行超参数搜索,选择能够最大化有害回答得分、同时将MMLU-Pro推理准确率下降控制在未攻击模型10%以内的攻击结果。2换句话说,攻击目标不是简单地把模型“弄坏”,而是在尽量保留实用能力的情况下拆除安全限制。
现有材料没有提供Llama-3-8B-Instruct或Qwen3-8B-Instruct各自对应的精确有害性增幅,因此无法可靠给出这两款模型的具体数值。
研究还测试了包括ReFAT和Circuit Breaking变体在内的五款防御增强模型。结果显示,这些防御方法在部分设置下确实能提升抗篡改能力,但在整套攻击评估中,没有一种方法能够稳定阻止安全机制被移除。2
5
这一发现的关键背景在于:开放权重一旦发布,开发者通常无法继续控制下游用户如何复制、微调和再分发模型。与仍由服务商掌控部署环境的API模型不同,开放权重模型的安全策略可能在离开原始发布者的控制范围后被重新改写。2
研究团队并不是在否定开放权重模型的价值。开放性有助于学术研究、独立审计和公共问责;但研究结果表明,模型“公开可用”不应仅因为通过了常规发布前对齐测试,就被自动视为安全。5
如果模型在不明显损失能力的情况下失去安全护栏,潜在滥用就可能从个人手工作业扩大为可规模化操作,例如批量制造虚假信息、进行更复杂的钓鱼和诈骗,或生成有害技术指导。5
作者同时提醒,闭源商业模型或API服务也可能面对相关的篡改风险。不过,能够控制微调流程和部署环境的服务商,仍可在微调阶段或部署后采取防御措施;当开放权重被自由分发后,这类控制手段就不再由原始开发者掌握。2
5
因此,研究团队建议进一步发展抗篡改技术,在模型发布前引入TamperBench一类的标准化对抗评估,并以更多基于证据的安全测试支持AI采购和部署决策。对于医疗、反欺诈、教育及其他公共服务领域的AI系统,这类评估尤其重要。2
5
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5]
TamperBench测试的21款开放权重模型,没有任何一款能在所有评估的篡改威胁下保持足够稳健的安全防护;每款模型都可能在保留大部分推理能力的同时,更容易生成有害内容。[2][5] 最严重的攻击通常是隐蔽式越狱微调,尤其是竞争目标、后门和风格调制变体:这些方法主要使用良性数据,只混入少量有害训练成分。[2]
包括ReFAT和Circuit Breaking在内的防御增强模型同样存在漏洞;现有方法在部分场景下能提高抵抗力,却无法可靠阻止安全机制被移除。[2][5]