TamperBench发现,测试的21款开放权重模型都至少容易受到九类篡改威胁中的一种攻击,而且通常不必牺牲超过10%的MMLU Pro推理性能。[2][5][6] 隐蔽式越狱微调通常是效果最强的攻击类别,其中包括竞争目标、后门和风格调制等方法。[2][6] 包括ReFAT和Circuit Breaking变体在内的五款防御增强模型,在部分场景下提高了抵抗力,但没有任何一种防御能够可靠阻止整套攻击中的安全机制移除。[2][5][6]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench给出的核心结论十分明确:在接受测试的21款开放权重大语言模型中,没有任何一款具备能够稳定抵御所测篡改威胁的安全防护。测试模型的参数规模约为6亿至80亿,既包括常规模型,也包括加入额外安全防御的变体。对每款模型而言,至少有一种攻击可以让它更倾向于生成有害内容,同时保留相当一部分通用能力。256
这项发现的关键不在于模型能否被某个特殊提示词“诱导”,而在于:开放权重模型发布后,用户可以复制权重、继续微调,甚至重新分发。开发者在发布前测试中有效的安全层,并不等于模型权重被他人修改后仍然是一道持久可靠的控制措施。
TamperBench关注的是抗篡改能力,而不是普通的基于提示词的越狱抵抗力。其框架结合了权重空间中的微调攻击与潜在表示空间攻击,并同时评估模型的安全行为和保留能力。研究人员还针对每一组“模型—攻击”组合进行了系统化超参数搜索,而不是只依赖某一种固定攻击配置。2
测试覆盖九类篡改方式,包括:
研究人员并非只观察模型是否会产生有害回答。他们寻找的是这样一类攻击:在让有害回答明显增加的同时,使模型在MMLU-Pro推理测试上的准确率下降不超过未受攻击状态的10%。2
总体而言,结果最严重的通常是越狱微调攻击。研究中报告的变体包括竞争目标、后门和风格调制等方法。这些攻击尤其值得关注,因为它们可以主要使用无害训练数据,只加入较小比例的有害成分。相比于粗暴地把模型重新训练成不安全模型,这种方式更像是在尽量保留模型实用性的前提下,定向改变其安全行为。26
论文更广泛的结论是,模型的安全性与能力可能被不利地“拆分”开来:篡改可以削弱拒答行为,却不必同等程度地摧毁推理能力。因此,一个模型即使在常规基准测试中仍然表现良好,部署风险也可能已经显著上升。
TamperBench评估了21款参数规模在6亿至80亿之间的开放权重模型,其中包括Llama、Qwen3和Mistral等系列。现有研究证据支持这样一个覆盖全体测试的结论:每款模型都至少容易受到一种所测攻击的影响。56
不过,现有资料并没有给出Llama-3-8B-Instruct或Qwen3-8B-Instruct在“ MMLU-Pro性能下降不超过10%”这一约束下,有害性具体增加了多少。因此,不能根据总体结果推算这两款模型的精确百分比。较为稳妥的结论是定性和比较性的:攻击能够在保留相当一部分推理能力的同时,明显增加有害行为,但现有证据不足以为上述任一具体模型提供准确的有害性增幅数字。
研究还显示,基础模型和经过后训练的模型并不存在统一的抗篡改规律。不同模型家族的相对抵抗力可能不同;在Llama 3和Qwen3变体之间,研究甚至观察到了相反的趋势。6
不能。测试的五款防御增强模型——包括ReFAT和Circuit Breaking变体——同样受到测试攻击的影响。这些防御在部分场景下提高了模型的抵抗力,但没有一种方法能够在整套威胁中可靠地阻止安全机制被移除。25
研究比较中,Triplet被列为较具韧性、且较能保留模型能力的防御之一。这是一个值得关注的研究信号,而不是绝对保证:该基准测试的首要结论仍然是,没有任何受测防御能够在完整攻击套件下彻底消除篡改问题。6
这项研究并不意味着开放权重模型没有价值。开放发布有助于研究、审计和问责。更准确的教训是:模型通过常规对齐或发布前安全评估,并不能证明它在权重可被自由修改后仍然安全。5
商业闭源模型或API模型也会面临微调和后训练安全问题,但其提供商通常能更大程度地控制训练流程与部署环境。这种控制使提供商有机会在微调阶段或模型定制后继续施加安全措施;而当权重已经公开流通后,这类措施就更难由原始开发者强制执行。25
TamperBench强调的风险,并不只是某个人找到一个提示词、让模型偶尔拒答失败。如果篡改能够保留模型的实用能力,那么修改后的模型理论上可能被反复部署,用于大规模虚假信息传播、钓鱼和诈骗,或提供危险的技术协助。研究人员将这些视为“在保留能力的同时移除安全防护”可能带来的影响,而不是声称基准测试本身已经实施了这些滥用活动。5
对于正在选择模型的组织,实际决策中应区分两类测试:
研究人员呼吁加强抗篡改方法研究,在模型发布前采用TamperBench等标准化对抗评估,并建立更基于证据的AI评估与采购流程。25他们特别指出,在医疗、欺诈检测、教育和公共服务等高影响场景中,模型发布后的行为可能与初始安全记录同样重要。
TamperBench并没有证明所有开放权重模型都会被滥用。它证明的是:在接受测试的21款模型中,只要攻击者能够篡改模型,现有安全防护就不能被视为可靠保证。隐蔽式越狱微调通常是最强的攻击类别;额外防御在部分情况下有所帮助,却没有彻底弥合这一缺口;而现有资料也不支持为单独的Llama或Qwen3模型给出精确有害性增幅百分比。
对于开放权重模型而言,安全评估不能只回答“模型发布时能做什么”,还必须回答“模型被修改后,原有安全行为还能保留多少”。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
TamperBench发现,测试的21款开放权重模型都至少容易受到九类篡改威胁中的一种攻击,而且通常不必牺牲超过10%的MMLU Pro推理性能。[2][5][6]
TamperBench发现,测试的21款开放权重模型都至少容易受到九类篡改威胁中的一种攻击,而且通常不必牺牲超过10%的MMLU Pro推理性能。[2][5][6] 隐蔽式越狱微调通常是效果最强的攻击类别,其中包括竞争目标、后门和风格调制等方法。[2][6]
包括ReFAT和Circuit Breaking变体在内的五款防御增强模型,在部分场景下提高了抵抗力,但没有任何一种防御能够可靠阻止整套攻击中的安全机制移除。[2][5][6]