TamperBenchは、パラメーター数6億〜80億のオープンウェイトLLM 21種類すべてで、9種類の改変攻撃のうち少なくとも1種類に対する脆弱性を確認した。MMLU Proの推論性能低下を10%以内に抑えたまま、有害な応答を増やせるケースもあった。[2][5][6] 特に深刻だったのは、競合目的型、バックドア型、スタイル変調型などのステルス性を意識した「jailbreak tuning」攻撃だった。[2][6] ReFATやCircuit Breakingを含む防御強化モデルは一部の条件で耐性を高めたものの、検証した攻撃全体に対して安全対策の解除を確実に防ぐことはできなかった。[2][5]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
AIモデルの安全性は、公開時点の評価だけで判断できるのか。新たなベンチマーク「TamperBench」の答えは、少なくともオープンウェイトモデルについては慎重であるべきだ、というものだ。
研究チームが検証した21種類のオープンウェイト大規模言語モデル(LLM)は、いずれもテストした改変攻撃の少なくとも1種類に対して脆弱だった。モデルの規模はパラメーター数約6億〜80億で、通常のモデルに加え、安全対策を強化した派生モデルも含まれている。攻撃後も汎用的な能力を大きく失わずに、有害な内容を出力しやすくなるケースが確認された。256
これは、公開された重み(weights)を誰でもコピー、ファインチューニング、再配布できるオープンウェイトモデルにとって重要な論点だ。開発元の評価環境で機能した安全対策が、モデルの重みを利用者側で変更した後も持続するとは限らない。
TamperBenchは、通常のプロンプトによる「脱獄(jailbreak)」への耐性ではなく、モデルそのものを改変された場合の**耐タンパー性(tamper resistance)**を測るために設計された。重み空間でのファインチューニング攻撃と、モデル内部の潜在表現を操作する攻撃を組み合わせ、安全性と有用性の両方を評価している。さらに、モデルと攻撃の組み合わせごとにハイパーパラメーターを体系的に探索し、単一の攻撃設定だけに依存しない検証を行った。2
対象となったのは、次のような9種類の改変手法だ。
評価のポイントは、単にモデルを危険な状態にできるかどうかではない。攻撃によって有害な応答を増やしながら、推論ベンチマーク「MMLU-Pro」の正解率低下を、攻撃前のモデルから10%以内に抑えられるかを調べた。2
全体として最も深刻な結果を示したのは、**jailbreak-tuning(脱獄チューニング)**だった。研究では、競合目的型、バックドア型、スタイル変調型などの手法が扱われている。これらは、無害な訓練データを大部分に使いながら、少量の有害な要素を組み込める点が特徴だ。モデル全体を露骨に危険な用途へ再訓練するというより、安全な応答や拒否の振る舞いを狙って変える手法といえる。26
研究の大きな示唆は、安全性と能力が同じ割合で失われるとは限らないことだ。拒否応答だけを弱め、推論性能をある程度維持できるなら、一般的なベンチマークでは依然として有能に見える一方、実運用上のリスクは大きく上昇しうる。
TamperBenchは、Llama、Qwen3、Mistralなどのモデルファミリーを含む、0.6B〜8B規模のオープンウェイトモデル21種類を評価した。提供された研究資料から確実に言えるのは、検証対象となったすべてのモデルが、少なくとも1種類の攻撃に対して脆弱だったというベンチマーク全体の結果である。56
一方、提供資料には、MMLU-Proの性能低下を10%以内に抑えた条件で、Llama-3-8B-InstructやQwen3-8B-Instructの有害性が何%上昇したかというモデル別の数値は示されていない。そのため、全体結果から個別モデルの具体的な上昇率を推測することはできない。妥当な結論は、攻撃によって推論能力の多くを維持しながら有害な振る舞いを大幅に増やせる場合があった、という比較・定性的なものにとどまる。
また、ベースモデルと追加学習後のモデルで、耐タンパー性が一律に同じ傾向を示すわけでもなかった。モデルファミリーによって相対的な耐性は異なり、Llama 3系とQwen3系では反対方向の傾向も報告されている。6
結論から言えば、解決には至らなかった。ReFATやCircuit Breakingの派生モデルを含む5種類の防御強化モデルも、攻撃スイートに対して脆弱性を示した。防御手法によって一部の条件で耐性が向上することはあったが、検証したすべての脅威に対して安全対策の解除を確実に防ぐことはできなかった。25
比較対象の中では、Tripletが比較的高い堅牢性と能力維持を示す防御策の一つとされた。もっとも、これは有望な研究上の結果であって、完全な安全性の保証ではない。今回の中心的な結論は、テストした防御策のいずれも、攻撃全体を通じて改変問題を解消できなかったという点にある。6
今回の結果は、オープンウェイトモデルに価値がないという意味ではない。モデルの公開は、研究、監査、説明責任を支える重要な手段になりうる。より限定された教訓は、公開前のアラインメント評価に合格しただけでは、重みが自由に変更された後も安全だとは判断できない、ということだ。5
商用のクローズドモデルやAPI提供モデルにも、ファインチューニングや追加学習後の安全性という課題はある。ただし、提供企業が学習パイプラインやデプロイ環境を管理できる場合、カスタマイズ時やその後の段階で安全策を適用しやすい。重みが公開され、利用者の手元で自由に再配布される状況では、同じ統制を維持するのが難しくなる。25
TamperBenchが示すリスクは、誰かが一度のプロンプトで拒否を回避できるか、という問題だけではない。改変後も有用な能力が残るなら、変更されたモデルを繰り返し運用し、大規模な偽情報の作成、フィッシングや詐欺、危険な技術支援などに利用できる可能性がある。研究チームが示したのは、能力を維持したまま安全策を外せる場合の含意であり、TamperBench自体がこうした悪用を実行・測定したわけではない。5
モデルを選定する組織にとっては、少なくとも次の2種類の評価を分けて考える必要がある。
研究チームは、より強固な耐タンパー性手法の開発、公開前にTamperBenchのような標準化された敵対的評価を行うこと、そして根拠に基づくAI評価・調達の強化を求めている。医療、詐欺検知、教育、公共サービスなど影響の大きい分野では、導入時の安全記録だけでなく、公開・配布後の振る舞いも調達判断に含める必要があるという。25
TamperBenchは、すべてのオープンウェイトモデルが必ず悪用されると示したわけではない。示したのは、今回テストした21種類すべてで、攻撃者がモデルを改変できる状況では、安全対策が確実な保証にならなかったということだ。
特に深刻だったのは、能力を大きく損なわずに拒否の振る舞いを弱める脱獄チューニングだった。追加の防御策は一部で効果を示したものの、問題を完全には封じ込められなかった。また、LlamaやQwen3の個別モデルについて、正確な有害性上昇率を示す資料は提供されていない。
オープンウェイトモデルの安全性を評価するなら、公開時に何ができるかだけでなく、改変された後も安全な振る舞いがどの程度残るのかまで検証する必要がある。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
TamperBenchは、パラメーター数6億〜80億のオープンウェイトLLM 21種類すべてで、9種類の改変攻撃のうち少なくとも1種類に対する脆弱性を確認した。MMLU Proの推論性能低下を10%以内に抑えたまま、有害な応答を増やせるケースもあった。[2][5][6]
TamperBenchは、パラメーター数6億〜80億のオープンウェイトLLM 21種類すべてで、9種類の改変攻撃のうち少なくとも1種類に対する脆弱性を確認した。MMLU Proの推論性能低下を10%以内に抑えたまま、有害な応答を増やせるケースもあった。[2][5][6] 特に深刻だったのは、競合目的型、バックドア型、スタイル変調型などのステルス性を意識した「jailbreak tuning」攻撃だった。[2][6]
ReFATやCircuit Breakingを含む防御強化モデルは一部の条件で耐性を高めたものの、検証した攻撃全体に対して安全対策の解除を確実に防ぐことはできなかった。[2][5]