TamperBenchは、検証した21種類のオープンウェイトモデルのすべてで、安全対策を弱めて有害な出力を引き出せる可能性を確認した。[2][5] 対象にはLlama、Qwen3、Mistralなど、6億〜80億パラメータ規模のモデルが含まれた。[2][8] 特に、良性データを中心に使いながら少量の有害要素を混ぜる、隠れた仕組みのジェイルブレーク調整が深刻だった。[2]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
ACM KDD ’26で発表された研究「TamperBench」は、オープンウェイトの大規模言語モデル(LLM)が、重みを公開・変更できる状態でどの程度安全対策を維持できるかを検証したものだ。結論は厳しい。検証した21モデルのいずれも、評価対象となった改変攻撃をすべて阻止できなかった。各モデルでは、推論能力を大きく失わせることなく、有害な回答を出しやすくできる余地が確認された。25
対象は、Llama、Qwen3、Mistralなどを含む、パラメータ数6億〜80億規模のオープンウェイトLLMだ。研究チームは、モデルの重みを追加学習する手法と、内部表現を操作する手法を組み合わせ、9種類の改変脅威を評価した。28
攻撃には、表面上は良性に見えるファインチューニング、明示的に有害なデータを使う調整、少量の有害要素を埋め込むバックドア型・毒入れ型の調整、多言語を利用した調整、埋め込みや潜在表現を狙う攻撃などが含まれる。2
評価では、単に有害性を最大化するだけでなく、攻撃後の実用性も重視された。具体的には、攻撃前のモデルと比べてMMLU-Proの推論精度の低下を10%以内に抑えながら、有害な応答の増加を大きくできる攻撃が選ばれた。2 つまり、モデルを露骨に壊すのではなく、通常の能力をかなり残したまま安全機能を弱められるかが試されたことになる。
9種類の中で、特に深刻だったのは、隠れたジェイルブレーク調整に分類される攻撃だった。なかでも、競合する目的を学習させる手法、バックドア型、文体変調型の攻撃が強い傾向を示した。これらは良性データを大部分に使い、少量の有害な学習要素を組み込むことで、通常の性能や振る舞いを大きく変えずに安全対策を弱めることを狙う。2
研究結果からは、通常の安全性評価を通過したモデルであっても、重みが公開されていれば、第三者が追加学習によって安全対策を取り除ける可能性を否定できないことが分かる。なお、提供された資料には、Llama-3-8B-InstructやQwen3-8B-Instructについて、攻撃前後で有害性が何ポイント上昇したかというモデル別の正確な数値は含まれていない。そのため、個別モデルの具体的な増加幅を断定することはできない。
研究では、ReFATやCircuit Breakingなどの防御手法を組み込んだ5種類のモデルも検証された。こうした対策は一部の条件では耐性を高めたものの、9種類の攻撃全体に対して安全機能の除去を確実に防ぐことはできなかった。25
この点が、オープンウェイトモデル特有の難しさを浮き彫りにする。API経由で提供されるモデルなら、開発者がファインチューニングや利用環境を管理しやすい。一方、重みが公開されると、第三者がコピーし、再調整し、別の場所で再配布できる。元の開発者は、その後の利用方法や安全設定を直接制御できない。2
研究チームは、今回の結果をオープンウェイトモデルそのものの否定とは位置づけていない。重みの公開は、研究、検証、透明性、説明責任を支える重要な利点を持つ。ただし、公開前の通常のアラインメント評価に合格したからといって、改変後も安全だとみなすべきではないと警告している。5
また、閉鎖型の商用モデルやAPIモデルにも、関連する改変リスクが存在する可能性はある。しかし、提供事業者がファインチューニングやデプロイ環境を管理できる場合は、公開後に第三者が自由に重みを変更できるモデルよりも、学習段階や提供段階で対策を適用しやすい。25
安全機能を維持したままモデルの能力を保てる攻撃は、悪用の規模を拡大させるおそれがある。研究者は、例として大量の偽情報生成、高度なフィッシングや詐欺、有害な技術情報の生成などを挙げている。5
研究者らは、公開前にTamperBenchのような標準化された敵対的評価を実施すること、改変耐性を高める研究を進めること、そしてAIの調達や導入判断をより実証的な評価に基づいて行うことを求めている。25
とりわけ、医療、詐欺検知、教育などの公共サービスでAIの導入が進むほど、「開発時に安全だったか」だけでなく、「第三者に改変された後も安全性と性能を維持できるか」が重要な判断材料になる。TamperBenchの示唆は、オープンウェイトモデルの安全性を、公開時点の性能やガードレールだけで評価することの限界にある。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
TamperBenchは、検証した21種類のオープンウェイトモデルのすべてで、安全対策を弱めて有害な出力を引き出せる可能性を確認した。[2][5]
TamperBenchは、検証した21種類のオープンウェイトモデルのすべてで、安全対策を弱めて有害な出力を引き出せる可能性を確認した。[2][5] 対象にはLlama、Qwen3、Mistralなど、6億〜80億パラメータ規模のモデルが含まれた。[2][8]
特に、良性データを中心に使いながら少量の有害要素を混ぜる、隠れた仕組みのジェイルブレーク調整が深刻だった。[2]