TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型;每款模型至少有一種攻擊能削弱其安全行為,同時將 MMLU Pro 推理準確率降幅控制在未攻擊模型的 10% 以內。[2][5][6] 越獄式微調通常是最有效的攻擊類型,其中包括競爭目標、後門與風格調制等變體;部分攻擊主要使用看似良性的資料,僅混入少量有害成分。[2][6] 包括 ReFAT 與 Circuit Breaking 變體在內的 5 款防禦增強模型,在部分情境下提高了抗性,但沒有任何受測防禦能在整套攻擊中可靠阻止安全防護被移除。[2][5]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench 的核心結論相當直接:在研究測試的 21 款開放權重大型語言模型中,沒有任何一款能讓安全防護可靠地抵禦所有受測篡改威脅。這些模型的參數量約介乎 6 億至 80 億,既包括一般版本,也包括加入額外安全防禦的變體。研究人員至少找到一種攻擊方式,能讓每款模型更容易產生有害內容,同時保留大部分一般能力。256
這項結果之所以重要,是因為開放權重模型發布後可以被複製、微調及重新分發。模型在開發者原始評估環境中有效的安全層,並不代表當使用者能夠直接修改模型權重後,仍然是一項持久且可強制執行的控制措施。
TamperBench 衡量的不是一般以提示詞為主的「越獄」抗性,而是模型遭到實際篡改後,安全行為能否維持。其框架結合權重空間的微調攻擊與操縱潛在表示的攻擊,再同時評估模型的安全表現與保留能力。研究針對每個模型與攻擊組合進行系統性的超參數搜尋,而不是只採用單一攻擊設定。2
研究涵蓋 9 類篡改情境,包括:
測試重點並不只是「模型能否被弄得不安全」。研究人員尋找的是一種更具現實風險的結果:模型產生有害回應的程度上升,但在 MMLU-Pro 推理準確率方面,與未受攻擊模型相比的降幅仍控制在 10% 以內。2
整體而言,最嚴重的結果通常來自越獄式微調。研究報告提到的變體包括競爭目標、後門與風格調制。這些方法特別值得注意之處,在於它們可以主要使用良性訓練資料,只加入較少量的有害成分;相較於直接把模型重新訓練成不安全版本,這更像是針對安全行為進行精準改動,同時盡量保留模型的實用性。26
研究的廣泛結論是,安全性與能力可能以不利的方式被分離:篡改可以削弱模型的拒答行為,卻未必會同等程度破壞其推理表現。因此,一個模型即使在傳統基準測試中仍然看似有用,部署風險也可能已大幅上升。
TamperBench 測試了 21 款、參數量介乎 0.6B 至 8B 的開放權重模型,涵蓋 Llama、Qwen3 及 Mistral 等模型家族。現有研究證據支持一項跨模型的結論:每一款受測模型至少對其中一種攻擊存在脆弱性。56
不過,現有來源並沒有提供 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 在「MMLU-Pro 降幅不超過 10%」這項限制下,個別模型的精確有害性增幅。因此,不能從整體研究結果推算這兩款模型的具體百分比。較穩妥的說法是:相關攻擊能在保留大部分推理能力的同時,顯著增加有害行為;但現有證據不足以支持兩款指定模型的精確增幅數字。
研究亦指出,基礎模型與後訓練模型並沒有呈現單一、普遍適用的抗篡改模式。不同模型家族的相對抗性可能有所不同;Llama 3 與 Qwen3 變體甚至呈現相反趨勢。6
目前答案是否定的。研究測試的 5 款防禦增強模型,包括 ReFAT 與 Circuit Breaking 變體,同樣受到攻擊套件影響。這些防禦在部分設定下確實提高了抗性,但未能在所有受測威脅中可靠地阻止安全防護被移除。25
研究比較中,Triplet 被列為較具韌性、且較能保留模型能力的防禦方法之一。這是一項值得進一步研究的訊號,而不是已獲證實的萬全方案:研究的總體結果仍是,沒有任何受測防禦能在完整攻擊套件下消除篡改問題。6
這項發現並不代表開放權重模型本身沒有價值。開放發布可以支持研究、審計與問責。較精確的結論是:模型通過一般的對齊或發布前安全評估,不能被視為在權重可被自由修改後仍然安全的證明。5
封閉式商業模型或 API 模型同樣可能面對微調與後訓練安全問題,但供應商通常能控制訓練流程與部署環境。這種控制讓供應商有機會在微調階段或客製化之後加上防護;一旦權重已公開重新分發,這些措施就更難被強制執行。25
TamperBench 所揭示的風險,不只是某個人找到一條提示詞,讓模型偶爾失去拒答能力。如果篡改後仍能保留實用能力,修改過的模型理論上可能被重複部署,用於大規模假訊息、網絡釣魚或詐騙,以及危險技術協助等用途。研究人員提出的是「在保留能力的情況下移除安全防護」可能帶來的風險;TamperBench 本身並沒有實際量度這些濫用行為。5
對選擇模型的組織而言,實務上應把以下兩種測試區分開來:
研究人員呼籲進一步發展抗篡改方法,在發布前採用 TamperBench 等標準化對抗性評估,並以更多證據支撐 AI 評估與採購決策。他們特別指出醫療、詐騙偵測、教育及公共服務等高影響領域,因為模型發布後的行為,可能與最初的安全紀錄同樣重要。25
TamperBench 並沒有證明每款開放權重模型都必然會被濫用;它證明的是,在可被攻擊者修改模型的前提下,21 款受測模型的安全防護都不能被視為可靠保證。越獄式微調通常是最強的攻擊類型,額外防禦雖然在部分情境有所幫助,卻沒有完全堵住缺口;而現有資料也不支持對個別 Llama 或 Qwen3 模型提出精確的有害性增幅百分比。
對開放權重模型而言,安全評估不能只回答模型在發布時能做甚麼,也必須回答:模型經過修改後,還能保留多少原有的安全行為。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型;每款模型至少有一種攻擊能削弱其安全行為,同時將 MMLU Pro 推理準確率降幅控制在未攻擊模型的 10% 以內。[2][5][6]
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型;每款模型至少有一種攻擊能削弱其安全行為,同時將 MMLU Pro 推理準確率降幅控制在未攻擊模型的 10% 以內。[2][5][6] 越獄式微調通常是最有效的攻擊類型,其中包括競爭目標、後門與風格調制等變體;部分攻擊主要使用看似良性的資料,僅混入少量有害成分。[2][6]
包括 ReFAT 與 Circuit Breaking 變體在內的 5 款防禦增強模型,在部分情境下提高了抗性,但沒有任何受測防禦能在整套攻擊中可靠阻止安全防護被移除。[2][5]