TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。 隱蔽式 jailbreak tuning,尤其是 competing objectives、backdoor 及 style modulation 變體,通常是最有效的攻擊類別。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench 的核心結論相當直接:研究測試的 21 款開放權重語言模型,沒有一款能夠可靠抵禦所有受測篡改威脅。這批模型的參數量約由 6 億至 80 億不等,當中包括一般版本及加入防禦機制的變體。每款模型至少都有一種攻擊,可以令它更容易產生有害內容,同時保留大部分原有的整體能力。2
5
6
這個結果之所以重要,在於開放權重模型一旦發布,其他人可以複製、微調,甚至再分發。開發者在首次評估時有效的安全層,並不代表模型權重交到用戶手上、可以自由修改後,仍然是一項持久可靠的控制措施。
TamperBench 測量的不是一般以提示詞為主的 jailbreak 抵抗力,而是模型面對「篡改」時能否維持安全行為。框架結合了權重空間微調攻擊,以及操控模型潛在表徵的攻擊,再同時評估安全表現和保留下來的能力。研究團隊亦為每個模型與攻擊組合進行系統化超參數搜尋,而不是只採用單一攻擊設定。2
研究涵蓋 9 類篡改方案,包括:
測試重點不只是「能否令模型變得不安全」。研究人員尋找的是一類更具實際意義的攻擊:在增加模型輸出有害回應的同時,令 MMLU-Pro 推理準確度相對未受攻擊模型的跌幅維持在 10% 以內。2
換句話說,攻擊者不一定要將模型整個「整壞」。只要能削弱拒答行為,而又不大幅破壞模型的推理和實用能力,風險便可能已經顯著上升。
整體而言,最嚴重的結果通常來自 jailbreak tuning 攻擊。研究報告提到的變體包括 competing objectives、backdoor 及 style modulation。這些方法特別值得關注,因為它們可以主要使用良性訓練資料,再加入較少量的有害成分;相比直接把模型重新訓練成不安全模型,更像是針對性改變安全行為,同時盡量保留模型的實用性。2
6
研究的更廣泛結論是,模型的安全性和能力可以被不利地「拆開」:篡改可能削弱拒答能力,卻未有按比例摧毀推理表現。因此,一個模型即使在傳統基準測試中仍然表現良好,部署時卻可能已經變得明顯更加危險。
TamperBench 測試了 21 款參數量介乎 0.6B 至 8B 的開放權重模型,涵蓋 Llama、Qwen3 和 Mistral 等模型系列。現有研究證據支持一項全局性結論:每款受測模型至少對一種評估攻擊存在弱點。5
6
不過,現有資料沒有提供 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 在「MMLU-Pro 跌幅不超過 10%」這項限制下,個別模型的確實有害性增幅。因此,不能從「21 款模型全部有弱點」這個總體結果推算兩款模型的具體百分比。
較穩妥的說法是:相關攻擊可以在保留相當部分推理能力的情況下,大幅增加模型的有害行為;但現有證據不足以確認 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 各自的精確增幅。研究亦指出,基礎版本和經後訓練版本的篡改抵抗力並沒有統一模式;不同模型系列的趨勢可以不一樣,Llama 3 和 Qwen3 變體更出現相反方向的結果。6
沒有。研究測試的 5 款加強防禦模型,包括 ReFAT 和 Circuit Breaking 變體,同樣對測試套件中的攻擊存在弱點。這些防禦方法在部分情境下確實提高了抵抗力,但未能在所有受測威脅中可靠阻止安全防護被移除。2
5
研究比較中,Triplet 被列為較穩健、亦較能保留模型能力的防禦方案之一。這是一個值得跟進的研究訊號,卻不是「已經解決問題」的保證:研究的 headline 結果仍然是,沒有任何受測防禦可以在整套攻擊中完全消除篡改風險。6
研究結果並不代表開放權重模型沒有價值。開放發布可以支援研究、審計和問責。較準確的結論是:模型通過一般的 alignment 或發布前安全評估,不應被視為它在權重可以被自由修改後,仍然安全的證明。5
商業閉源模型或 API 服務同樣要面對微調及後訓練安全問題,但服務供應商通常仍然掌握訓練流程和部署環境。這種控制力讓供應商可以在微調階段或模型客製化後套用防護;當開放權重已經被公開分發,這些措施便較難強制執行。2
5
TamperBench 所突出的風險,不只是有人找到一條提示詞,令模型偶爾失去拒答能力。如果篡改可以保留模型的實用能力,一個被修改的模型便可能被重複部署,用於大規模假資訊、釣魚或詐騙,以及危險技術支援等有害工作。研究人員提出的是能力保留式安全防護移除可能帶來的影響,而不是聲稱 TamperBench 本身已經量度這些濫用行為。5
對選擇模型的機構而言,實際上應該將兩類測試分開看:
研究人員呼籲加強篡改抵抗技術研究,在模型發布前加入 TamperBench 等標準化對抗性評估,並以更多證據支持 AI 評估和採購決策。2
5 他們特別提到醫療、詐騙偵測、教育和公共服務等高影響範疇:在這些場景,模型發布後的行為,可能與它最初的安全紀錄同樣重要。
TamperBench 並沒有證明所有開放權重模型都必然會被濫用;它證明的是,在受測的 21 款模型中,只要攻擊者可以修改模型,現有安全防護便不是可靠的絕對保證。隱蔽式 jailbreak tuning 通常是最強的一類攻擊;額外防禦在部分情況有幫助,卻未能全面堵塞漏洞;而現有資料亦不支持為個別 Llama 或 Qwen3 模型提供精確的有害性增幅百分比。
對開放權重模型而言,安全評估不能只問模型在發布當日可以做甚麼,也要問:當模型被修改之後,它原本的安全行為還剩下多少。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。 隱蔽式 jailbreak tuning,尤其是 competing objectives、backdoor 及 style modulation 變體,通常是最有效的攻擊類別。
包括 ReFAT 和 Circuit Breaking 在內的 5 款加強防禦模型,在部分情境提高了抵抗力,但未能在整套測試中可靠阻止安全防護被移除。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。 隱蔽式 jailbreak tuning,尤其是 competing objectives、backdoor 及 style modulation 變體,通常是最有效的攻擊類別。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench 的核心結論相當直接:研究測試的 21 款開放權重語言模型,沒有一款能夠可靠抵禦所有受測篡改威脅。這批模型的參數量約由 6 億至 80 億不等,當中包括一般版本及加入防禦機制的變體。每款模型至少都有一種攻擊,可以令它更容易產生有害內容,同時保留大部分原有的整體能力。2
5
6
這個結果之所以重要,在於開放權重模型一旦發布,其他人可以複製、微調,甚至再分發。開發者在首次評估時有效的安全層,並不代表模型權重交到用戶手上、可以自由修改後,仍然是一項持久可靠的控制措施。
TamperBench 測量的不是一般以提示詞為主的 jailbreak 抵抗力,而是模型面對「篡改」時能否維持安全行為。框架結合了權重空間微調攻擊,以及操控模型潛在表徵的攻擊,再同時評估安全表現和保留下來的能力。研究團隊亦為每個模型與攻擊組合進行系統化超參數搜尋,而不是只採用單一攻擊設定。2
研究涵蓋 9 類篡改方案,包括:
測試重點不只是「能否令模型變得不安全」。研究人員尋找的是一類更具實際意義的攻擊:在增加模型輸出有害回應的同時,令 MMLU-Pro 推理準確度相對未受攻擊模型的跌幅維持在 10% 以內。2
換句話說,攻擊者不一定要將模型整個「整壞」。只要能削弱拒答行為,而又不大幅破壞模型的推理和實用能力,風險便可能已經顯著上升。
整體而言,最嚴重的結果通常來自 jailbreak tuning 攻擊。研究報告提到的變體包括 competing objectives、backdoor 及 style modulation。這些方法特別值得關注,因為它們可以主要使用良性訓練資料,再加入較少量的有害成分;相比直接把模型重新訓練成不安全模型,更像是針對性改變安全行為,同時盡量保留模型的實用性。2
6
研究的更廣泛結論是,模型的安全性和能力可以被不利地「拆開」:篡改可能削弱拒答能力,卻未有按比例摧毀推理表現。因此,一個模型即使在傳統基準測試中仍然表現良好,部署時卻可能已經變得明顯更加危險。
TamperBench 測試了 21 款參數量介乎 0.6B 至 8B 的開放權重模型,涵蓋 Llama、Qwen3 和 Mistral 等模型系列。現有研究證據支持一項全局性結論:每款受測模型至少對一種評估攻擊存在弱點。5
6
不過,現有資料沒有提供 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 在「MMLU-Pro 跌幅不超過 10%」這項限制下,個別模型的確實有害性增幅。因此,不能從「21 款模型全部有弱點」這個總體結果推算兩款模型的具體百分比。
較穩妥的說法是:相關攻擊可以在保留相當部分推理能力的情況下,大幅增加模型的有害行為;但現有證據不足以確認 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 各自的精確增幅。研究亦指出,基礎版本和經後訓練版本的篡改抵抗力並沒有統一模式;不同模型系列的趨勢可以不一樣,Llama 3 和 Qwen3 變體更出現相反方向的結果。6
沒有。研究測試的 5 款加強防禦模型,包括 ReFAT 和 Circuit Breaking 變體,同樣對測試套件中的攻擊存在弱點。這些防禦方法在部分情境下確實提高了抵抗力,但未能在所有受測威脅中可靠阻止安全防護被移除。2
5
研究比較中,Triplet 被列為較穩健、亦較能保留模型能力的防禦方案之一。這是一個值得跟進的研究訊號,卻不是「已經解決問題」的保證:研究的 headline 結果仍然是,沒有任何受測防禦可以在整套攻擊中完全消除篡改風險。6
研究結果並不代表開放權重模型沒有價值。開放發布可以支援研究、審計和問責。較準確的結論是:模型通過一般的 alignment 或發布前安全評估,不應被視為它在權重可以被自由修改後,仍然安全的證明。5
商業閉源模型或 API 服務同樣要面對微調及後訓練安全問題,但服務供應商通常仍然掌握訓練流程和部署環境。這種控制力讓供應商可以在微調階段或模型客製化後套用防護;當開放權重已經被公開分發,這些措施便較難強制執行。2
5
TamperBench 所突出的風險,不只是有人找到一條提示詞,令模型偶爾失去拒答能力。如果篡改可以保留模型的實用能力,一個被修改的模型便可能被重複部署,用於大規模假資訊、釣魚或詐騙,以及危險技術支援等有害工作。研究人員提出的是能力保留式安全防護移除可能帶來的影響,而不是聲稱 TamperBench 本身已經量度這些濫用行為。5
對選擇模型的機構而言,實際上應該將兩類測試分開看:
研究人員呼籲加強篡改抵抗技術研究,在模型發布前加入 TamperBench 等標準化對抗性評估,並以更多證據支持 AI 評估和採購決策。2
5 他們特別提到醫療、詐騙偵測、教育和公共服務等高影響範疇:在這些場景,模型發布後的行為,可能與它最初的安全紀錄同樣重要。
TamperBench 並沒有證明所有開放權重模型都必然會被濫用;它證明的是,在受測的 21 款模型中,只要攻擊者可以修改模型,現有安全防護便不是可靠的絕對保證。隱蔽式 jailbreak tuning 通常是最強的一類攻擊;額外防禦在部分情況有幫助,卻未能全面堵塞漏洞;而現有資料亦不支持為個別 Llama 或 Qwen3 模型提供精確的有害性增幅百分比。
對開放權重模型而言,安全評估不能只問模型在發布當日可以做甚麼,也要問:當模型被修改之後,它原本的安全行為還剩下多少。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。
TamperBench 在 9 類篡改威脅下測試 21 款開放權重模型,發現每款模型至少有一種攻擊可以削弱其安全行為,而且 MMLU Pro 推理表現跌幅可控制在 10% 以內。 隱蔽式 jailbreak tuning,尤其是 competing objectives、backdoor 及 style modulation 變體,通常是最有效的攻擊類別。
包括 ReFAT 和 Circuit Breaking 在內的 5 款加強防禦模型,在部分情境提高了抵抗力,但未能在整套測試中可靠阻止安全防護被移除。