TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。 所有模型都可以被調整至更容易產生有害內容,同時保留相當大部分原有推理能力。[2][5] 最嚴重的通常是隱蔽式越獄微調,包括 competing objectives、backdoor 及 style modulation 變體。[2]
發布者圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench 是一套用來系統測試大型語言模型「抗篡改能力」的基準框架。研究團隊測試了 21 款開放權重模型,涵蓋 Llama、Qwen3、Mistral 等系列,參數規模由 6 億至 80 億不等;當中亦包括加入防禦機制的模型版本。2
5
研究結論相當直接:在這次評估的威脅下,沒有一款模型的安全防護足夠穩健。每款模型都可以透過篡改,變得明顯更願意輸出有害內容,同時保留大部分推理及其他實用能力。換句話說,模型在正常上線前通過安全對齊測試,並不代表當權重可以被修改後,安全性仍然有保證。2
5
TamperBench 評估九種權重空間及潛在表示(latent representation)篡改方法,範圍包括:
整體而言,越獄微調通常是破壞力最強的一類。其中,competing-objectives、backdoor 及 style-modulation 變體尤其突出。這些方法主要使用良性資料,僅加入少量有害成分,因此較像是把安全弱點藏在一般微調流程中,而不是明目張膽地重新訓練模型。2
研究團隊並非只挑選令模型完全失去能力的攻擊。他們為每個「模型—攻擊」組合搜尋參數,目標是在提高有害回應分數的同時,將 MMLU-Pro 推理準確率的跌幅限制在未受攻擊模型的 10% 以內。2
因此,研究所展示的風險並不是「模型被破壞後只會胡言亂語」,而是安全護欄被削弱後,模型仍可能維持相當的推理及實用能力。至於 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 各自增加了多少有害性,現有資料沒有提供可靠的逐模型數值,不能據此作出精確比較。
研究亦測試了五款加入防禦機制的模型,包括 ReFAT 及 Circuit Breaking 變體。這些方法在部分情境下確實可以提升抗篡改能力,但在整套攻擊組合中,仍未能可靠防止安全機制被移除。2
5
這個結果對開放權重模型特別重要:權重一旦公開,其他人可以複製、微調及重新分發,原開發者便難以像管理 API 服務那樣,持續控制下游部署方式或強制執行安全規則。2
研究團隊並非認為開放權重模型沒有價值。開放模型有助推動研究、審計及問責;但研究提醒,模型不能只因為在發布前通過一般安全測試,就被視為在公開後仍然安全。5
封閉式商業模型或 API 服務亦可能面對類似的篡改風險。不過,當服務供應商掌握微調流程及部署環境時,仍可以在微調階段或部署後加入防禦措施;一旦開放權重被自由轉發,這些控制手段便不再完全掌握在原開發者手上。2
5
如果安全護欄可以在不大幅削弱能力的情況下被移除,濫用就可能由個別人士手動操作,擴大至更具規模的用途,例如大量製造虛假資訊、進行高階網絡釣魚及詐騙,或生成有害的技術指引。5
研究團隊因此呼籲加強抗篡改研究,在模型發布前採用 TamperBench 等標準化對抗性評估,並以更多實證測試支援 AI 評估及採購決策。當政府把 AI 應用於醫療、詐騙偵測、教育及其他公共服務時,這類測試尤其重要。2
5
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。
TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。 所有模型都可以被調整至更容易產生有害內容,同時保留相當大部分原有推理能力。[2][5]
最嚴重的通常是隱蔽式越獄微調,包括 competing objectives、backdoor 及 style modulation 變體。[2]
TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。 所有模型都可以被調整至更容易產生有害內容,同時保留相當大部分原有推理能力。[2][5] 最嚴重的通常是隱蔽式越獄微調,包括 competing objectives、backdoor 及 style modulation 變體。[2]
發布者圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench 是一套用來系統測試大型語言模型「抗篡改能力」的基準框架。研究團隊測試了 21 款開放權重模型,涵蓋 Llama、Qwen3、Mistral 等系列,參數規模由 6 億至 80 億不等;當中亦包括加入防禦機制的模型版本。2
5
研究結論相當直接:在這次評估的威脅下,沒有一款模型的安全防護足夠穩健。每款模型都可以透過篡改,變得明顯更願意輸出有害內容,同時保留大部分推理及其他實用能力。換句話說,模型在正常上線前通過安全對齊測試,並不代表當權重可以被修改後,安全性仍然有保證。2
5
TamperBench 評估九種權重空間及潛在表示(latent representation)篡改方法,範圍包括:
整體而言,越獄微調通常是破壞力最強的一類。其中,competing-objectives、backdoor 及 style-modulation 變體尤其突出。這些方法主要使用良性資料,僅加入少量有害成分,因此較像是把安全弱點藏在一般微調流程中,而不是明目張膽地重新訓練模型。2
研究團隊並非只挑選令模型完全失去能力的攻擊。他們為每個「模型—攻擊」組合搜尋參數,目標是在提高有害回應分數的同時,將 MMLU-Pro 推理準確率的跌幅限制在未受攻擊模型的 10% 以內。2
因此,研究所展示的風險並不是「模型被破壞後只會胡言亂語」,而是安全護欄被削弱後,模型仍可能維持相當的推理及實用能力。至於 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 各自增加了多少有害性,現有資料沒有提供可靠的逐模型數值,不能據此作出精確比較。
研究亦測試了五款加入防禦機制的模型,包括 ReFAT 及 Circuit Breaking 變體。這些方法在部分情境下確實可以提升抗篡改能力,但在整套攻擊組合中,仍未能可靠防止安全機制被移除。2
5
這個結果對開放權重模型特別重要:權重一旦公開,其他人可以複製、微調及重新分發,原開發者便難以像管理 API 服務那樣,持續控制下游部署方式或強制執行安全規則。2
研究團隊並非認為開放權重模型沒有價值。開放模型有助推動研究、審計及問責;但研究提醒,模型不能只因為在發布前通過一般安全測試,就被視為在公開後仍然安全。5
封閉式商業模型或 API 服務亦可能面對類似的篡改風險。不過,當服務供應商掌握微調流程及部署環境時,仍可以在微調階段或部署後加入防禦措施;一旦開放權重被自由轉發,這些控制手段便不再完全掌握在原開發者手上。2
5
如果安全護欄可以在不大幅削弱能力的情況下被移除,濫用就可能由個別人士手動操作,擴大至更具規模的用途,例如大量製造虛假資訊、進行高階網絡釣魚及詐騙,或生成有害的技術指引。5
研究團隊因此呼籲加強抗篡改研究,在模型發布前採用 TamperBench 等標準化對抗性評估,並以更多實證測試支援 AI 評估及採購決策。當政府把 AI 應用於醫療、詐騙偵測、教育及其他公共服務時,這類測試尤其重要。2
5
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。
TamperBench 測試的 21 款開放權重模型,沒有一款能穩健抵禦研究評估的篡改威脅。 所有模型都可以被調整至更容易產生有害內容,同時保留相當大部分原有推理能力。[2][5]
最嚴重的通常是隱蔽式越獄微調,包括 competing objectives、backdoor 及 style modulation 變體。[2]