TamperBench 測試的 21 款開放權重模型,沒有一款能抵禦研究評估的所有竄改威脅;每款模型都能被調整至更容易產生有害輸出。 攻擊可在 MMLU Pro 推理準確率下降不超過 10% 的條件下,盡量提高模型的有害回應分數,顯示安全防護被移除時未必會同時失去實用能力。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench 是一套用來系統性測試大型語言模型「抗竄改能力」的基準框架。研究團隊在 ACM KDD ’26 發表的研究中,評估了 21 款開放權重大型語言模型,涵蓋 Llama、Qwen3 與 Mistral 等系列,參數量介乎 6 億至 80 億。結果顯示,沒有任何一款模型能在研究所測試的竄改威脅下,穩定保留原有安全防護:每款模型都能被調整至更容易產生有害內容,同時維持相當大部分的推理能力。25
研究作者因此認為,對於權重可被修改、複製及重新發布的模型,目前的安全護欄不能被視為可靠保證。25
測試涵蓋九種以權重空間微調及潛在表徵竄改為主的方法,包括看似良性的微調、直接的有害微調、帶有資料投毒特徵的隱蔽式越獄微調、多語言微調,以及針對嵌入或潛在表徵的攻擊。2
其中,隱蔽式越獄微調通常造成最嚴重的結果,尤其是以下幾類變體:
這些方法大多使用良性資料,只加入少量有害成分,因而不一定會明顯破壞模型的一般能力。2
研究的攻擊選擇方式也特別關注「安全性下降、能力仍在」的情境:研究團隊尋找能最大幅度提高有害回應分數、同時讓 MMLU-Pro 推理準確率相較未受攻擊模型下降不超過 10% 的設定。2換言之,攻擊的危險之處不只是讓模型變得「失控」,而是可能令它在仍能完成複雜任務的情況下,較願意提供有害內容。
研究提供的資料並未列出 Llama-3-8B-Instruct 或 Qwen3-8B-Instruct 在每種攻擊下的確切有害性增幅,因此目前無法可靠地為這兩款模型提供具體百分比。
研究亦測試了五款加入防禦機制的模型變體,包括 ReFAT 與 Circuit Breaking 變體。整體而言,這些方法在部分設定下確實能提高抗竄改能力,但未能在整套攻擊中穩定阻止安全機制被削弱或移除。25
這項結果對開放權重模型尤其重要。模型權重一旦公開,第三方可以在沒有原始開發者控制的情況下複製、微調及重新發布模型;原開發者也就難以像 API 服務商那樣,持續掌握部署環境或強制執行安全政策。2
研究作者並非主張開放權重模型沒有價值。相反,開放性有助於研究、審查及問責;但模型通過一般的發布前對齊測試,不代表其安全防護在權重被修改後仍然有效。5
作者也提醒,封閉式商業模型或 API 服務同樣可能面對相關的竄改風險。不過,控制微調流程與部署環境的供應商,仍可在微調階段或模型上線後部署防禦措施;當開放權重被自由散布後,這些控制手段便不再由原開發者掌握。25
如果安全護欄能在不大幅犧牲能力的情況下被移除,潛在濫用便可能具備規模化特徵,例如大量製造假訊息、進行更複雜的網路釣魚與詐騙,或產生有害的技術指引,而不再受限於單一使用者逐次操作的成本。5
研究團隊因此呼籲:在模型發布前進行更嚴格且標準化的對抗性評估,例如使用 TamperBench;同時加強抗竄改技術研究,並以更多實證資料支援 AI 採購與風險評估。這對政府將 AI 用於醫療、詐欺偵測、教育及其他公共服務的情境尤其關鍵。25
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
TamperBench 測試的 21 款開放權重模型,沒有一款能抵禦研究評估的所有竄改威脅;每款模型都能被調整至更容易產生有害輸出。
TamperBench 測試的 21 款開放權重模型,沒有一款能抵禦研究評估的所有竄改威脅;每款模型都能被調整至更容易產生有害輸出。 攻擊可在 MMLU Pro 推理準確率下降不超過 10% 的條件下,盡量提高模型的有害回應分數,顯示安全防護被移除時未必會同時失去實用能力。
以少量有害資料混入大量良性資料的隱蔽式越獄微調,包括競爭目標、後門及風格調制變體,通常是最嚴重的攻擊。