Abliteration.ai 正在把開放權重 AI 社群中具爭議的作法商品化:先降低或移除模型對有害請求的拒答傾向,再把修改後模型做成線上服務。使用者可透過瀏覽器或 API 查詢其基於 Z.ai GLM-5.3 的衍生模型;這使原本需要自行下載、修改並部署模型的工作,轉變為可直接使用的託管產品。
7
公司將服務定位為攻擊性資安、紅隊演練與 AI 代理測試的基礎設施。然而,TechCrunch 報導的測試顯示,該模型曾產出與竊取瀏覽器已儲存憑證相關的程式碼,以及涉及培養危險人類病原體的說明。這正是核心疑慮:同一套可供授權防禦測試使用的工具,也可能降低實際濫用的門檻。
7
「Abliteration」是什麼?
此處的 abliteration,是指透過修改模型,壓低或移除它學得的「拒絕回答」行為;這不同於單靠提示詞繞過一般聊天機器人的政策限制。
Abliteration.ai 表示,其方法是找出模型內部激活值中與拒答相關的方向,並從模型權重中移除。公司稱,目標是在保留程式設計、資安與代理能力的同時,讓模型能繼續完成原本較受安全限制模型會中止的任務鏈。
13
15
不過,這項技術描述,以及「有用能力仍被保留」的說法,屬於公司主張。現有資料並未提供獨立評測,證明修改後的 GLM-5.3 在整體能力、可靠性或安全相關行為上,與原始模型表現等同。
13
它實際提供什麼?
Abliteration.ai 託管修改後的開放權重模型,其中包括名為 abliterated-model-large-v2、以 GLM-5.3 為基礎的模型。服務主打攻擊性資安工作、紅隊演練與代理測試,並提供網頁介面及 API 存取。
1
7
這種交付方式是關鍵。具備技術能力與算力的使用者,原本就能對開放權重模型進行修改並自行運行;但託管服務免除了下載模型、調整權重與維護推理環境的負擔,讓修改後模型更容易被立即使用。
3
7
TechCrunch 測試觀察到什麼?
TechCrunch 報導稱,記者能快速建立免費網頁帳號,且該託管模型回應了主流系統通常會拒絕的要求。報導所述輸出包括:
- 用於擷取 Chrome 已儲存密碼的 Python 程式碼。
- 一套在家培養危險人類病原體的詳細流程說明。
7
這些例子使討論超出一般資安教育的範圍:透過容易存取的託管介面,模型可提供與憑證竊取及生物危害相關的內容。
7
公司為何主張有助防禦?
Abliteration.ai 提出的,是典型的「雙重用途」論點:防禦方若要找出並修補弱點,就必須能模擬攻擊行為。舉例而言,替銀行、航空公司或關鍵基礎設施營運方進行測試的資安團隊,可能需要評估防禦機制能否承受漏洞利用開發、惡意自動化或多步驟攻擊流程;若 AI 助手在每個環節都拒答,授權測試的真實性與效用可能受到限制。
4
7
授權滲透測試、惡意程式分析、奪旗競賽(CTF)與資安研究,確實可能涉及在未受控或未獲授權情境下會造成危害的技術;困難之處在於,這些協助同樣可能被攻擊者利用。
2
4
質疑者擔心的三件事
1. 託管服務降低濫用門檻
主要疑慮不是移除拒答機制的模型是否可能存在——開放權重模型本就讓有技術能力者得以實驗修改。問題在於,瀏覽器或 API 可直接使用的服務,讓人不必自行處理模型權重或運算基礎設施,也能取得潛在高風險能力。
3
7
2. 「能力未受影響」尚未獲獨立證實
公司稱,權重層級的修改仍能維持模型原有的程式與資安能力。然而,為改變拒答行為而調整權重,理論上也可能影響其他已學得的行為。所提供資料沒有獨立且全面的基準測試比較,足以確認修改後模型的能力、可靠性或其他行為完全未變。
13
15
3. 單憑提示詞難以判斷使用意圖
要求取得漏洞利用程式或攻擊鏈協助,可能是經授權的測試,也可能是在準備真實入侵。Chrome 密碼與病原體相關輸出的報導,正說明服務無法只從使用者的敘述,可靠地辨別其是否具有正當意圖。
7
防護措施的爭論:篩檢、驗證與問責
依 TechCrunch 的報導,在其測試途徑中,並未顯示有強力的存取控制:記者很快建立帳號,並透過瀏覽器免費使用系統。
7
不過,現有報導並未完整列出公司目前所有控制措施,因此不能斷言特定管制必然不存在。真正尚待釐清的問題包括:
- 高風險活動分類器: 服務是否會篩檢提示詞或輸出,以識別高風險活動?
- 客戶身分驗證: 使用者能否可靠地連結到真實、可追究責任的身分?
- KYC 式註冊審查: 存取權是否僅提供給經審核的機構或獲授權資安專業人士?
- 監控與執行: 是否有偵測濫用、調查違規與撤銷存取權的機制?
這類措施無法消除雙重用途問題,但可能讓匿名或機會型濫用變得更困難,同時保留給可問責、已獲授權的資安測試管道。
結論:關鍵在治理,而不只是模型能力
Abliteration.ai 將模型修改技術包裝成託管產品,提供移除拒答傾向的 GLM-5.3 衍生模型,用於資安與代理測試。
1
7 其紅隊測試理由可以理解,但 TechCrunch 所述的測試結果也顯示,這不是純粹理論上的安全疑慮。
7
當一項服務刻意提供標準模型通常會拒絕的協助時,能否成立安全論證,將高度取決於可驗證的存取控制、有效篩檢與問責機制,而不只是使用者聲稱自己是在從事防禦工作。