OpenAI 表示,會支持獨立機構喺前沿 AI 模型的訓練、評估同部署期間,更早進行技術安全評估,而唔係臨近推出先做一次檢查。公司稱,目標係畀外部組織有足夠存取權去測試安全聲稱、找出盲點,並檢驗風險緩解措施係咪真係有效。
5
呢個方向比一般「推出前紅隊測試」行前一步。不過,公開方案仍然係自願框架,唔係由外部監管機構發牌,亦冇具約束力的「發現風險就必須暫停部署」規則。實際成效取決於評估者可得到幾多存取權、佢哋是否真正獨立,以及發現嚴重問題後有冇實質後果。
第三方評估會查乜?
OpenAI 將第三方評估描述為:獨立測試公司就前沿模型能力、風險同防護措施所提出的證據。公司稱,評估應在訓練、評估及部署各階段取得深入存取權。
5
據框架相關報道,其中一項重點係獨立審視 AI 實驗室的「安全論證」:由訓練、內部部署到對外部署都包括在內。框架亦列出四個評估範圍同七項運作原則;實驗室可在結果公開前先修正發現的問題,亦可要求刪節部分內容。
2
提早介入好重要:如果等到研發尾聲先審查,發現問題時,重大技術同商業決定可能已經好難扭轉。另一邊廂,早期存取亦可能涉及敏感的模型權重、能力資料同測試材料,因此評估制度本身亦要處理保安風險。
OpenAI 所講的四個可信條件
OpenAI 列出有效第三方評估的四項核心要求:強而有力的獨立性機制、科學嚴謹、穩健保安措施,以及清晰責任。
5
1. 獨立性
如果開發商可以主導測試方法、遇到不利結果就收窄存取權,或者因為唔鍾意結論而終止資助,評估就談不上真正獨立。獨立性唔只關乎評估者係咪公司以外的人,仲涉及管治、資金、範圍同溝通安排。
由評估者組成的聯盟亦要求具實質獨立性,包括避免被受評公司控制,以及有權公開主要發現;只有在狹窄而明確界定的情況下才可作刪節。
17
34
2. 科學嚴謹
評估要有合資格的專家、有效方法,同埋可以被檢驗或重現的證據。Future of Life Institute 的《AI Safety Index》指出,評估方法同獨立性需要加強,不能只靠零散、有效性薄弱的單項任務測試,而應使用可信的外部評估者。
8
12
3. 保安
讓外部人士更早接觸前沿系統,本身可能帶來風險。OpenAI 指出,開發商要一方面容許有意義的審查,另一方面保護敏感資料。
5 保安控制應減少不必要外洩,但唔應變成阻止評估或掩蓋重要發現的萬能藉口。
4. 清晰責任與問責
可信的流程要講清楚:邊個提供存取權、邊個定測試方法、邊個接收結果、邊個判斷補救是否足夠,以及嚴重問題未解決時會點處理。清楚的匯報與上報渠道不可或缺;否則評估只會變成管理層可以靜靜地唔理的建議書。
同「對齊」及遞歸自我改進政策有咩分別?
第三方評估係一種監督機制,唔係解決 AI 對齊問題的技術方案。它的作用係檢驗一間公司對風險及緩解措施的聲稱,有冇證據支持。
另外,OpenAI 的聯邦政策藍圖主張,前沿 AI 開發商應評估及緩解多類風險,包括網絡能力、CBRN 風險(化學、生物、放射性及核相關風險)、失控、失配,以及朝向遞歸自我改進(RSI)的進展。該藍圖亦提出公開安全框架與透明度報告,但容許因保安及商業機密作適當刪節。
7
喺呢個脈絡下,外部評估者可以幫手驗證開發商的測試同安全措施是否可信;但單靠佢哋,無法解決失控、失配或 RSI 相關風險。
OpenAI 對比 Anthropic 的「駐場評估者」構想
Anthropic 行政總裁 Dario Amodei 提倡更持續的模式:讓第三方評估者以近似員工的方式,長期駐留於前沿 AI 實驗室內。佢哋唔只評估完成的模型,亦會檢視訓練流程、部署做法、內部防護同重大安全事故。
18
21
Anthropic 已宣布安排 Accenture 人員駐場,審視模型及公司做法,並正同其他組織討論試點。Anthropic 同時承認,評估者的存取權和溝通方式目前仍未有既定標準。
19
22
OpenAI 今次公布的框架,同樣指向更早、更深入的審查;但其已公開描述主要聚焦於研發各階段的技術評估。會否提供駐場監督所意味的持續存取權,仍要視乎未公開的執行細節。
5
點解業界標準都係爭論焦點?
有報道指 Anthropic、OpenAI 同 Google DeepMind 曾討論成立共同、但自願參與的 AI 安全標準機構。
20 統一標準有機會令不同公司的評估方法更易比較,亦可界定風險門檻及事故匯報的一致要求。
不過,有標準機構唔代表自動消除利益衝突,亦唔代表有執法權。自願標準要有力,通常仍需配合透明的量度方式、獨立核證,以及違規後的實際後果。
點解批評者仍然唔放心?
批評者未必反對外部測試;佢哋質疑的是,由公司主導安排的制度,能否提供真正的監督。憂慮包括:開發商可能仍然選擇評估者、決定可接觸的資料、拖慢評估、要求刪節,甚至在負面結果下照樣部署。
具體爭議包括:
- 資金與制度獨立性: 評估者需要免受財政壓力,亦不應因結論不利而被終止合作。
17
34
- 及時而足夠的存取權: 測試必須及早接觸相關模型、系統及開發決策,先有機會影響結果。
- 公開發現的自由: 基於保安作刪節可以合理,但應範圍狹窄,並有規則防止公司壓下不利結果的核心內容。
2
17
- 上報與後果: 評估需要直達決策者的渠道,並在風險超過門檻時有明確回應程序。
前 OpenAI 研究員 Daniel Kokotajlo 曾批評主要 AI 實驗室為爭取市佔而「快速行動、打破常規」,反映一種更廣泛的憂慮:競爭與財務壓力,會令自願延遲變得代價高昂。
36
40 問題在於制度結構:如果公司仍可單方面控制存取、公開與部署決定,第三方評估可以改善證據質素,卻未必等同獨立監督。
總結:由「提早測試」走到「有效監督」,仲差幾步
OpenAI 的方案將安全評估移前,理論上可讓發現的問題更早影響訓練同部署決策。其提出的獨立性、嚴謹、保安同清晰責任四大支柱,亦是合理基準。
5
真正考驗係,呢啲基準會否成為可執行的運作條件:評估者能否持續存取、自由選擇方法、受保護地匯報結果;刪節如何透明處理;以及面對嚴重發現時,是否有可信的行動程序。若欠缺這些保障,提早的外部評估仍可能有價值,但更接近紅隊測試,而未達到批評者所要求的獨立監督。