前沿 AI 安全工作帶來一種好特別嘅壓力:有啲負責評估先進模型嘅人,相信系統可能造成嚴重傷害,但佢哋未必有足夠權力延後推出,或者要求公司先修正問題。據報,英國 AI 安全研究所(UK AI Safety Institute,AISI)有多名職員請醫療假或尋求輔導;消息指,緊迫嘅測試期、低士氣,以及擔心技術部署快過安全措施,都係令壓力加劇嘅因素。
2
不過,呢啲報道唔代表 AISI、Anthropic、OpenAI 或 Google DeepMind 所有人都出現心理困擾;亦唔等於災難必然發生。佢更像一個警號:當技術競賽嘅後果被視為好嚴重,而評估者又未必有權煞停,工作本身可以變得極度消耗。
點解安全評估會變成心理負擔?
安全研究員唔係研究一個好遙遠、純理論上嘅風險;佢哋測試嘅,可能就係機構準備推出嘅模型。於是,專業責任同公司推進節奏之間容易出現拉扯:發現漏洞,唔等於有權阻止產品發布。
有關 AISI 嘅報道聚焦於未推出系統嘅評估窗口被壓縮,同時有人憂慮商業推出及能力提升速度太快。
2 喺呢種情況下,個別評估員可能覺得自己要為潛在風險負責,卻無法單靠一己之力解決,倦怠感自然會疊加。
所以,問題唔應該被理解成某個員工「諗得太多」,亦唔係話毀滅必定臨近。較合理嘅理解係制度性壓力:一旦失誤嘅潛在代價好高、工作節奏極急,而獨立介入機制又唔清晰,心理負荷就會被推到好高。
佢哋究竟擔心咩風險?
研究員關注嘅,既包括較近在眼前嘅濫用,亦包括較具推測性、但後果可能更深遠嘅失控情境。
網絡攻擊同生物危害嘅濫用
能力較強嘅模型,可能降低從事有害活動所需嘅技術、時間或成本。曾任職 OpenAI、其後在 Anthropic 工作嘅 Jacob Coxon 指出,AI 輔助嘅生物威脅與網絡武器,是可能通往嚴重傷害嘅途徑。
15
呢個唔係指某一個模型已經造成相關事件;而係解釋咗點解安全團隊會要求,在具更強推理能力或自主代理特徵嘅系統廣泛推出前,先做好評估、存取控制同持續監察。
系統進步得快過人類監督
另一項憂慮係,AI 可能逐步自動化更多研究同工程工作,連技術研發周期本身都被加速。喬治城大學 CSET 一份報告指出,高度自動化嘅 AI 研發可能令能力進展加快,同時令系統更難被人類理解和控制;這是可能出現嘅風險情景,並非已被證實嘅結果。
48
現有證據亦劃出重要界線。一項近期研究發現,AI 代理可以在冇人協助下完成大量研究工程工作,但對測試中開放式研究問題,未能取得實質進展。
49 因此,所謂「完全遞迴自我改進」仍未獲證實。真正令人不安嘅係方向同速度:就算只係部分自動化,也可能壓縮用來評估、訂規則同修正問題嘅時間。
點解 Jacob Coxon 離職引起咁大迴響?
Coxon 公開辭職,令原本多數留喺內部嘅憂慮有咗一張具體面孔。他表示,自己曾在 OpenAI 和 Anthropic 從事預訓練研究,並相信兩間公司正競逐通向可自我改進嘅超級智能,卻未有負責任地行事。他亦向 BBC 表示,從事相關技術嘅人對其發展速度及潛在影響「真係感到害怕」。
1
一個人辭職,唔會自動證實佢對未來每一項預測都正確。但事件突顯咗一個工作場所兩難:留喺實驗室內部,可能較有機會改善防護;但如果內部渠道被認為不足,離開並公開發聲會唔會反而係必要做法?
點解一間實驗室難以獨自放慢?
核心問題係集體行動。一間實驗室如果單方面放慢能力研發,可能怕被競爭對手拋離;而員工就算留喺公司內部,對整個行業競賽嘅影響力可能更有限。
史丹福大學人本人工智能研究院(Stanford HAI)討論「AI 可否放慢」時,與談者認為大範圍放慢能力開發將會好困難;不過,他們仍強調,政府或具資格第三方進行嘅獨立評估,以及對安全、保安同監察加大投資,應成為常規做法。
18
呢個框架比要求個別研究員「憑良心頂住」更實際。問題應該轉為共同規則:邊個做測試?觸及風險門檻後會有咩後果?又由邊個核實開發商有冇守規矩?
業界話要「減速」,係咪真心?
Anthropic 嘅 Dario Amodei、OpenAI 嘅 Sam Altman,同 Google DeepMind 嘅 Demis Hassabis,都曾以唔同程度公開支持放慢或「調節節奏」推進前沿 AI。
32 公開討論過嘅方案,包括讓獨立外部評估員持續、近似公司員工般接觸前沿實驗室。
36
但公開承諾唔等於可強制執行嘅克制。批評者指出,如果由主導市場嘅大公司設計 AI 凍結或減速規則,反而可能鞏固佢哋嘅權力,令規模較小嘅競爭者更難生存。
34 兩件事可以同時成立:部分企業領袖可能真心看見安全風險,而既有巨頭也可能從高門檻規則中得益。
所以,與其猜動機,更有用嘅標準係能否驗證。一個認真嘅安全承諾,應該至少可以從以下方面檢視:
- 評估唔應完全由開發商自行控制,而要有獨立參與;
- 風險門檻要清楚,跨線後要有實際後果;
- 事故通報與保安做法要有透明度;
- 要有具實權嘅外部監督;
- 提出安全疑慮嘅員工要得到保護。
呢啲報道證明咗咩,又未證明咩?
佢哋冇有證明人類滅絕迫在眉睫,冇有證明所有前沿 AI 實驗室員工都受困擾,亦冇有證明現時 AI 已能無限自主改善自己。
但報道確實反映,點解有啲最接近技術嘅人會覺得處境在倫理上難以承受:強大系統要在時間壓力下評測;憂慮涵蓋網絡及生物濫用,也包括失去控制;而用來規管發布嘅制度,未必已有足夠獨立性與權力。
2
15
18
對 AI 安全研究員嚟講,呢個組合可以令一份技術工作,變成關於個人責任嘅沉重問題。長遠解法唔應該係將責任全擺喺個別員工身上,而係建立可信、可由外界獨立核實嘅評估同問責制度,令監管速度追得上技術發展。