前沿 AI 安全工作正形成一種特殊壓力:負責測試最先進模型的人,可能相信系統會帶來嚴重危害,卻未必擁有延後發布或要求修正的權限。
報導指出,英國 AI 安全研究所(UK AI Safety Institute,負責評估前沿 AI 模型的政府機構)有數名員工請醫療假或尋求諮商。消息來源將壓力與緊湊的測試時程、低落士氣,以及對快速部署的憂慮連結在一起。
2 這不代表該機構、Anthropic、OpenAI 或 Google DeepMind 的所有員工都處於同樣狀態;但它確實凸顯,在高風險技術競賽中,第一線安全人員正承受顯著的人性成本。
壓力不只是工作量,而是責任與權限失衡
安全研究人員測試的不是遙遠的假設,而是可能很快就會被部署的系統。當他們找出漏洞、能力風險或濫用途徑時,能否阻止模型推出,往往不是由評估人員單獨決定。
英國研究所面臨的壓力,據報集中在未發布系統的評估時間被壓縮,以及商業部署與能力提升速度過快的疑慮。
2 在這種環境裡,倦怠不只源自加班,而是「個人被賦予高度風險責任,卻無法單靠自己處理」的無力感。
因此,這更適合被理解為制度問題,而非個別研究人員反應過度,也不能據此推論災難已成定局。當失誤後果被認為極高、工作節奏極快、外部介入機制又不清楚時,道德壓力便容易累積。
他們究竟擔心哪些風險?
焦點同時包括近期可見的濫用,以及較長期、仍具推測性的失控情境。
資安與生物領域的濫用
能力強大的模型可能降低從事有害行為所需的技能、時間或成本。曾任職 OpenAI、後來離開 Anthropic 的研究員 Jacob Coxon 指出,AI 輔助的生物威脅與網路武器,可能是造成嚴重傷害的途徑。
15
這不是說某個特定模型已經造成這類事件。它說明的,是為何安全團隊主張:在具備更強推理或代理式行為的系統被廣泛部署前,應先進行能力與風險評估、建立存取控制,並持續監測。
系統進步快過監督能力
另一項憂慮是,AI 可能自動化愈來愈多研究與工程工作,進而加速 AI 本身的開發循環。喬治城大學安全與新興技術中心(CSET)的報告指出,高度自動化的 AI 研發可能加快能力進展,也可能讓人類更難理解與控制系統;這是可能的風險情境,而不是已被證實的結果。
48
現有證據也劃出重要界線:一項研究發現,AI 代理能在無人協助下完成大量研究工程工作,但在受測的開放式研究問題上,未能取得實質進展。
49 因此,完全的遞迴式自我改進尚未得到證實。真正的擔憂在於方向與速度:即使只是部分自動化,也可能縮短留給評估、治理與修正的時間。
Jacob Coxon 的離職,為何引起共鳴?
Coxon 的公開離職,讓原本多在組織內部流動的焦慮有了具體面孔。他表示,自己先後在 OpenAI 與 Anthropic 從事預訓練研究後,認為這些公司正競相邁向可自我改進的超級智慧,卻沒有採取負責任的做法。他也向 BBC 表示,從事這項技術的人確實對其發展速度與可能後果感到害怕。
1
一名員工離職,並不能證實其所有預測都正確;但它讓一個工作場所的兩難浮上檯面:留在實驗室內部,是否更有機會推動防護?還是當內部反映管道不足時,離開並公開發聲才是必要選擇?
為何單一實驗室很難自行放慢?
核心問題是集體行動。若單一實驗室獨自放慢能力開發,可能擔心被競爭者超越;而實驗室內的員工,對整個產業競賽的影響力往往更有限。
史丹佛大學人本人工智慧研究院(Stanford HAI)討論「AI 能否放慢」時指出,全面放緩 AI 能力開發並不容易實現。不過,與談者仍強調,政府或合格第三方進行的獨立評估,以及對安全、資安與監測更強的投入,都應成為標準做法。
18
這比要求個別研究員獨自背負風險更具體。問題應轉向共同規則:誰來測試?風險跨過門檻後會怎樣?誰能獨立驗證業者是否遵守承諾?
產業呼籲「減速」,可信嗎?
Anthropic 執行長 Dario Amodei、OpenAI 執行長 Sam Altman 與 Google DeepMind 共同創辦人 Demis Hassabis,都曾以不同程度公開支持放慢或「調節」前沿 AI 發展。
32 公開討論的方案包括:讓外部獨立評估者持續取得如同員工般的進入權限,以監督前沿實驗室。
36
但公開承諾不等於可執行的克制。批評者指出,若由主導市場的大公司設計 AI 凍結或減速規則,反而可能鞏固其權力,並使小型競爭者更難生存。
34 兩件事可以同時成立:部分領袖可能真心擔憂安全,而既有業者也可能從高進入門檻中受益。
因此,比起猜測動機,更有用的標準是能否驗證。認真的安全承諾,應可透過以下措施檢視:
- 不完全由開發者控制的獨立評估;
- 清楚的風險門檻,以及跨越門檻後的實際後果;
- 透明的事故通報與資安做法;
- 有實質權力的外部監督;
- 對提出安全疑慮員工的保護。
這些報導證明了什麼,又沒有證明什麼?
這些報導沒有證明人類滅絕迫在眉睫,也沒有證明所有前沿實驗室員工都陷入焦慮,更沒有證明現有 AI 已能無限自主地改進自己。
它們顯示的是:有些最接近技術的人,正在把當前局面視為高度艱難的倫理問題。強大系統在時間壓力下接受測試;擔憂涵蓋資安與生物濫用,也涵蓋失去控制;而本應治理模型發布的制度,可能尚未具備足夠的獨立性與權限。
2
15
18
對 AI 安全研究員而言,這會讓技術職務演變成個人責任的問題。較持久的解方,不是把責任丟給個別工作者,而是建立可信、獨立且可驗證的評估與問責制度,讓治理速度能跟上它試圖約束的技術。