AI「kill switch」(緊急關停機制)嘅討論,已經唔再只係問:一間實驗室可唔可以按掣熄咗一個模型。更棘手嘅問題係,當強大 AI 被部署到龐大而分散嘅基建,甚至有足夠自主性走出單一受控環境時,個掣仲有冇用?
Coxon 警告:而家可能關到,唔代表將來都得
前 Anthropic 及 OpenAI 研究員 Jacob Coxon 喺 NBC News 節目 Meet the Press 表示,現階段「kill switch」大概對好多 AI 都有效。不過,呢個唔係按一粒掣咁簡單:大型資料中心同已部署嘅系統涉及好多組件同關停步驟。雖然難做,但只要系統仍受限於一個實體地點,佢認為仍然做得到。
8
佢擔心嘅係下一階段。Coxon 指,如果 AI 變成分散、自主運作嘅「群體」(swarm),中央發出嘅關停指令或會喺技術上失效。關鍵在於覆蓋範圍:控制機制必須觸及系統每一個仍在運作嘅實例,先至真正關得停。
Coxon 離開 Anthropic 後亦警告,頂尖實驗室正競逐可自我改進嘅 AI 系統,但呢類系統有機會變得無法控制。
1
50
由公司自設關機掣,走向可核實嘅安全保障
Anthropic 聯合創辦人 Jack Clark 認為,將來關停危險 AI 系統嘅能力,可能需要由法律規定,而唔只係開發公司自願承諾。佢接受 BBC 訪問時話,大部分主要 AI 實驗室——包括 Anthropic——本身已有停用系統嘅方法;但更重要嘅問題係,呢個「掣掣」係咪可以由獨立第三方核實。
33
兩者分別好大。公司聲稱有緊急關停程序,唔等於外部評估者能夠確認:程序係咪存在、設計係咪足夠,以及真正出事時係咪可行。
Amodei:要「調節前沿步伐」,唔係全面停研 AI
Anthropic 行政總裁 Dario Amodei 提出一套框架,希望前沿 AI 能力提升嘅速度,唔好快過安全措施發展。方案有三部分:
- 常駐式獨立評估者: 前沿 AI 公司應讓外部評估者持續以近似員工嘅權限,接觸相關系統同安全做法,核實公司承諾並報告問題。
- 民主國家之間建立共同標準: 主要開發者協調一致嘅安全標準,並限制缺乏制衡嘅能力增長。
- 國際協調: 政府跨境合作,處理任何一家公司或一個國家都難以獨力控制嘅風險。
17
呢個唔係要求停止所有 AI 研究,而係要求技術進展要建基於可被公司以外人士審視嘅安全控制之上。
有邊啲科技領袖支持?
路透社報道,OpenAI 行政總裁 Sam Altman 同 xAI 負責人 Elon Musk 都公開支持 Amodei 提出嘅大方向。Altman 表示 OpenAI 會採納讓獨立評估者取得近似員工權限嘅做法;Musk 就話:「Dario is right。」
17
另有報道指 Google DeepMind 行政總裁 Demis Hassabis 支持方案嘅方向。
30 至於 Microsoft 行政總裁 Satya Nadella,現有資料未能證實佢曾就呢個具體方案作出可歸屬嘅回應,因此唔應推斷佢支持或反對。
美國《AI Kill Switch Act》想做乜?
美國眾議院法案 H.R. 9917,即擬議中嘅 AI Kill Switch Act,會修訂《國土安全法》,要求若干受涵蓋機構維持技術能力,以停止受涵蓋 AI 技術嘅推理運算(inference)、終止用戶存取,並關停有關技術。
49
呢項措施目前只係提案,並唔係已獲證明能解決所有 AI 控制問題嘅方案。它實際有幾大作用,取決於嚴重事故出現時,開發者仲可唔可以識別、接觸同停用相關系統——而呢個正係 Coxon 對未來分散式系統提出嘅挑戰。
「滅絕風險」係個人判斷,唔係預測數字
Anthropic 研究員 Evan Hubinger 表示,佢個人評估未來十年由 AI 導致人類滅絕嘅風險高過 10%。電腦科學家 Geoffrey Hinton 就向 BBC 表示,10% 嘅可能性「並非不合理」。
57
呢啲係專家對高度不確定未來嘅判斷,唔係量度得出嘅機率,更唔代表科學界已有共識。不過,呢啲看法說明咗點解關停機制嘅討論,已超出一般產品安全範圍:支持較強控制嘅人認為,即使不可逆轉災難嘅機會率不高,後果極端嚴重,亦值得建立更嚴密嘅保障。
點解政府會抗拒強制關停或放慢發展?
英國政府拒絕設立全國性 AI 關停機制,理由係英國「唔可以簡單噉將 AI 關掉」。政府指出,即使封鎖英國境內用戶存取模型,都無法阻止模型喺其他地方被開發或濫用。
51
呢個正正反映地緣政治難題。一個國家可以監管本地公司同基建,但 AI 開發本身係跨國進行。憂慮競爭力嘅政府,可能擔心單方面收緊限制,會令投資、技術能力同戰略優勢流向規管較少嘅競爭者。
不過,主張加強治理嘅一方認為,正因風險跨境,公司自願承諾同單一國家規例本身都唔夠;監管同安全承諾亦要具備可信嘅國際協作基礎。
真正衝突:發展速度,抑或可控制性?
呢場分歧唔係簡單分成「支持 AI」同「反對 AI」。
- 安全倡議者希望有可獨立檢查嘅保障、真正可用嘅關停能力,同埋防止 AI 能力跑得快過評估與控制嘅限制。
- 質疑硬性限制嘅一方認為,全球性暫停難以執行,亦可能在無法阻止海外研發嘅情況下,拖慢有價值嘅創新。
- 條件式發展立場則由 Coxon、Clark 同 Amodei 所代表:AI 可以繼續進步,但安全措施必須能夠被測試與驗證,而唔係只靠公司承諾。
8
33
17
所以,「kill switch」最好理解成整套安全系統其中一層,而唔係萬能答案。假如先進 AI 終有一日分散到一個中央掣都觸及唔到,部署前監督、獨立評估同國際協調,只會變得更加重要。