Sam Altman對AI嘅警告,有兩個層面:一個係技術上會唔會失控,另一個係權力由邊個掌握。即使一套AI仲可以由人操控,如果操控權落喺極少數人手上,問題一樣可以好嚴重。呢個亦令AI安全唔再只係工程問題,而係治理問題。
13
16
Altman話要避開嘅兩條壞路
第一條:人類失去控制。 Altman警告,人類可能會「將未來嘅控制權交咗畀AI」。佢形容呢個結果不可接受,並強調AI必須服務人類,而唔係令人成為無法充分監督嘅系統嘅附庸。
2
16
第二條:AI權力過度集中。 另一個危險係,一套極其強大嘅AI由一個人、一間公司或者一個國家控制,再用嚟向所有人強加其世界觀。Altman形容,呢種局面可能會「極度反烏托邦」。
1
13
兩種風險有關連,但唔係同一件事:前者問嘅係,人類能否理解、限制同覆核強大系統;後者問嘅係,即使系統仍然受控,掌權者係咪有過多而欠缺制衡嘅權力。
佢主張咩保障?
Altman並非單純主張停止AI研發。佢嘅重點係:模型能力唔可以跑得快過「對齊」(alignment,即令系統行為符合人類目標與限制)同監測能力;競爭壓力亦唔可以變成魯莽部署嘅藉口。
2
13
佢提出或支持嘅方向包括:
- 對齊同監測要跟得上能力提升。 開發者必須可以有意義咁評估同控制越嚟越強嘅模型。
2
13
- AI要始終服務人。 呢個係佢反對「失控」嘅核心原則。
2
16
- 為前沿AI訂立一致嘅聯邦要求。 Altman歡迎美國聯邦層面建立框架,處理前沿AI風險,而唔係只靠零散嘅自願承諾。
13
16
- 獨立審視。 佢提過獨立審計員可協助建立公眾對開發高能力模型公司嘅信心。
16
實際意思係:模型愈強,推出前就愈要有可信、經測試嘅安全措施;安全唔可以等能力已經衝咗出去先至補鑊。
Anthropic研究員嘅警報,令爭論更尖銳
同一星期,前Anthropic研究員Jacob Coxon辭職時警告,頂尖實驗室正向可自我改進嘅AI競跑,等同「攞我哋嘅命去賭」。報道指,佢相信參與開發呢類系統嘅研究人員,真心擔心系統可能強到人類無法控制。
17
呢個講法比Altman更直接,但核心憂慮一致:能力進步可能快過可靠監督嘅能力。一場被報道嘅公開交流中,Anthropic對齊研究主管Evan Hubinger估計,AI喺十年內導致人類滅絕嘅機會超過10%,並承認目前尚未有完整方案解決超智能AI嘅對齊問題。不過,呢個係佢個人嘅風險判斷,唔係已被證實嘅預測,更唔係科學界已有共識嘅機率。
17
重點唔係某個滅絕時間表已經被證實——事實上冇;而係最接近前沿研發嘅人,正公開質疑現有安全做法追唔追得上正在開發嘅系統。
真正分歧:能力行先,定安全行先?
呢場爭論經常被講成「加速AI」對「減慢AI」,但咁樣分法太粗疏。大部分參與者都承認AI可以帶來巨大好處;真正爭議在於先後次序同規則有冇約束力。
其中一派主張,前沿AI嘅能力提升要放慢節奏,畀安全研究、模型評估、治理制度同應對濫用嘅安排追返上來。Anthropic行政總裁Dario Amodei就呼籲減慢能力提升,並提出由可深入公司運作嘅獨立評估員驗證安全實踐、前沿實驗室協調,以及國際合作等措施。
另一面嘅壓力亦確實存在:公司同政府擔心比競爭者行得慢,就會失去經濟或地緣政治優勢。不過Altman認為,競爭唔可以成為容許模型能力超越對齊同監測嘅理由。
13
路透社報道,有研究人員認為模型能力嚟得比預期快,同時人類對系統內部運作嘅可見度、以及可能嘅控制力卻正在下降。 因此,最迫切嘅政策問題係:實驗室應否繼續部署愈來愈自主嘅模型,再由保障措施慢慢追;定係應該先證明保障已經足夠,先可以部署?
AI治理要同時處理兩件事
Altman嘅兩個警告意味,前沿AI治理至少要兼顧技術控制同權力分配。模型評估、對齊研究、監測同獨立監督,主要係處理前者;一致規則、透明度同防止單一主體獨攬控制權,則針對後者。
無論係災難性預測定精確時間表,都唔應該當成既定事實。但正正因為一旦失敗嘅後果可以極嚴重,要求更嚴格評估、外部審視同安全規則,已由小眾議題變成AI業界嘅核心問題。
13