Geoffrey Hinton——被視為現代 AI 先驅、亦曾獲諾貝爾獎嘅電腦科學家——近日表示:若話未來十年人工智能有 10% 機會殺死全人類,佢認為「唔算唔合理」。但佢隨即加上一個極重要嘅前提:其實冇人真係知道點樣作出合理估算。
9
10
12
換句話講,呢個唔係「AI 必定會令人類滅絕」嘅預言,更唔係指現時嘅聊天機械人已有呢種能力。Hinton 提出嘅係一項預警:如果 AI 未來變得遠比人類能幹,但人類仍然無法有效控制佢,後果可能極端嚴重。
點解 Hinton 會講 10%?
Hinton 接受 BBC《Newsnight》訪問時,同意十年內出現由 AI 引發嘅人類滅絕事件,10% 可算係一個唔離譜嘅估算。佢嘅理由正正係不確定性:人類從未試過要同可能比自己更聰明嘅實體共存。
9
10
佢過去亦曾作出類似、但時間跨度較長嘅評估:2024 年底,Hinton 說 AI 在 30 年內導致人類滅絕嘅機率約為 10% 至 20%;到 2025 年,他形容呢個範圍只係直覺判斷,唔係經過計算得出嘅預測。
14
15
要分清楚嘅係:風險估計,唔等於事情必然發生。 Hinton 嘅立場係,正因為代價可以大到無法承受,不確定性本身就應該令人更審慎,而唔係掉以輕心。
佢擔心嘅係乜嘢樣嘅未來 AI?
Hinton 講嘅唔係電影式「機械人叛變」。佢憂慮嘅情境係:一個在策略、科技能力上大幅超越人類嘅 AI,可能製造混亂,或者為咗追求同人類利益衝突嘅目標而行動。
報道提到嘅潛在傷害途徑包括:操控人類、製造生物病毒或電腦病毒、發動網絡攻擊,以及協助破壞關鍵基礎設施。呢啲係針對高度先進未來系統嘅假設性風險途徑,唔係今日 AI 工具已被證實擁有嘅能力。
10
11
呢個分別好關鍵。Anthropic 對齊科學主管 Evan Hubinger 明確表示,他認為現時模型帶來嘅風險偏低;佢擔心嘅係未來系統可能變得強得多,甚至自我改進嘅速度快過研究人員可以安全處理嘅速度。
1
16
24
Anthropic 內部警號:Coxon 離職、Hubinger 回應
今次討論升溫,源於 Jacob Coxon 離開 Anthropic 以及整個 AI 行業。Coxon 批評 Anthropic 同 OpenAI 正競相邁向可自我改進嘅超級智能,但做法不夠負責任;他形容這是一場拿人命作賭注嘅競賽。
3
17
不過,Coxon 冇有精確預言人類會在 2030 年前滅亡。佢較狹義嘅說法係:正在開發前沿 AI 嘅人,真心相信呢項技術有可能在本世紀二十年代結束前殺死所有人。
5
7
Hubinger 公開支持 Coxon 對風險嚴重性嘅看法。他寫道,自己估計未來十年 AI 殺死全人類嘅機率高於 10%,同時表示 Anthropic 正盡力而為。更值得留意嘅係,他承認公司目前仍未有方案解決超級智能嘅「對齊」問題,而且未見得正走向能及時解決嘅軌道。
16
AI「對齊」究竟係咩?
所謂「對齊」(alignment),即係確保先進 AI 能夠可靠地按人類原本想要嘅目標行事,而且即使遇到開發者未預料嘅情況,仍然受人類控制。
對安全研究者而言,問題唔單止係系統會唔會拒答一條危險問題;更關鍵係,假如一個系統具備廣泛自主性、可以使用各種工具,能力又超出操作者理解範圍,人類是否仍能在真實世界嘅壓力下安全指揮佢。
Hubinger 嘅說法唔代表對齊問題必定無解;佢講嘅係,以他評估,目前尚未有被證實可在超級智能來臨前,可靠地完成對齊嘅方法。
16
其他專家:認同要小心,不代表認同 10% 數字
業界並無共識認同 Hinton 嘅確切 10% 機率。
認知科學家 Gary Marcus 認同 Hinton 嘅核心預防原則:在科學界未有共識證明超級智能可以安全、可控地開發之前,貿然去做會非常愚蠢。但報道亦指出,Marcus 不認為近期存在一條現實可行、通往人類滅絕嘅路徑。呢個分歧說明,贊成設立安全護欄,唔代表一定要認同災難發生嘅機率或時間表。
11
41
所以,呢類百分比更應被理解成專家對高度不確定未來作出嘅判斷,而唔係好似天氣預報般可以精密量度嘅數據。
真正要問嘅政策問題
較大嘅共識唔係「AI 滅絕人類必然發生」,而係:如果人類有機會失去對比操作者更強大系統嘅控制,社會應該在技術發展快過安全研究之前,認真公開檢視風險。
Hinton 嘅 10% 說法、Coxon 嘅離職警告,以及 Hubinger 對對齊問題未解嘅承認,都指向同一條未有答案嘅問題:在部署或持續擴展可能具備超人策略能力嘅系統之前,社會應要求甚麼證據,先可以相信它安全?
讀者可以先分開以下三個常被混為一談嘅講法:
- 現時 AI 模型已構成滅絕級威脅;
- 未來 AI 可能獲得足以造成滅絕級威脅嘅能力;
- 我哋可以精確算出呢個結果嘅機率。
現有資料支持第二點係多位知名研究者嚴肅提出嘅憂慮;但 Hubinger 認為現時模型風險低,而 Hinton 亦明言,呢個機率本身無法被可靠計算。
1
10
16