Geoffrey Hinton 是獲諾貝爾獎肯定、常被稱為現代 AI 先驅的電腦科學家。他近日表示,人工智慧在未來 10 年內「殺死全人類」的機率若是 10%,他認為「並非不合理」。不過,他隨即加上一項關鍵限定:「沒有人真正知道」如何對這種風險作出有意義的機率估算。
9
10
12
因此,這番話不是斷言人類滅絕一定會發生,也不是說現今的聊天機器人已構成這種威脅。Hinton 的警告屬於一種預防性論點:若 AI 未來變得遠比人類強大,且人類仍無法可靠地控制它,後果的上限可能極高。
10% 指的不是預言,而是面對未知的風險判斷
Hinton 在 BBC《Newsnight》訪談中認同:未來 10 年出現 AI 引發人類滅絕事件的機率為 10%,並非不合理。他的理由正是高度不確定性:人類從未需要與可能比自己更聰明的實體共存。
9
10
他過去也曾給出較長時間尺度的嚴峻評估。2024 年底,他表示 AI 在 30 年內導致人類滅絕的機率約為 10% 至 20%;2025 年則形容這個區間是直覺判斷,而非經過精密計算的預測。
14
15
這裡必須分清楚:風險估計不等於必然發生的預言。 Hinton 的觀點是,當可能造成的損害極端重大時,不確定性本身不應成為安心的理由,反而應促使人們更審慎。
他擔心的是未來的超人類系統,而非科幻式機器叛亂
討論中的情境,並不是電影裡機器突然起義。Hinton 所憂慮的是:如果 AI 在策略規劃與技術能力上遠勝人類,它可能製造大規模混亂,或追求與人類利益衝突的目標。
報導所列舉的可能危害途徑包括操縱人類、設計生物或電腦病毒、發動網路攻擊,以及協助破壞關鍵基礎設施。這些是針對高度先進的未來系統所提出的風險機制,不是當前 AI 工具已被證實具備的能力。
10
11
這項區別十分重要。Anthropic 對齊科學主管 Evan Hubinger 明確表示,他認為現有模型帶來的風險很低。他與 Hinton 擔心的,是未來系統可能大幅提升能力,甚至自我改進的速度快過研究人員能安全管理的速度。
1
16
24
Coxon 離職引爆討論,Hubinger 公開支持憂慮
這波討論升溫,起因於 Jacob Coxon 離開 Anthropic 及整個 AI 產業。Coxon 指控 Anthropic 與 OpenAI 正在競逐可自我改進的超級智慧,卻沒有採取足夠負責任的做法;他形容這是一場拿人類生命下注的賭局。
3
17
不過,Coxon 並沒有精確預測人類文明將在 2030 年前終結。他提出的說法較為限縮但同樣震撼:正在建造前沿 AI 的人,真心相信這項技術可能在本世紀末前殺死所有人。
5
7
Hubinger 則公開表示,這份憂慮值得嚴肅看待。他寫道,自己評估 AI 在未來 10 年殺死全人類的機率高於 10%,同時也表示 Anthropic 正盡力而為。尤其關鍵的是,他承認公司至今尚未有解決超級智慧「對齊」問題的方案,也看不出明確正在走向解方的軌道。
16
「對齊」問題究竟是什麼?
所謂 AI 對齊(alignment),是指如何確保先進 AI 能穩定遵循人類原本設定的目標與限制,並在設計者未曾預想到的情況下,仍然保持可控。
對重視安全的研究人員來說,問題不只是讓模型拒答危險提示詞。更嚴峻的問題是:若一套系統具備廣泛自主性、可使用外部工具,且能力已超出操作者理解範圍,人類是否仍能在真實世界的壓力與利益衝突中安全引導它?
Hubinger 的說法並不代表對齊不可能完成;他的重點是,現階段尚未有已被證明可在超級智慧出現前,可靠完成超級智慧對齊的方案。
16
專家並未就 10% 達成共識
Hinton 的 10% 並非科學界共有的精確數字。
認知科學家 Gary Marcus 贊同 Hinton 的核心預防原則:在沒有科學共識證明超級智慧可以安全且可控地建造之前,貿然開發它是很不明智的。但相關報導也指出,Marcus 不認為短期內存在一條現實可行、通往人類滅絕的路徑。這說明一項重要分歧:支持安全防護,並不表示必須接受相同的末日機率或時間表。
11
41
更廣泛而言,公開討論中同時存在兩種看法:一方認為長期 AI 風險值得高度重視;另一方則質疑現有技術路線能否在不久後產生自主、不可控制的超級智慧。正因如此,這些百分比應被視為專家判斷,而不是可直接量測的統計結果。
真正的政策問題:開發前需要什麼證據?
較大的共識並不是「AI 滅絕必然發生」,而是:若失去對能力超過操作者的系統之控制,存在不可忽視的可能性,那麼在技術開發速度超越安全研究前,就應有公開審視與制度性把關。
Hinton 的估計、Coxon 的離職,以及 Hubinger 對對齊難題的警告,都指向同一個尚未解答的問題:在部署或繼續擴大可能具備超人類策略能力的系統之前,社會應要求哪些可檢驗的安全證據?
讀者尤其應避免把下列三種說法混為一談:
- 現有 AI 模型已構成滅絕等級威脅;
- 未來 AI 系統可能獲得足以造成這類威脅的能力;
- 這種結果的機率可以被精確計算。
現有資料支持第二點是一項由多位重要研究者提出、值得嚴肅看待的憂慮;但 Hubinger 認為當前模型風險偏低,而 Hinton 也強調,這類機率本身無法被可靠地算出來。
1
10
16