公開報道顯示,Anthropic、OpenAI 同 Google DeepMind 確實喺一個核心原則上愈來愈接近:能力最強嘅 AI 模型面世前,唔應該只靠開發商自己做內部檢查,而要接受外部審視。不過,現有資料未能證明三間公司已成立一個新嘅聯合監管機構,亦未見佢哋就具約束力嘅測試、審計存取權、發布門檻,或者違規罰則達成協議。
8
11
呢個分別好重要:同意要做評估,唔等於已經有一個可以執法嘅機構。
用白話講:而家提議緊乜?
報道指,三間公司自 2026 年 7 月開始進行工作層面討論,研究成立由業界主導嘅前沿 AI 標準機構。表面目標係建立一套共用制度,喺模型公開部署之前評估其危險能力,尤其係網絡攻擊、生物濫用、欺騙,以及其他可能造成重大傷害嘅濫用情境。
8
11
Google DeepMind 行政總裁 Demis Hassabis 提出過較清晰嘅制度藍圖:由美國主導、參照金融業自律組織 FINRA 模式嘅 「前沿 AI 標準機構」。FINRA 即金融業監管局,屬業界出資、但受聯邦監督嘅自律組織。Hassabis 嘅構想係,由類似機構喺前沿模型推出前進行測試;初期由公司自願提交模型,待評估程序證明有效後,先可能轉為強制要求。
9
不過,公開資料仍未顯示各實驗室已就以下真正決定制度有冇牙力嘅細節達成共識:
- 邊類模型必須接受審查;
- 邊啲技術評估屬強制;
- 外部評估員可獲幾多系統存取權;
- 乜嘢結果會令模型發布被阻止、延後,或附加條件;
- 機構由邊個出資、點樣管治;
- 評估員點樣同被評估公司保持獨立;
- 政府監督同法律保障會點安排。
喺呢啲問題未有答案之前,將呢項討論形容為已運作嘅「聯合監管機構」,會誇大現有證據。
三間公司真正有共識嘅地方
最明確嘅交集係 發布前獨立測試。Axios 7 月報道指,Dario Amodei、Sam Altman 同 Demis Hassabis 大致支持:前沿模型面向公眾前要由外部人士審視,而唔再主要靠公司自我申報。
8
呢個轉變唔只係程序問題。前沿模型安全,除咗睇開發商有冇做測試,亦取決於獨立一方能否重現、質疑甚至挑戰其結論。一套可信制度需要清楚測試標準、可靠嘅系統存取安排,以及模型跨越風險門檻時有明確後果。
三家公司亦都將議題放喺國際層面。背後有一個現實張力:如果美國單方面收緊限制,而海外競爭對手毋須面對相近約束,政治上未必容易推行。Hassabis 嘅構想明確以美國主導;Amodei 則認為,只靠單一國家嘅安全措施,管唔到可全球部署嘅系統。
9
1
分歧唔係表面:自願框架、政府背書,定真正監管?
幾間實驗室同樣講安全,但最根本嘅分歧係:呢個制度究竟應該係自願業界框架、政府支持嘅制度,定係有實權嘅監管者?
DeepMind 嘅方案係業界出資、聯邦監督,先行自願參與,之後有可能令審查成為部署前置條件。
9
Amodei 嘅方案則着重讓獨立評估員以近似員工嘅權限進駐前沿 AI 實驗室;同時呼籲民主國家嘅公司協調安全標準,必要時取得政府支持。
1
2
至於工作小組討論,報道形容 OpenAI 對業界先行採取行動持開放態度,而唔想等政府建立完整制度先開始。
11 OpenAI 行政總裁 Sam Altman 亦喺 Amodei 發文後公開支持讓獨立評估員取得近似員工級別嘅存取權。
呢啲差異絕非文字遊戲。自願安排可以較快建立共同技術做法;但如果欠缺獨立管治同公共權力,可能無法強制公司開放資料、裁決爭議、防止利益衝突,或者阻止一間公司發布未通過安全審查嘅模型。
Frontier Model Forum 唔等於新監管機構已成立
Frontier Model Forum 本身早已存在,係由多間大型 AI 公司參與嘅業界組織。其公開目標包括推進安全研究、建立評估與最佳實踐,以及促進政策制定者同業界之間嘅資訊交流。
所以,佢可以係協調工作嘅合理平台,但本身唔能夠證明一個新獨立機構已啟動,亦唔代表跨公司審計制度已具約束力。真正要問嘅係:公司最後成立嘅實體,會只係寫指引,抑或可以獨立評估模型,並對發布附加有意義嘅條件?
Amodei 篇文章點樣改變咗公開討論
9 月 12 日,Anthropic 行政總裁 Dario Amodei 發表約 3,800 字文章《We Must Pace the Frontier》。佢主張,AI 能力提升要放慢,畀安全實務有時間追上。
5
2
Amodei 警告,喺 6 至 12 個月內,更強大嘅自動化 AI 代理群體或許有能力接管互聯網。呢個應理解為預測同風險警告,而唔係已被確立嘅技術結論。
5
13
佢提出三步走:
- 讓獨立評估員進駐前沿 AI 實驗室,以近似員工嘅存取權測試系統、找出安全失效,並評估合規情況。
1
2
- 民主國家內嘅 AI 公司協調共同安全標準與限制,有需要時由政府支持。
2
16
- 推動更廣泛國際協調,包括同威權政府協作,因為先進模型同相關風險都可以全球部署。
1
15
Anthropic 表示會向第三方評估員提供永久、員工級別嘅系統存取權。呢個承諾比一次性外部測試更進一步,但實際可信度仍取決於:邊個揀評估員、佢哋可以睇乜、可否公開結果,以及一旦發現不可接受風險會有咩後果。
12
2
最終考題:問責有冇落到地?
批評者最直接嘅疑問係:幾間正競逐開發最強系統嘅公司,會唔會同時參與制定、管理同詮釋規管自己產品嘅規則?
一個安全機構要令人信服,需要獨立技術領導、透明評估方法、防止公司干預嘅保護機制、有實質意義嘅政府監督,以及喺評估失敗時採取行動嘅清楚權力。欠缺呢啲,統一標準固然可能改善做法,但仍未必等於真正獨立問責。
Future of Life Institute 嘅 2026 年夏季 AI Safety Index,正好反映點解外界仍有保留。該指數評 Anthropic 為 C+、OpenAI 為 C、Google DeepMind 為 C;冇一間受評估實驗室高過 C+。
17
美國參議員 Bernie Sanders 認為「減速」仍然唔夠,主張暫停先進 AI 開發,同時禁止人工超級智能。 呢個立場比幾間實驗室提出嘅方案嚴厲得多,但正好凸顯自願減速同可執行限制之間嘅距離。
下一步應該睇乜?
真正值得留意嘅,唔係再多一份原則聲明,而係具體制度承諾:
- 公開管治章程;
- 已具名、獨立嘅評估員;
- 標準化能力與濫用測試;
- 審計存取權同披露規則;
- 模型發布門檻與補救要求;
- 對安全評估結果能否延後或阻止部署嘅清楚答案。
目前最穩妥嘅結論係:主要前沿 AI 實驗室正討論共通安全基建,亦愈來愈支持外部測試。討論最終會產生一個獨立、可執行嘅標準機構,抑或只係自願性業界論壇,仍然未有定論。
8
9
11