英國未能在 Anthropic 的 Claude Mythos 5.1 發布前取得測試存取權,與其說是對英國技術能力的否定,不如說是對「存取權」問題的警訊:只要參與與否最終仍取決於開發商同意,國家評估機構就無法保證能及時、獨立檢視前沿模型。
歐盟資安署 ENISA 取得 Anthropic Mythos 5 與 OpenAI GPT-6 Astra 的測試權限,當然具有重要意義;但這不代表歐盟已享有測試所有後續模型的常設權利,更不表示它已取得 Mythos 5.1 的存取權。
9
20
關鍵不在「有沒有權限」,而在權限屬於哪一個模型
根據歐盟執委會發言人說法,ENISA 已獲准存取並測試 Mythos 5 和 GPT-6 Astra。
9 另一方面,報導指出 Anthropic 並未在 Mythos 5.1 上市前向英國 AI Security Institute 提供該模型進行測試;這也是首次有報導稱 Anthropic 未讓該英國機構參與重大模型的發布前測試。
20
23
不能因此把事件簡化成「歐盟勝、英國輸」。ENISA 的權限涉及兩個具名模型與特定安排;Mythos 5.1 則是另一項發布、存取限制也更嚴格。這顯示安全評估正按模型版本、能力、用途、司法管轄,以及開發商自行訂定的合作夥伴資格被切分。
為何 Mythos 5.1 是更棘手的治理案例
Anthropic 表示,Claude Fable 5.1 與 Claude Mythos 5.1 使用相同底層模型,但採取不同層級的安全防護。Fable 5.1 可普遍使用;Mythos 5.1 則僅透過「受信任存取計畫」提供,其防護設計主要用於支援資安與生命科學工作。
12
這已不只是一般產品測試。若模型定位於敏感的資安或科學研究,便會牽涉受控環境、濫用監測、人員審查與國家安全層級的資訊處理。報導稱,Mythos 5.1 初期僅向通過審核的美國組織開放。
18
24
現有證據無法證明 Anthropic 是因不信任英國或其評估機構,才未提供存取。受限計畫本身的設計、作業安全考量與對商業存取的控制,都可能是原因。然而結果仍值得重視:既有合作關係與評估機構的聲譽,並不足以保證能及時接觸高後果模型。
ENISA 的存取權反映了歐盟哪些籌碼?
相較於純自願制度,歐盟擁有更強的法律基礎。依歐盟《AI 法案》第 55 條,具系統性風險的通用 AI 模型提供者,必須按照標準化流程與工具執行模型評估、評估及減輕系統性風險、追蹤並通報重大事件,並確保適當程度的資安保護。
43
37
法案也設想在模型首次投放市場前進行評估,包括記錄在案的對抗測試;視情況可由內部或獨立外部單位執行。
35
34
不過,這些對供應商的義務,並不等於 ENISA 自動有權取得模型權重、不受限制的系統存取,或每一個前沿模型的發布前存取。ENISA 此次安排之所以重要,正因它看來既建立在與企業的協商合作上,也受惠於歐盟較廣泛的監管地位。
4
9
換言之,法規可提升歐盟要求提出證據、風險管理與合規的能力;但在測試具敏感資安、生物或自主代理能力的模型時,仍無法取代安全合作所必需的實務安排。
英國為何承擔較高風險
英國這次被排除於 Mythos 5.1 的發布前測試之外,突顯自願存取制度的上限。相關報導指出,Anthropic 未提供最新模型後,已有聲音主張應賦予英國 AI Security Institute 更明確的法定地位與權力。
23
自願模式在實驗室認為合作有價值時可以運作良好,也可能比僵化規則更迅速、技術彈性更大。但弱點在於可預測性不足:開發商可限制存取、改變合格夥伴範圍,或認定某模型應轉入更嚴格的國安管道。
這對英國形成戰略風險。若英國評估人員只能在模型上線後,或在其他政府與獲准夥伴完成測試後才取得系統,英國的角色可能從參與塑造安全證據,轉為接收別處產生的證據。
較具韌性的英國方案:受控、可稽核的存取
眼前的政策目標未必是強制交出模型權重。對能力極強的模型而言,那樣做本身也可能帶來安全與智慧財產風險。更合理的方向,是建立受控且可稽核的評估存取機制。
可考慮的措施包括:
- 針對指定前沿模型的部署前通報:若模型符合明確的能力或風險門檻,開發商須在部署前通知指定主管機關。
- 要求安全證據的法定權力:賦予英國 AI Security Institute 明確權限,取得安全案例、評估結果、事件資訊及相關技術文件。
- 安全評估環境:透過受監測 API、沙盒系統或其他受控環境提供有期限的存取,而非一概要求交出模型權重。
- 國家安全審查途徑:對可能在資安、生命科學或自主代理造成重大影響的模型,啟動整合資安、生物安全、情報與 AI 評估專業的協調審查。
- 制度化的歐盟合作:建立共享評估協議、互惠的安全測試管道及相容的重大事件處理流程,減少重複工作,也降低英國被排除在歐洲測試網絡之外的風險。
這些措施共同處理了本案揭示的核心問題:存取權必須被納入治理制度設計,不能完全依賴與個別實驗室的關係。
前沿 AI 測試很可能走向分級制度
未來較可能出現分層的評估架構:面向廣大市場的模型,將面對提供者測試、監管文件與事件通報義務;涉及資安、生物與自主代理能力的模型,則會愈來愈多在受限制環境中接受評估;最高風險系統,可能只開放給少數通過審查的政府、實驗室與安全夥伴。
ENISA 的安排與英國未獲 Mythos 5.1 存取權,正好說明此一差異為何重要。競爭焦點已不只是誰能打造最強模型,也包括誰能在更廣泛部署前,檢視、測試並治理最具影響力的版本。
9
12
20
對英國來說,技術評估能力依然不可或缺,但僅有能力並不足夠。若要維持影響力,英國還需要國內可靠的法定權力,以及能兼顧安全的跨國存取安排。