白宮要求Anthropic未來推出嘅AI模型要「零越獄漏洞」,即係完全冇任何方法繞過安全機制。 AI研究人員一致認為呢個要求技術上冇可能做到,因為越獄係一個數學上嘅根本限制,唔係一個可以修復嘅bug。 事件由Amazon舉報觸發,美國政府首次對已公開嘅商用AI模型實施出口管制,樹立危險先例。

Create a landscape editorial hero image for this Studio Global article: What is the nature of the White House's demand that Anthropic block all possible jailbreaks of its advanced AI models, why is this technical. Article summary: Here is a comprehensive breakdown of the dispute between the White House and Anthropic as of June 2026.. Topic tags: general, government, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrat
2026年6月12號,美國商務部出咗一份史無前例嘅出口管制命令,要求Anthropic即刻停止向「任何外國國民,無論喺美國境內定境外」提供佢哋新推出嘅Fable 5同Mythos 5模型 。原因係NSA同其他機構發現可以「越獄」Fable 5——即係繞過佢嘅安全護欄——令政府擔心外國敵對勢力會利用呢個模型
。
除咗出口禁令,白宮仲提出咗一個更加苛刻嘅要求:如果Anthropic想繼續推出前沿模型,就要保證零越獄漏洞——即係要完全阻擋所有繞過安全機制嘅可能性 。呢個係一個絕對標準:唔可以有任何情況下嘅繞過
。
業界同學術界嘅AI研究人員都一致認為,「零越獄漏洞」呢個要求係目前技術做唔到嘅 。原因係大型語言模型嘅數學基礎本身就有限制。
越獄悖論。 一份2024年嘅arXiv論文(2026年5月更新)正式證明咗兩個悖論:第一,冇可能建立一個完美嘅越獄偵測器;第二,一個較弱嘅模型冇辦法持續偵測到一個更強嘅模型係咪被越獄咗 。呢個唔係可以修復嘅bug,而係數學上嘅根本限制。
對抗性軍備競賽,唔係一個可以解決嘅問題。 越獄本身係一個對抗性問題。攻擊者不斷發現新嘅提示模式、編碼技巧同多輪策略嚟避開現有嘅過濾器。當一種越獄方法被修補,新嘅變種就會出現 。
自動化越獄擴展。 2026年3月喺《自然通訊》發表嘅研究發現,大型推理模型而家可以成為自動化越獄代理,喺所有測試嘅模型組合中成功率高達97.14% 。攻擊面係喺度擴大,而唔係縮細。
專家共識。 安全專家話,完全阻擋越獄「會令所有前沿AI部署停擺」——呢個標準唔係一個修復bug嘅目標,而係一個存在性嘅不可能 。
呢個要求唔係憑空出現嘅。佢係跟住一條清晰嘅政府施壓軌跡:
之前同五角大樓嘅衝突。 Anthropic早已經因為同五角大樓嘅互動而同美國政府有拗撬,國防部將佢哋列為「供應鏈風險」,指示聯邦機構限制或停止使用佢哋嘅產品 。
Amazon嘅觸發點。 Amazon CEO Andy Jassy據報向白宮通報咗Fable 5嘅具體安全憂慮,加速咗政府嘅介入 。另外至少仲有五間公司亦發出警報
。
突然嘅停用。 6月12號美國東岸時間下午5點21分,Anthropic收到商務部嘅信。到大約晚上10點,兩個模型已經對全球所有客戶停用——呢個係美國首次對一個已經公開使用嘅商用AI模型實施出口管制 。
TechCrunch將成件事定性為一個政治操作,「從來都唔係關於AI越獄」——係一個信號,顯示政府願意單方面決定一個AI模型係咪危險到唔可以營運 。
根據多個媒體報導,白宮嘅立場係:Anthropic嘅Fable 5模型要返嚟,除非公司令越獄變成冇可能 。呢個唔係要求逐步改善或者分級漏洞管理——而係一個絕對嘅二分法:如果存在任何越獄,個模型就唔可以推出
。
Anthropic反駁話,「到目前為止冇測試人員能夠搵到一個通用越獄」,而且「完全避免任何越獄對佢哋或者任何其他公司嚟講都係冇可能嘅」。公司仲話「甚至冇收過任何關於一個令人憂慮嘅非通用越獄嘅披露,而呢啲越獄係導致有害結果嘅」
。
根據多個媒體報導,Anthropic面對三條主要嘅戰略路徑:
1. 順從同談判。 CEO Dario Amodei喺6月15號同白宮官員會面,商討一個雙方都可以接受嘅漏洞評估框架——用分級嚴重性標準嚟取代零越獄嘅絕對要求 。白宮同Anthropic據報正合作制定一個評估安全漏洞嚴重程度嘅框架
。呢個係Anthropic目前似乎正在採取嘅路徑。
2. 司法或政治挑戰。 Anthropic可以喺法庭挑戰出口管制,指控政府超越咗法定權力,或者對一個已經公開嘅商業產品追溯實施出口管制,違反咗正當程序 。呢個係高風險、高回報嘅做法,可能會創下標誌性先例。
3. 重組或搬遷業務。 Anthropic可以將模型發佈限制喺監管環境更可預測嘅司法管轄區,或者重組公司架構,將面向美國同面向全球嘅產品分開。有分析將呢個形容為「核選項」,會根本性改變Anthropic嘅商業模式。
呢場爭拗具體展現咗三個將會定義前沿AI未來嘅根本矛盾:
技術現實 vs. 監管絕對主義。 政府要求一個保證——零越獄——而電腦科學話呢個係冇可能嘅 。如果政府堅持呢個標準,佢實際上就對任何前沿模型嘅推出有否決權,因為冇任何實驗室可以達到呢個門檻。
對公開軟件實施出口管制。 美國首次對一個已經公開嘅商用AI模型實施出口管制 。呢個開創咗一個先例:任何AI實驗室都可以畀人基於單方面嘅國家安全判斷,命令佢哋一晚之間關閉一個產品。
獨立 vs. 事實監督。 Anthropic當初成立嘅時候,強調以使命為導向嘅安全性同獨立性。白宮嘅行動顯示,即使係最「負責」嘅實驗室,都可以被迫遵從技術上唔現實嘅政府標準——或者就係直接被迫熄機 。正如彭博所講,呢次封鎖標誌住「美國嘅轉向」同「對矽谷嘅警告」,表示自我監管嘅前沿AI部署時代可能已經結束
。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
白宮要求Anthropic未來推出嘅AI模型要「零越獄漏洞」,即係完全冇任何方法繞過安全機制。
白宮要求Anthropic未來推出嘅AI模型要「零越獄漏洞」,即係完全冇任何方法繞過安全機制。 AI研究人員一致認為呢個要求技術上冇可能做到,因為越獄係一個數學上嘅根本限制,唔係一個可以修復嘅bug。
事件由Amazon舉報觸發,美國政府首次對已公開嘅商用AI模型實施出口管制,樹立危險先例。