Anthropic 於 2026 年 9 月 10 日發布的威脅情報報告指出,其團隊在 2025 年 12 月至 2026 年 8 月這八個月間,發現並阻止多起試圖濫用 Claude 的行動。涉案模型包括 Claude Haiku、Sonnet 與 Opus,範圍涵蓋網路行動、影響力行動、監控、詐騙與欺詐、生物濫用、常規武器開發,以及非法模型蒸餾等七類風險。
16
首先要釐清的是:報告記錄的是有人嘗試取得 AI 協助,並不是對相關武器、監控系統或生物計畫已在現實世界成功部署的獨立驗證。Anthropic 也將這些內容定位為具代表性的個案,而非 Claude 日常使用情況的統計縮影。
16
報告傳達的關鍵警訊
Anthropic 的整體判斷是,高能力模型可能降低從事有害活動所需的專業知識、時間與人力。在已公開的案例中,行動者尋求 AI 協助的工作,從資料研究、軟體開發,一直到目標資訊整理與行動分析都有。
1
16
換句話說,風險不只在於「模型會不會直接寫出惡意程式碼」。它也可能協助整理資料、分類目標、分析情境,以及產製可支援行動的文件;這些看似零散的工作,一旦被串接,就可能大幅降低複雜行動的執行門檻。
武器與監控:從無人機到通訊資料追蹤
報導指出,最嚴重的指控包括有人嘗試利用 Claude 支援常規武器與監控工作,涉及自主單程攻擊無人機軟體、飛彈導航系統,以及與俄羅斯、伊朗、中國和葉門相關行動者有關的軍事應用。
1
個案材料也包括:涉嫌透過 WhatsApp 與 Telegram 辨識、鎖定維吾爾族人士的活動,以及馬利一套大規模電信監控系統。這套系統被描述為可監看 2,500 萬張 SIM 卡。這些案例凸顯,模型的用途不僅是產生程式碼,也可能被用在研究、分類、分析與撰寫行動文件。
1
16
生物濫用:拒答能中斷請求,卻未必能終止意圖
Anthropic 識別出五起生物濫用案例。據相關報導,其中一例涉及試圖提高一種蚊媒病毒傳播力的工作。
1
公司也表示,部分使用者在 Claude 拒絕敏感請求後,轉而尋找競爭對手的 AI 系統。這並不能證明那些嘗試後來在其他平台成功,但它點出一項現實限制:單一供應商的拒答機制,可以中斷某個服務上的操作,卻未必能阻止行動者改用其他工具。
1
非法模型蒸餾:另一種不靠「直接攻擊」的濫用
報告另有一節聚焦非法模型蒸餾,也就是利用能力較強模型的輸出,協助訓練另一個系統。Anthropic 將相關行動歸因於七家中國境內實驗室,並點名阿里巴巴、月之暗面(Moonshot)與 DeepSeek;報告稱,這些行動利用大量帳號與轉送提示詞,取得可用的模型輸出或推理內容。
1
這與武器或監控並非同一類風險,但對 AI 開發商同樣具有戰略意義:模型存取權可能被用來複製能力,並在一定程度上繞過自行研發所需的成本與時間。
哪些 Claude 模型牽涉其中?
Anthropic 表示,已披露的濫用案件涉及 Claude Haiku、Sonnet 與 Opus。較新的 Fable 與 Mythos 模型類別並未出現在這些濫用案例中,但有一個例外:非法蒸餾案件。
12
16
因此,若直接說 Fable 與 Mythos「完全沒有涉及」報告並不精確。較準確的說法是:除了那起蒸餾例外,這兩個模型類別沒有出現在已披露的濫用案例中。
12
Anthropic 怎麼處理?證據又能說明到哪裡?
Anthropic 表示,公司已中斷相關行動、停用涉案帳號、加強防禦措施,並在適當情況下與政府機關及產業夥伴分享資訊。
16
不過,這仍是一份由公司依據自身平台觀測資料製作的報告。它對於理解 Anthropic 偵測到什麼、如何因應,具有重要價值;但不應被解讀為每一名被指稱行動者都已完成其原定計畫的獨立證明。Anthropic 本身也強調,報告列舉的是值得注意的案例,而非所有濫用活動的代表性樣本。
16
為何報告後出現「放慢前沿」的呼籲?
報告發布兩天後,Anthropic 執行長 Dario Amodei 發表〈We Must Pace the Frontier〉,主張 AI 公司應刻意放緩提升前沿模型能力的速度,讓對齊、安全防護與驗證工作有時間追上。
25
這不等於停止訓練模型或凍結技術進步。Amodei 提出的第一項具體承諾是,Anthropic 將讓第三方評估人員取得常設、員工等級的系統存取權,以檢視安全作法、通報事故,並在訓練期間評估模型對齊狀況。
18
25
他的三步方案則涵蓋公司內部層級的監督、民主國家企業之間的協調,以及最終更廣泛的國際協調。
23
25
已確立的事實,以及尚未證實的說法
這份報告能確立的是:Anthropic 表示,它在所述期間偵測並阻止了針對較舊 Claude 模型的惡意使用嘗試,涵蓋七類危害領域。報告也具體呈現了該公司為何主張,模型能力提高時,安全控制也必須同步演進。
16
但現有資料無法證實這份報告直接促成特定的美國國會行動、結束眾議院休會,或導致針對「超級智慧」的具體立法禁令。AI 安全監管確實正面臨更大政治壓力,Amodei 也主張政府應協助讓能力進展與安全維持平衡;但要把特定政策結果直接歸因於這份報告,仍需要更多證據。
25
27
更實際、也更重要的結論是:防止 AI 濫用,不能只靠模型拒絕危險提示詞。它還需要持續監測協同行動與帳號規避、回應模型蒸餾企圖、共享威脅情報,並在模型能力持續躍升時,建立可信的安全評估機制。
16
25