Anthropic 喺 2026 年 9 月 10 日發表嘅威脅情報報告,涵蓋 2025 年 12 月至 2026 年 8 月、共八個月內公司聲稱偵測並截斷嘅行動。當中有人嘗試利用 Claude Haiku、Sonnet 及 Opus,涉及網絡行動、影響力行動、監控、騙案及詐騙、生物濫用、常規武器研發,以及非法模型蒸餾七個範疇。
16
不過,讀呢份報告要先捉緊一個關鍵:佢記錄嘅係嘗試取得 AI 協助,並唔等於報告已證實有關武器、監控系統或生物項目最終成功落地。Anthropic 亦表明,公開嘅係具代表性嘅重點個案,唔係 Claude 日常使用情況嘅統計縮影。
16
報告揭示咗乜嘢風險?
報告最核心嘅警告係:能力較強嘅模型,可能降低從事有害行為所需嘅專業知識、時間同人手門檻。喺披露個案中,相關人士尋求協助嘅工作,由研究同軟件開發,一直到目標材料及行動分析都有。
1
16
武器同監控:AI 唔止係寫 code
報道指,個案牽涉自主式單程攻擊無人機軟件、導彈導航系統,以及與俄羅斯、伊朗、中國和也門有關人士連結嘅軍事應用嘗試。
1
材料亦包括涉嫌透過 WhatsApp 和 Telegram 識別及鎖定維吾爾人,以及馬里一個大規模電訊監控系統。呢啲例子反映,模型嘅風險唔只在於生成程式碼,亦可以被用作資料研究、分類、分析同撰寫行動文件。
1
16
生物濫用:五宗嘗試,以及「轉場」問題
Anthropic 指出曾發現五宗生物濫用個案;其中一宗據報與嘗試提升一種蚊傳病毒嘅傳播能力有關。
1
公司亦稱,部分使用者被 Claude 拒絕敏感請求後,會轉而尋找其他 AI 系統。呢點唔代表佢哋喺其他平台成功,但說明單一供應商嘅拒答機制有其局限:可以中斷某一服務上嘅行為,卻未必能令行為完全消失。
1
非法模型蒸餾:競爭對手點樣抽取能力
另一部分講嘅係非法模型蒸餾,即利用較強模型嘅輸出,協助訓練另一套系統。Anthropic 將相關行動歸因於七間以中國為基地嘅實驗室,包括阿里巴巴、Moonshot 和 DeepSeek;報告形容對方透過大量帳戶及轉發提示詞,取得有用嘅模型輸出或推理內容。
1
呢類行為同武器或監控唔同,但對 AI 開發商一樣係策略風險:模型存取權可能被利用來複製能力,並迴避自行開發所需嘅成本。
涉及邊幾款 Claude?
Anthropic 表示,已披露嘅濫用個案涉及 Claude Haiku、Sonnet 同 Opus。較新嘅 Fable 及 Mythos 模型類別並無出現喺呢啲個案之中,但模型蒸餾部分有一宗例外。
12
16
所以,將報告概括成「Fable 同 Mythos 完全冇被涉及」並唔準確;較嚴謹嘅講法係:除咗一宗蒸餾個案外,佢哋未有出現於已披露嘅濫用案例。
12
Anthropic 做咗乜,以及證據去到邊?
Anthropic 表示已截斷有關行動、封禁相關帳戶、加強防禦措施,並在適當情況下向執法機關及業界伙伴分享資訊。
16
但報告始終係公司根據自己平台觀察所得嘅帳目。佢係了解 Anthropic 偵測到甚麼、又如何回應嘅重要證據,卻唔應被視為對每一名涉嫌行動者完成目標嘅獨立確認。公司本身亦將其定位為值得留意嘅個案集合,而唔係所有濫用情況嘅代表性調查。
16
點解引出「為前沿技術定速」?
報告發布兩日後,Anthropic 行政總裁 Dario Amodei 發表文章 We Must Pace the Frontier,主張 AI 公司應刻意放慢前沿模型能力提升嘅步伐,讓對齊、安全防護同驗證工作有時間追上。
25
佢所講嘅唔係停止訓練模型或停止技術進步。Anthropic 提出嘅首項具體承諾,係向第三方評估員提供長期、與員工同級別嘅系統存取權,讓對方檢視安全措施、報告事故,並在訓練期間評估模型對齊情況。
18
25
其三步建議包括公司層面監督、民主國家企業之間協調,以及最終更廣泛嘅國際協調。
23
25
已知事實,同未能證實嘅說法
現有資料支持嘅結論係:Anthropic 稱在指定期間發現並截斷舊一代 Claude 模型被嘗試用於七類有害活動,亦以此作為安全控制必須跟住模型能力演進嘅實例。
16
但現有報道未能證實該報告直接促成任何特定美國國會行動、令眾議院結束休會,或者導致針對「超級智能」嘅具體立法禁令。AI 安全監管壓力確實正在增加,而 Amodei 亦主張政府協助令能力發展同安全保持平衡;不過,將個別政治行動直接歸因於此報告,仍需要更多證據。
25
27
對一般使用者同政策制定者而言,重點其實好實際:防範 AI 濫用,唔可以只靠模型對危險提示詞講「唔得」。隨住能力提升,仲需要監測協同行為、應對帳戶規避及模型蒸餾、分享威脅情報,並令安全評估真正可信。
16
25