簡單講,Mythos 特別擅長做兩件事:
這類能力對紅隊測試(red teaming)或漏洞研究尤其有價值。
但目前公開證據亦指出,Mythos 未能取代資深安全分析師。
AISI 的評估顯示,模型可以協助找漏洞或提供 exploit 思路,但在以下環節仍需要人類專家:
另一個現實問題是 誤報(false positives)。AI 可能一次過提出大量疑似漏洞,但安全團隊仍需逐一驗證,否則會造成「漏洞分流過載」。
此外,一些聲稱 Mythos 找到「數千個高嚴重度漏洞」的數據主要來自 Anthropic 或相關報告,除非有更多獨立重現,否則仍應視為供應商聲明 。
市場上不少報道將 Mythos 描述成網絡安全 AI 的「領先者」,但政府測試顯示差距可能沒有想像中大。
AISI 在對 OpenAI GPT‑5.5 的網絡安全評估中指出,另一個開發商的模型已經達到 相近水平的表現 。
在同類型網絡任務測試中:
一些第三方分析亦報告兩者在高難度任務上的通過率接近,但完整數據仍需官方公開報告確認 。
另外亦有研究指出,在某些漏洞測試場景中,較小或開源模型配合專門工具 亦能復現部分類似能力,顯示真正的護城河可能在整體工具鏈,而不只是模型本身 。
Mythos 引發各國金融監管機構關注,其中一個原因是 AI 可能同時強化攻擊者與防守方。
例如:
背後邏輯其實很直接:如果 AI 可以更快找到漏洞,金融機構希望 先自己發現並修補,而不是等攻擊者利用。
AISI 長期追蹤 AI 在網絡安全領域的能力變化。他們的數據顯示,在其測試環境中,AI 能夠獨立完成的網絡任務長度 自 2024 年以來平均每約 4.7 個月翻倍 。
英國國家網絡安全中心(NCSC)亦指出,前沿 AI 已經能夠在某些攻擊步驟上提供實際幫助,例如:
這意味著網絡安全正逐漸進入一種 AI 軍備競賽:防守者希望利用 AI 找漏洞,而監管機構則擔心同樣技術會降低網絡攻擊門檻。
綜合目前政府測試與公開資料,Mythos 的合理定位是:
高槓桿的安全研究助手,而非完全自動化的防禦系統。
它在漏洞發現和攻擊流程推理方面確實非常強,但真正的挑戰仍包括:
而隨著 GPT‑5.5 及其他模型迅速追上,未來網絡安全 AI 的競爭,很可能不只是模型能力,而是 整個工具鏈、成本與部署方式 的較量。