但如果「獨特」指的是便宜公開模型完全無法做出類似資安推理,公開證據就弱得多。Aisle 測試了 Anthropic 展示的漏洞案例:先把相關程式碼隔離出來,再交給小型、便宜的開放權重模型分析;結果顯示,這些模型能找回相當一部分相同分析 。
Mythos 最清楚的優勢,不是單次問答,而是長時間跨度的工作:漏洞發現、漏洞利用、逆向工程,以及需要規劃、使用工具、串接多個步驟的模擬入侵。AISI 特別提到 Capture-the-Flag(CTF,資安奪旗賽)任務與多步驟攻擊模擬,並把 Mythos 放在「AI 模型資安能力快速提升」的大趨勢下解讀 。
Anthropic 自家的紅隊報告說得更強,稱 Mythos 在多類資安任務上表現突出,包括在真實開源程式碼庫中發現零日漏洞、對閉源軟體進行逆向工程並形成利用方式,以及把 N-day 漏洞轉成可運作的 exploit 。不過,同一份報告也說,由於超過 99% 被發現的漏洞尚未修補,公開細節受到限制,因此外部讀者無法獨立檢視多數案例 。
低成本模型的反駁點,不是說小型開放權重系統已經能像 Mythos 一樣自主行動。重點在於:AI 的資安能力可能很「鋸齒狀」——某個模型在一些任務上很弱,卻可能在範圍明確、材料準備好的漏洞分析中出人意料地有用。Aisle 的測試顯示,只要先把相關程式碼隔離出來,小型、便宜的開放權重模型也能在 Mythos 展示的部分漏洞案例中重現不少分析 。
科技媒體 Tom’s Hardware 對公告後的討論也做了類似總結:Mythos 可能是目前整體資安能力最強的 AI 模型之一,但在某些找 exploit 與修補漏洞的任務上,便宜模型也能達到相近結果;同時,可靠性與可用時間仍是問題 。
這個差別很重要。能在已切好的程式碼片段上做出相似分析,不等於能自主探索網路、連接多個攻擊步驟、利用漏洞並完成模擬入侵。公開證據最能支持的,是 Mythos 在這類更長、更像代理人行為的工作流上有領先 。
從目前證據看,最合理的解釋不是「模型本身獨一無二」,而是模型加上資安專用支架:工具、執行環境、存取權限、上下文選擇、提示設計,以及專家審查。Aisle 明確主張,護城河在於「把深度安全專業嵌入其中的系統」,而不是模型本身 。AISI 的評估也凸顯了設定的重要性,因為 Mythos 最強的行為是在受控條件下、被明確指示並取得網路存取時出現 。
存取權限也是故事的一部分。Bain 的分析把 Claude Mythos Preview 描述為具備嚴肅資安能力的前沿模型,能力強到 Anthropic 將其釋出限制在名為 Project Glasswing 的受審核合作夥伴計畫中 。因此,實務上的比較不是單純問哪個公開 API 比較便宜,而是要問:可取得的模型、工具與專業能力,能否重建同等工作流 。
現在還沒有乾淨的公開「同場競技」價格/效能基準,能在完全相同條件下比較 Mythos、低成本 API 與開放權重模型。AISI 評估的是受控環境中的 Mythos,並將其與先前前沿模型的進展相比 。Anthropic 提供了詳細但由開發者撰寫的紅隊證據 。Aisle 則提供較窄的反向測試,聚焦在 Anthropic 展示過的部分漏洞案例 。這些資料都重要,但回答的是不同問題。
真正理想的比較,必須固定工具存取、程式碼上下文、網路權限、嘗試次數、運算預算、exploit 執行規則與人類審查程度。少了這些條件,無論說 Mythos 已形成不可追趕的護城河,或說便宜模型已經全面追上,都還太早 。
| 使用情境 | 證據最合理的讀法 |
|---|---|
| 自主紅隊式工作流 | Mythos 級系統看來明顯領先,尤其是模型必須搭配工具與網路存取,自己規劃並執行多個步驟時 。 |
| 有界限的程式碼漏洞初篩 | 當相關程式碼已準備好、流程夠窄時,便宜或開放權重模型可能已經有實用價值 。 |
| 企業 AI 風險規劃 | 不應把 Mythos 視為一次性異常。Bain 認為 Mythos 的風險很嚴肅,但其他前沿系統已具備部分可比能力,或很可能跟上 。 |
| 模型評估 | 不要只比較模型名稱,要比較完整系統。工具、支架、上下文與人類專業都可能改變結果 。 |
Claude Mythos 的資安能力在需要自主性與多步驟執行時看起來相當突出。但公開紀錄還沒有證明,它的底層資安推理能力是便宜模型完全無法取得的獨家資產。比較穩妥的結論是:Mythos 在複雜資安工作流上確實領先;而低成本模型若搭配良好工具與專家監督,也能在範圍明確的分析任務中覆蓋令人意外的一部分能力 。