MAI-Cyber-1-Flash 是一個參數量僅 50 億 的模型,以當代 AI 標準來看屬於輕量級 。它源自微軟的 MAI-Code-1-Flash 系列,而該系列又繼承自 2026 年 6 月公布的 MAI-Thinking-1 推理模型家族 。此模型專為資安漏洞工作流程(包含發現、驗證、分類與修補程式生成)進行微調,並在微軟內部代號為 MDASH 的掃描引擎中運行 。
微軟表示,於 MDASH 內運行的 MAI-Cyber-1-Flash 在微軟自訂的 CyberGym 基準測試(專為測試漏洞偵測、驗證與修補能力而設計)中達到了 96% 的分數,比 Anthropic 的 Claude Mythos 5(約 84%)高出 12 個百分點 。此外,該配置還能帶來 約 50% 的成本節省,因為自家模型可處理約 90% 的 MDASH 工作流程任務,而 OpenAI 的 GPT-5.4 等昂貴模型僅保留給最複雜的邊緣案例 。
獨立驗證說明: 上述效能與成本數據皆為微軟自行對外宣稱。根據 Digital Applied 的報導,目前尚無第三方機構獨立驗證其 96% 的 CyberGym 分數,且該測試平台的排行榜分數均由參與的實驗室自行申報 。《紐約時報》也指出,微軟在發表前並未將此模型提供給獨立測試人員進行評估 。
微軟已發布 MAI-Cyber-1-Flash 的 模型卡,記錄了其安全校準、微調數據以及在 MDASH 引擎內的預期用途 。該系統採用 多模型間的辯論機制 以及 專用驗證管道,以確保任何發現送達人類工程師之前,都能消除誤判 。
MDASH(Multi-Model Agentic Scanning Harness,多模型代理式掃描引擎)是 MAI-Cyber-1-Flash 運作的底層系統。它統籌協調 多個大型語言模型(包括微軟自家的模型、OpenAI 的 GPT-5.4 等),執行一套協調式的掃描、驗證與修復工作流程 。其模型路由邏輯會將例行任務分配給成本較低的 MAI-Cyber-1-Flash,只有最困難的推理任務才會升級至較大的模型 。
在正式發表之前,MDASH 已在生產環境中證明其價值:
這些漏洞是透過 多模型辯論系統 發現的:AI 代理之間會先辯論某個發現是否可被利用,之後才會通報給人類工程師 。
Project Perception 是建立在 MDASH 和 MAI-Cyber-1-Flash 之上的商業平台。微軟將其定位為一個「新型網路安全堆疊」,結合了信號、安全情境、專用模型和代理,形成一個持續學習的防禦系統,旨在實現「以 AI 對抗 AI」。
Project Perception 部署了多組 AI 代理團隊,組織方式如下 :
系統會 根據效率在不同模型間分配任務——它可以根據特定工作流程步驟的需要,部署微軟的 MAI-Cyber-1-Flash、OpenAI 的 GPT-5.4 或 Anthropic 的模型 。
雖然初期專注於軟體漏洞管理,微軟表示 Project Perception 未來將擴展至更廣泛的安全工作流程,包括持續監控、威脅調查和自動化修復,形成一個「持續學習的防禦體系」。
Project Perception 將於 2026 年 8 月 3 日 針對已參與 MDASH 代理引擎測試的微軟商業客戶開放 公開預覽 。初期將內建於 Microsoft Defender 中,並計劃逐步部署至所有 Microsoft Security 產品 。
此次發表正值 AI 資安軍備競賽 白熱化之際。Anthropic 先前已憑藉其 Claude Mythos 安全模型設下了高標,而 Google 和 OpenAI 也在 AI 驅動的漏洞發現領域投入大量資源 。微軟明確將此次發表定位為「以 AI 驅動的防禦來對抗 AI 驅動的攻擊」,並主張傳統安全工具已無法跟上腳步 。
這種 模型路由架構——使用輕量、低成本的專業模型搭配昂貴的尖端模型——是一項成本上的競爭優勢。面臨 AI 安全工具預算壓力的企業,視 50% 的成本節省為主要賣點 。
隨著 Project Perception 將於 8 月 3 日進入公開預覽,且 MDASH 已在生產環境中於一個修補週期內發現 16 個真實世界的 CVE,微軟賭的是:在企業採購決策中,實際的漏洞發現紀錄 將比單純的基準測試分數更具說服力 。接下來的關鍵問題在於,是否有第三方機構能獨立驗證微軟的主張——以及企業願意在多大程度上信任 AI 系統來持續探查自己的基礎架構。