MAI-Cyber-1-Flash 係一個得 50 億參數嘅模型,以今日嘅標準嚟講算係細細粒,但係佢嘅來頭唔細,係由 MAI-Code-1-Flash 改進而嚟,而 MAI-Code-1-Flash 本身又係嚟自 Microsoft 喺 2026 年 6 月發布嘅旗艦推理模型家族 MAI-Thinking-1 。Microsoft 將呢個模型專門針對網絡安全工作流程(包括發現漏洞、驗證、分類同埋自動產生修補程式)進行微調,並且整合咗落佢哋內部研發嘅 MDASH 引擎入面 。
根據 Microsoft 嘅講法,MAI-Cyber-1-Flash 配合 MDASH 引擎喺自家嘅 CyberGym 基準測試入面取得咗 96% 嘅分數,比 Anthropic 嘅 Claude Mythos 5(大約 84%)高出 12 個百分點 。而且,因為呢個自家模型可以處理大約九成嘅 MDASH 工作流程,淨係將最複雜嘅邊緣案例留返畀 OpenAI 嘅 GPT-5.4 呢類大型模型,所以整體成本可以 慳返大約一半 。
留意返: 以上呢啲效能同成本數字都係 Microsoft 單方面嘅講法。根據 Digital Applied 嘅報導,至今未有第三方獨立機構驗證過呢個 96% 嘅 CyberGym 分數,相關嘅排行榜數據都係由參與嘅實驗室自行申報 。《紐約時報》都指出,Microsoft 喺發布前冇將呢個新模型交畀獨立測試機構做評估 。
Microsoft 為 MAI-Cyber-1-Flash 發布咗一份 Model Card,詳細記錄咗佢嘅安全校準數據、微調資料嘅來源,同埋喺 MDASH 引擎入面嘅預期用法 。成個系統採用咗一個「多模型辯論機制」,即係由幾個 AI 模型互相爭論一個漏洞係咪真正可以利用,加上一個專用嘅「證明管道」嚟消除誤報,確保最後送到人類工程師手上嘅結果係高可信度嘅 。
MDASH(Multi-Model Agentic Scanning Harness)係 MAI-Cyber-1-Flash 嘅運行平台。佢嘅角色係一個「模型指揮官」,協調多個大型語言模型——包括 Microsoft 自家模型、OpenAI 嘅 GPT-5.4 同其他模型——一齊進行掃描、驗證同修復 。佢嘅模型路由邏輯好聰明:簡單例行嘅任務就派畀平啲嘅 MAI-Cyber-1-Flash 去做,淨係將最難嘅推理任務先交畀更大、更貴嘅模型處理 。
MDASH 喺正式發布之前,已經喺 Microsoft 內部證明咗自己嘅價值:
呢啲漏洞係透過一個「多模型辯論系統」搵出嚟嘅:AI 代理之間會先辯論一個發現係咪真係可以被利用,先至會升級畀人類工程師處理 。
Project Perception 係一個建基於 MDASH 同 MAI-Cyber-1-Flash 嘅商業化平台。Microsoft 將佢定位為一個「全新嘅網絡堆疊」,結合訊號、安全情境、專門模型同代理,組成一個能夠持續學習嘅防禦系統,去應付「用 AI 對付 AI」嘅新時代威脅 。
Project Perception 會派出唔同類型嘅 AI Agent 團隊,模擬人類安全團隊嘅分工 :
成個系統會根據效率嚟分配任務——佢可以決定用 Microsoft 嘅 MAI-Cyber-1-Flash、OpenAI 嘅 GPT-5.4,或者 Anthropic 嘅模型,邊個最適合做當前呢一步工作就用邊個 。
雖然初期會集中喺軟件漏洞管理,但 Microsoft 話 Project Perception 最終會擴展到更廣泛嘅安全工作流程,包括持續監控、威脅調查同自動化修復,形成一個「持續學習嘅防禦系統」 。
Project Perception 將會喺 2026 年 8 月 3 日開始公開預覽,對象係已經喺度測試 MDASH 代理引擎嘅 Microsoft 商業客戶 。初期會內置喺 Microsoft Defender 入面,之後會逐步擴展到所有 Microsoft 安全產品 。
今次 Microsoft 嘅發布,正值一場日益激烈嘅 AI 網絡安全軍備競賽。Anthropic 之前憑住 Claude Mythos 安全模型搶咗頭啖湯,而 Google 同 OpenAI 亦都喺 AI 漏洞發現方面投入大量資源 。Microsoft 明確指出,而家嘅傳統安全工具已經追唔上 AI 驅動嘅攻擊速度,必須要用 AI 嚟防禦 AI 。
呢種「模型路由架構」——一個細、平嘅專門模型,配合一個貴、勁嘅前沿模型——係成本上嘅重要競爭優勢。對於面對 AI 安全工具預算壓力嘅企業嚟講,一半嘅成本節省係好大嘅吸引力 。
隨住 Project Perception 喺 8 月 3 日公開預覽,加上 MDASH 已經喺一個 Patch Tuesday 入面發現 16 個真實世界嘅 CVE,Microsoft 嘅策略係賭緊:企業做購買決定嗰陣,會更睇重「真實嘅漏洞發現戰績」,而唔係單單睇基準測試分數 。而家最大嘅問題係,究竟呢啲由 Microsoft 單方面公布嘅數字,會唔會有獨立驗證嚟撐腰?企業又會唔會咁快就放心交一個 AI 系統去不斷 probe 自己嘅 Infrastructure 呢?