MAI-Cyber-1-Flash是一个50亿参数的模型,按当前AI标准来看规模相对较小。它源自微软的MAI-Code-1-Flash系列——而该系列本身又脱胎于微软在2026年6月发布的MAI-Thinking-1推理模型家族。该模型针对网络安全漏洞工作流进行了专门微调,涵盖漏洞发现、验证、分类和补丁生成等环节,运行在微软内部名为MDASH的扫描引擎之中。
微软声称,在MDASH引擎内运行的MAI-Cyber-1-Flash,在微软自研的CyberGym基准测试中取得了96% 的得分——该基准旨在测试漏洞检测、验证和修复能力——比Anthropic的Claude Mythos 5高出12个百分点(后者得分约84%)。微软还表示,这一配置相比完全依赖第三方前沿模型,可节省约50%的成本,因为自研模型承担了MDASH工作流中约90%的任务,仅将最复杂的边缘案例交由OpenAI的GPT-5.4等昂贵模型处理。
独立验证说明: 上述性能和成本数据均为微软单方面宣称。据Digital Applied报道,目前没有第三方独立验证96%的CyberGym得分,且CyberGym排行榜上的数据均由参与实验室自行提交。此外,《纽约时报》也指出,微软在发布前并未将模型提供给独立测试机构进行评估。
微软发布了MAI-Cyber-1-Flash的模型卡,记录了其安全校准、微调数据以及在MDASH引擎内的预期用途。该系统采用多模型辩论机制以及专用的验证管道,确保在将任何发现上报给人类工程师之前,消除所有误报。
MDASH(多模型智能体扫描引擎)是承载MAI-Cyber-1-Flash的底层系统。它协调多个大语言模型——包括微软自研模型、OpenAI的GPT-5.4以及其他模型——形成一个协同工作的扫描、验证与修复流水线。其模型路由逻辑将常规任务分配给成本更低的MAI-Cyber-1-Flash,仅将最困难的推理任务升级至更大模型处理。
在正式发布前,MDASH已在其实际运行中证明了价值:
这些漏洞是通过一种多模型辩论系统发现的——AI智能体在将发现上报给人类工程师之前,会相互争论某个发现是否确实可被利用。
Project Perception是构建在MDASH和MAI-Cyber-1-Flash之上的商业化平台。微软将其定位为一种“新型网络安全堆栈”,将信号、安全上下文、专用模型和智能体整合成一个持续学习的防御系统,旨在实现“以AI对抗AI”。
Project Perception部署了多个AI智能体团队,具体组织如下 :
该系统根据效率将任务路由到不同模型——它可以根据具体工作流步骤的需求,部署微软的MAI-Cyber-1-Flash、OpenAI的GPT-5.4或Anthropic的模型。
尽管初期专注于软件漏洞管理,微软表示Project Perception将扩展至更广泛的安全工作流——持续监控、威胁调查和自动修复——形成一个“持续学习防御系统”。
Project Perception将于2026年8月3日进入公开预览,面向已经测试MDASH智能体引擎的微软商业客户。初期将集成在Microsoft Defender中,并计划逐步推广至所有微软安全产品。
此次发布正值一场愈演愈烈的AI网络安全军备竞赛。Anthropic此前凭借其Claude Mythos安全模型占据了先机,而谷歌和OpenAI也在AI驱动的漏洞发现领域投入巨大。微软明确将此次发布定位为应对AI驱动攻击者的必要防御手段,认为传统安全工具已无法跟上步伐。
模型路由架构——同时使用小巧廉价的专业模型与昂贵的尖端模型——在成本上形成了竞争优势。面对AI安全工具预算压力的企业,将50%的成本削减视为重要卖点。
随着Project Perception于8月3日进入公开预览,且MDASH已在实战中验证(单个补丁周期发现16个真实CVE),微软押注的是:在企业采购决策中,实时的漏洞发现记录将比单纯的基准测试分数更重要。现在的问题是,独立的第三方验证能否支撑微软的宣称,以及企业需要多长时间才能信任一个AI系统持续探测自身基础设施。