MAI-Cyber-1-Flash es un modelo de 5 mil millones de parámetros, lo que lo hace relativamente pequeño para los estándares modernos de IA . Se deriva de la línea MAI-Code-1-Flash, que a su vez desciende de la familia de modelos de razonamiento MAI-Thinking-1 de Microsoft, anunciada en junio de 2026 . El modelo fue ajustado específicamente para flujos de trabajo de vulnerabilidades de ciberseguridad, incluyendo descubrimiento, validación, clasificación y generación de parches, todo dentro del arnés de escaneo interno de Microsoft conocido como MDASH .
Microsoft informa que MAI-Cyber-1-Flash, ejecutándose dentro de MDASH, alcanza un 96% en el benchmark CyberGym, un benchmark personalizado de Microsoft diseñado para probar la detección, validación y parcheo de vulnerabilidades. Esto es 12 puntos porcentuales por encima de Claude Mythos 5 de Anthropic (que obtuvo aproximadamente un 84%) . Según Microsoft, la configuración también ofrece un ahorro de costos de aproximadamente el 50% en comparación con depender únicamente de modelos fronterizos de terceros, ya que el modelo interno maneja alrededor del 90% de las tareas del flujo de trabajo de MDASH, reservando modelos costosos como GPT-5.4 de OpenAI solo para los casos extremos más complejos .
Nota de verificación independiente: Estas cifras de rendimiento y costo son afirmaciones del proveedor (Microsoft). Según informes de Digital Applied, ningún tercero ha verificado de forma independiente la puntuación del 96% en CyberGym, y las entradas del leaderboard de CyberGym son autoinformadas por los laboratorios participantes . The New York Times también señaló que Microsoft no compartió el modelo con evaluadores independientes para su evaluación antes del lanzamiento .
Microsoft publicó una Model Card para MAI-Cyber-1-Flash que documenta su calibración de seguridad, datos de ajuste fino y uso previsto dentro del arnés MDASH . El sistema utiliza un mecanismo de debate entre múltiples modelos más un pipeline de prueba dedicado para eliminar falsos positivos antes de que cualquier hallazgo llegue a un ingeniero humano .
MDASH (Multi-Model Agentic Scanning Harness) es el sistema subyacente en el que opera MAI-Cyber-1-Flash. Orquesta múltiples LLM, incluido el modelo de Microsoft, GPT-5.4 de OpenAI y otros, en un flujo de trabajo coordinado de escaneo, validación y remediación . La lógica de enrutamiento de modelos asigna tareas rutinarias al MAI-Cyber-1-Flash, más económico, y escala solo las tareas de razonamiento más difíciles a modelos más grandes .
MDASH ya ha demostrado su valor en producción, antes del anuncio formal:
Las vulnerabilidades se encontraron utilizando un sistema de debate multimodelo en el que los agentes de IA discutían si un hallazgo era explotable antes de escalarlo a ingenieros humanos .
Project Perception es la plataforma comercial construida sobre MDASH y MAI-Cyber-1-Flash. Microsoft lo posiciona como un "nuevo stack cibernético" que combina señales, contexto de seguridad, modelos especializados y agentes en un sistema de defensa de aprendizaje continuo diseñado para "usar la IA para defenderse de la IA" .
Project Perception despliega equipos de agentes de IA organizados como :
El sistema enruta tareas entre modelos según la eficiencia: puede desplegar MAI-Cyber-1-Flash de Microsoft, GPT-5.4 de OpenAI o modelos de Anthropic, según cuál sea el más adecuado para el paso del flujo de trabajo específico .
Aunque inicialmente se centra en la gestión de vulnerabilidades de software, Microsoft describió Project Perception como una expansión hacia flujos de trabajo de seguridad más amplios: monitoreo continuo, investigación de amenazas y remediación automatizada, formando un "sistema de defensa de aprendizaje continuo" .
Project Perception entra en vista previa pública el 3 de agosto de 2026 para los clientes empresariales de Microsoft que ya están probando el arnés de agente MDASH . Inicialmente estará disponible dentro de Microsoft Defender, con planes de implementarse en todos los productos de Microsoft Security .
El lanzamiento del lunes se produce en medio de una carrera armamentista de IA en ciberseguridad cada vez más intensa. Anthropic había marcado previamente el ritmo con su modelo de seguridad Claude Mythos, mientras que Google y OpenAI también estaban invirtiendo fuertemente en el descubrimiento de vulnerabilidades impulsado por IA . Microsoft enmarcó explícitamente el anuncio en torno a la necesidad de contrarrestar a los atacantes impulsados por IA con una defensa impulsada por IA, argumentando que las herramientas de seguridad tradicionales no pueden seguir el ritmo .
La arquitectura de enrutamiento de modelos (utilizar un modelo especialista pequeño y económico junto con modelos fronterizos costosos) es un diferenciador competitivo en términos de costo. Las empresas que enfrentan presión presupuestaria en herramientas de seguridad de IA ven la reducción de costos del 50% como un punto de venta importante .
Con Project Perception entrando en vista previa pública el 3 de agosto y MDASH ya demostrando su valía en producción con 16 CVE del mundo real encontrados en un solo ciclo de parches, Microsoft apuesta a que los historiales de descubrimiento de vulnerabilidades en vivo importarán más que las puntuaciones de los benchmarks por sí solas en las decisiones de compra empresariales . La pregunta ahora es si la validación independiente respaldará las afirmaciones de Microsoft y con qué rapidez las empresas confiarán en un sistema de IA para sondear continuamente su propia infraestructura.