El panorama cambia en ExploitBench, que exige un razonamiento más profundo sobre cómo se podría explotar realmente una vulnerabilidad y requiere un exploit funcional. GLM-5.3 más que duplica la puntuación de su predecesor, pasando del 24,4% al 54,4% . Sin embargo, Z.ai informa que Mythos 5 obtiene un 78% en ExploitBench y GPT-5.6 Sol un 76,5%, lo que sitúa a GLM-5.3 muy por detrás en esta medida más difícil
.
En ExploitGym, que cuenta cuántas tareas de explotación puede completar un modelo en un presupuesto normalizado de dos horas, GLM-5.3 finaliza 105 tareas (frente a 29 de GLM-5.2) . Con un presupuesto de seis horas, la cifra asciende a 130 tareas
.
| Benchmark | Qué mide | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | Descubrimiento y validación de vulnerabilidades en código fuente | 84,5% | 83,8% | 83,6% |
| ExploitBench | Razonamiento de causa raíz y generación de un exploit funcional | 54,4% | 78% | 76,5% |
| ExploitGym (2 horas) | Tareas de explotación completadas con presupuesto normalizado | 105 tareas | No divulgado | No divulgado |
Más allá de los benchmarks, GLM-5.3 se ha desplegado en pruebas de seguridad reales con resultados impresionantes:
GLM-5.3 también presenta cifras sólidas en benchmarks de programación y agentes, posicionándose como un modelo líder de pesos abiertos para tareas de ingeniería de software:
Z.ai afirma que la capacidad de ciberseguridad del modelo "creció más rápido de lo previsto" durante el post-entrenamiento . Los 740 mil millones de parámetros del modelo base no se reentrenaron; todas las mejoras provinieron de ajustes en el post-entrenamiento
. Dado que la capacidad fue una sorpresa emergente, la empresa retiene el lanzamiento de los pesos abiertos durante dos semanas mientras refuerza los controles de seguridad
. El modelo ya está disponible a través de la API de Z.ai y mediante integraciones con ZCode, Claude Code y OpenCode
.