GLM 5.3 de Z.ai logra un 84.5% en CyberGym (detección de vulnerabilidades), superando por un estrecho margen a Mythos 5 (83.8%) y GPT 5.6 Sol (83.6%). Sin embargo, en el crítico benchmark ExploitBench (generación de exploits funcionales), GLM 5.3 obtiene solo un 54.4%, frente al 78.0% de Mythos 5 y el 76.5% de GPT 5...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does Chinese AI startup Z.ai's open source GLM 5.3 model compare to Anthropic's restricted Mythos 5 model in cybersecurity vulnerability. Article summary: GLM-5.3 claims a narrow lead over Mythos 5 on vulnerability *detection* (84.5% vs 83.8% on CyberGym), but trails significantly on *exploitation* (54.4% vs 78.0% on ExploitBench). Its open-weight release is delayed for sa. Topic tags: general web, ai safety, openai, llm, agents. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
El 14 de agosto de 2026, la startup china Z.ai lanzó GLM-5.3, un modelo de código abierto con 743 mil millones de parámetros, logrando un resultado sobresaliente en el benchmark CyberGym de detección de vulnerabilidades (84.5%), superando por un estrecho margen al restringido Mythos 5 de Anthropic (83.8%) y a GPT-5.6 Sol de OpenAI (83.6%) . Sin embargo, GLM-5.3 queda muy por detrás de Mythos 5 en la capacidad de desarrollar exploits funcionales (54.4% frente al 78.0% en ExploitBench), y su lanzamiento como pesos abiertos se ha retrasado pendiente de una revisión de seguridad
. La comparación revela un panorama complejo: un liderazgo muy ajustado en detección frente a una brecha significativa en explotación, y un marcado contraste en los modelos de acceso, las salvaguardas y el contexto regulatorio.
| Benchmark | GLM-5.3 | GLM-5.2 (generación anterior) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 |
| Z.ai Internal Code Bench | ~50% de mejora | línea base |
Nota: Mythos 5 obtiene un 80.3% en SWE-bench Pro (codificación de agente), pero no hay comparaciones directas en estos benchmarks específicos entre ambos modelos . Todas las ganancias de GLM-5.3 provinieron únicamente de un post-entrenamiento expandido; el modelo base de 743B no fue re-entrenado
.
GLM-5.3 afirma un estrecho liderazgo sobre Mythos 5 en la detección de vulnerabilidades (84.5% frente a 83.8% en CyberGym), pero queda significativamente rezagado en la explotación (54.4% frente a 78.0% en ExploitBench). Su lanzamiento como pesos abiertos está retrasado por una revisión de seguridad, y su predecesor, GLM-5.2, fue evaluado como con un rechazo casi nulo a las instrucciones de ciberataque. Mythos 5 sigue siendo mucho más restringido —nunca disponible públicamente, limitado a unas 200 organizaciones verificadas— pero también mucho más capaz en la tarea ofensiva más peligrosa: generar exploits funcionales. La implicación más amplia es que los modelos de pesos abiertos están cerrando rápidamente la brecha de capacidades con los modelos restringidos fronterizos en tareas cibernéticas, mientras que las salvaguardas de seguridad siguen siendo sustancialmente más débiles. La incertidumbre regulatoria china sobre la exportación de los mejores modelos de IA añade otra capa de complejidad sobre si los pesos de GLM-5.3 llegarán a ser tan libremente accesibles como sugiere el marketing de Z.ai.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
GLM 5.3 de Z.ai logra un 84.5% en CyberGym (detección de vulnerabilidades), superando por un estrecho margen a Mythos 5 (83.8%) y GPT 5.6 Sol (83.6%).
GLM 5.3 de Z.ai logra un 84.5% en CyberGym (detección de vulnerabilidades), superando por un estrecho margen a Mythos 5 (83.8%) y GPT 5.6 Sol (83.6%). Sin embargo, en el crítico benchmark ExploitBench (generación de exploits funcionales), GLM 5.3 obtiene solo un 54.4%, frente al 78.0% de Mythos 5 y el 76.5% de GPT 5.6 Sol.
Z.ai ha retrasado la publicación de los pesos abiertos de GLM 5.3 al menos dos semanas para realizar una revisión de seguridad, un cambio respecto a su predecesor GLM 5.2, que se lanzó sin restricciones.