GLM 5.3 es el nuevo modelo de programación y agentes de Z.ai: ofrece una ventana de contexto de 1 millón de tokens y, según la compañía, mejora un 50 % frente a GLM 5.2 en Z.ai Code Bench. Z.ai atribuye los avances principalmente a un postentrenamiento ampliado y a entornos de tareas diseñados para reproducir trabaj...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3, how does it compare with GLM-5.2 in coding, long-horizon tasks, cybersecurity, and benchmarks such as Z.ai Code Benc. Article summary: GLM-5.3 is Z.ai’s flagship coding-and-agent model, aimed at complex software engineering and long-horizon tasks. It has a 1M-token context window and is available through Z.ai’s GLM Coding Plan; its API availability was . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3 es el modelo más reciente de programación y agentes de Z.ai, pensado para ingeniería de software compleja, depuración profunda y tareas que requieren mantener el rumbo durante muchos pasos. Z.ai le asigna una ventana de contexto de 1 millón de tokens y lo presenta como una opción más sólida que su predecesor, GLM-5.2, para trabajos complejos y de largo recorrido.
La novedad no consiste únicamente en obtener una puntuación más alta en las pruebas de código convencionales. Z.ai afirma que GLM-5.3 mejora un 50 % en su prueba interna Z.ai Code Bench y que alcanza un rendimiento de referencia entre los modelos de código abierto en evaluaciones públicas como Terminal-Bench 3.0 y Agents’ Last Exam (CLI).
La comparación oficial más clara es la mejora del 50 % que Z.ai declara en Z.ai Code Bench. Para las pruebas públicas, la información disponible incluye estas cifras de un informe de terceros:
| Prueba | GLM-5.2 | GLM-5.3 | Qué sugiere el resultado |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | Un avance notable en tareas prolongadas desde la línea de comandos |
| DeepSWE v1.1 | 46,2 % | 66,9 % | Mejor desempeño en trabajos de ingeniería de software |
| Agents’ Last Exam (CLI) | 23,8 % | 28,5 % | Progreso en tareas con uso de herramientas y comportamiento autónomo |
| CyberGym | 77,2 % | 84,5 % | Mayor capacidad reportada para descubrir vulnerabilidades |
| ExploitBench | 24,4 % | 54,4 % | Más del doble de la puntuación comunicada para GLM-5.2 |
Estas cifras deben interpretarse como resultados comunicados, no como mediciones confirmadas de forma independiente. La comparación detallada procede de una publicación de terceros en X, mientras que la documentación oficial de Z.ai confirma las afirmaciones generales sobre programación, tareas de largo recorrido y ciberseguridad, pero no reproduce todas las cifras en el extracto disponible.
El salto comunicado de 4,6 % a 28,3 % en Terminal-Bench 3.0 es la diferencia más llamativa de la tabla. Esta prueba resulta relevante para los agentes de programación porque evalúa el trabajo realizado en un entorno de línea de comandos. El modelo debe, por lo general, manejar herramientas, inspeccionar el estado del sistema, efectuar cambios y continuar durante varias etapas, en lugar de limitarse a generar un fragmento de código aislado.
La evidencia disponible permite describir a GLM-5.3 como claramente más fuerte en esta prueba, pero no demuestra que vaya a superar a GLM-5.2 en todos los repositorios, equipos o flujos de desarrollo reales.
El caso de uso central de GLM-5.3 es el trabajo de ingeniería sostenido: planificar, implementar, depurar y repetir el proceso sobre un proyecto con mucho contexto. La descripción general de Z.ai le atribuye una ventana de contexto de 1 millón de tokens y lo sitúa específicamente en tareas complejas y de largo recorrido.
Ese enfoque diferencia el lanzamiento de una simple actualización pensada para responder mejor a indicaciones breves. Z.ai comunica resultados de referencia entre los modelos de código abierto en Terminal-Bench 3.0 y Agents’ Last Exam (CLI), mientras que su comparación interna registra una mejora del 50 % frente a GLM-5.2 en Code Bench.
En la práctica, esto apunta a un modelo diseñado para conservar y utilizar más información del proyecto mientras lleva una tarea a través de más etapas. Sin embargo, las puntuaciones de referencia no bastan para establecer su fiabilidad, coste, latencia o calidad de ejecución de herramientas en un entorno concreto. Los equipos que estudien una migración deberían probar repositorios y flujos representativos antes de asumir que la mejora observada en una prueba se trasladará sin cambios a producción.
Z.ai afirma que GLM-5.3 obtuvo su mejor resultado hasta la fecha en la prueba CyberGym, centrada en el descubrimiento de vulnerabilidades. La compañía también asegura que el rendimiento del modelo en explotación de vulnerabilidades superó en más del doble el resultado de GLM-5.2.
La tabla de terceros sitúa CyberGym en el 84,5 %, frente al 77,2 % de GLM-5.2, y ExploitBench en el 54,4 %, frente al 24,4 %. Esas cifras exactas no están verificadas de forma independiente en el material oficial facilitado, por lo que conviene tratarlas como resultados comunicados con motivo del lanzamiento, no como referencias definitivas del sector.
Los resultados de seguridad informática son relevantes por dos motivos. Primero, sugieren que las mejoras en capacidades de agente podrían extenderse más allá de escribir código y abarcar también la identificación y el razonamiento sobre fallos. Segundo, refuerzan la necesidad de realizar evaluaciones de seguridad antes de una distribución amplia: un modelo más capaz para descubrir y explotar vulnerabilidades puede ayudar en tareas defensivas, pero también aumentar el riesgo de uso indebido si se despliega sin controles adecuados.
Z.ai atribuye principalmente las mejoras de GLM-5.3 a la ampliación del postentrenamiento. Según la explicación de la empresa, se expandieron los entornos de tareas utilizados durante esa fase para que se parecieran más a flujos reales de ingeniería e investigación de varios días, en lugar de concentrarse únicamente en ejercicios de programación breves y autocontenidos.
Dicho de otro modo, la mejora se presenta como un cambio en el entrenamiento y en los entornos de trabajo, no simplemente como el resultado de una ventana de contexto más grande o de una arquitectura base nueva descrita en el lanzamiento. Esto ayuda a entender por qué los avances más amplios aparecen en evaluaciones de largo recorrido y de uso de agentes: el postentrenamiento buscaba enseñar al modelo a planificar, utilizar herramientas, recuperarse de errores y continuar con tareas extensas.
Esta explicación procede de Z.ai. Será necesario contar con pruebas independientes para determinar cuánto de la mejora se generaliza entre distintos modelos, arneses de evaluación, instrucciones y proyectos de software.
GLM-5.3 está disponible mediante GLM Coding Plan, compatible con los planes indicados por Z.ai, y también puede utilizarse en el entorno de desarrollo ZCode.
Los pesos abiertos todavía no estaban disponibles según la evidencia facilitada. Un informe de terceros señaló que Z.ai esperaba publicarlos aproximadamente dos semanas después del lanzamiento del 14 de agosto de 2026, una vez completadas evaluaciones adicionales de seguridad. Eso apunta a finales de agosto de 2026, pero se trata de un calendario tentativo y no de una fecha de lanzamiento confirmada.
Para los desarrolladores que estén decidiendo si probar GLM-5.3 ahora, la diferencia clave es la que existe entre acceso y reproducibilidad. El modelo ya puede probarse a través de los productos de programación compatibles con Z.ai, pero los resultados detallados del lanzamiento todavía no pueden reproducirse plenamente de forma local con los pesos descritos en las fuentes disponibles.
GLM-5.3 es una actualización dirigida a los agentes de programación, no un simple cambio de número de versión. Z.ai comunica una mejora del 50 % en su prueba interna de código, mejores resultados en evaluaciones de agentes capaces de trabajar durante más tiempo y avances significativos en ciberseguridad frente a GLM-5.2.
La principal cautela tiene que ver con la evidencia. Z.ai confirma la dirección de las mejoras, mientras que las comparaciones públicas precisas y el calendario aproximado de dos semanas para los pesos proceden de informes de terceros y todavía requieren verificación independiente. Hasta que haya más pruebas y se publiquen los pesos, GLM-5.3 se entiende mejor como una prometedora actualización de un agente de programación, disponible actualmente como producto, pero todavía no como un modelo abierto plenamente reproducible de forma independiente.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
GLM 5.3 es el nuevo modelo de programación y agentes de Z.ai: ofrece una ventana de contexto de 1 millón de tokens y, según la compañía, mejora un 50 % frente a GLM 5.2 en Z.ai Code Bench.
GLM 5.3 es el nuevo modelo de programación y agentes de Z.ai: ofrece una ventana de contexto de 1 millón de tokens y, según la compañía, mejora un 50 % frente a GLM 5.2 en Z.ai Code Bench. Z.ai atribuye los avances principalmente a un postentrenamiento ampliado y a entornos de tareas diseñados para reproducir trabajos prolongados de ingeniería y de investigación, no solo ejercicios breves de programación.
El modelo ya está disponible mediante GLM Coding Plan y ZCode. Los pesos abiertos se esperaban tentativamente unas dos semanas después del lanzamiento del 14 de agosto de 2026, una vez completadas evaluaciones adicion...