Zhipu habría lanzado GLM 5.3 apenas unas horas después de que su científico jefe, Tang Jie, respondiera «sooooooon» a una pregunta sobre el modelo. El mayor salto reportado aparece en tareas de programación de larga duración, uso de terminales y descubrimiento de vulnerabilidades, no en un aumento del tamaño de la b...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What happened when Zhipu AI chief scientist Tang Jie responded “sooooooon” to a user asking about GLM-5.3, and what did Zhipu’s subsequently. Article summary: Tang Jie’s “sooooooon” proved unusually literal: Zhipu released GLM-5.3 only hours later, positioning it as a coding, agentic, and cyber-defence upgrade built on GLM-5.2’s base rather than a larger pretrained model. [1][. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
La promesa de Tang Jie resultó ser bastante literal. Después de responder «sooooooon» a un usuario que preguntaba por GLM-5.3, el científico jefe de Zhipu AI vio cómo la compañía presentaba el nuevo modelo apenas unas horas más tarde. 12
Pero la velocidad del lanzamiento no fue lo más interesante. GLM-5.3 llegó como un modelo especializado principalmente en programación, agentes capaces de ejecutar tareas con herramientas y ciberseguridad. Su particularidad técnica: mantiene la misma base de aproximadamente 743.000 millones de parámetros que GLM-5.2, mientras que Zhipu atribuye las mejoras sobre todo a un postentrenamiento más amplio, no a una nueva fase de preentrenamiento de mayor tamaño. 1
4
20
En una industria acostumbrada a asociar los avances con modelos cada vez más grandes, GLM-5.3 presenta otra estrategia: invertir más en el postentrenamiento para especializar y afinar una base ya existente.
Las comparaciones publicadas por Zhipu muestran los avances más claros en tareas de ingeniería de software complejas y con uso intensivo de herramientas:
Las cifras proceden de comparaciones difundidas por Zhipu y de análisis secundarios de esos resultados. 1
3
6
7
El salto de Terminal-Bench 3.0 llama especialmente la atención en puntos porcentuales. Aun así, una mejora muy grande desde una puntuación inicial baja no demuestra por sí sola que el modelo sea el mejor en todas las tareas de ingeniería de software. En SWE-Marathon, por ejemplo, el 42,5 de GLM-5.3 seguía por debajo de los resultados mostrados para Kimi K3 y Opus 4.8. 6
9
La cifra más llamativa de GLM-5.3 fue su 84,5 en CyberGym, una prueba centrada en encontrar y validar vulnerabilidades a partir del código fuente. La comparación de Zhipu situó ese resultado ligeramente por encima del 83,8 de Mythos 5 y del 83,6 de GPT-5.6 Sol. 2
5
6
CyberGym no mide simplemente si un modelo puede sugerir código más seguro. La tarea implica detectar debilidades, construir ataques y comprobar sus efectos: un proceso más cercano al descubrimiento de vulnerabilidades y al razonamiento sobre cadenas de explotación que a la generación habitual de código. 12
17
Esa diferencia explica el interés de las publicaciones especializadas en seguridad informática. The Register citó la afirmación de Zhipu de que la mejora no se limitaba a localizar fallos aislados, sino que también permitía razonar en varias etapas de una cadena de explotación. 17
Conviene, sin embargo, poner la palabra «líder» en contexto. Las comparaciones disponibles se describen como resultados comunicados por el proveedor y todavía no existe una replicación independiente a gran escala. 2
4
6
Más allá de CyberGym, Zhipu afirmó haber colaborado con equipos de seguridad para probar sus modelos en bases de código del mundo real. El registro publicado por la compañía contabilizaba 2.436 hallazgos de seguridad en 269 proyectos de código abierto, incluidos 1.097 fallos de gravedad crítica o alta. Según esos reportes, el hallazgo más antiguo se remontaba a 1981 y las vulnerabilidades habían permanecido sin descubrir durante un promedio de 26,6 años. 21
31
Estos datos sirven para entender el tipo de flujo de trabajo de seguridad que Zhipu quiere asociar con GLM-5.3, pero no deben interpretarse como mediciones auditadas de forma independiente. La información disponible atribuye el registro a la propia empresa y el conjunto de resultados de seguridad sigue basándose en gran medida en divulgaciones corporativas.
La presentación de GLM-5.3 no se limitó a la programación convencional. Zhipu lo promocionó para agentes capaces de trabajar durante periodos prolongados, utilizar herramientas, operar en terminales y completar tareas de ingeniería con múltiples pasos.
Entre los resultados comunicados figuran 73,0 en Toolathlon Verified, frente a 59,9 de GLM-5.2, y 48,2 en AutomationBench, frente a 26,2. 1
7 Otras comparaciones publicadas también registraron 28,5 en Agents’ Last Exam.
11
La diferencia práctica es relevante: la ventaja buscada no consiste únicamente en producir un fragmento de código plausible, sino en ejecutar una secuencia de acciones dentro de un repositorio, una terminal o un entorno de herramientas.
Eso no garantiza, por sí mismo, una ingeniería de producción fiable. En un proyecto real también importan los permisos concedidos al agente, la cobertura de las pruebas, los procesos de revisión y la frecuencia con la que el modelo se equivoca en una base de código concreta.
La evidencia disponible respalda una conclusión más acotada que «GLM-5.3 supera a todos los modelos de frontera». Los resultados de Zhipu muestran un avance considerable frente a GLM-5.2 en varios benchmarks de programación y agentes, además de una puntuación líder en CyberGym dentro de las tablas comparativas publicadas por la compañía y reproducidas por distintos medios. 2
5
6
No demuestran que GLM-5.3 sea superior de forma uniforme en programación, razonamiento, seguridad o tareas generales. Algunos modelos competidores siguen por delante en benchmarks concretos de código y los resultados disponibles todavía no han sido reproducidos ampliamente por evaluadores independientes. 6
9
La conclusión más importante es metodológica. GLM-5.3 plantea que un postentrenamiento a gran escala puede liberar capacidades especializadas a partir de una base grande ya existente. Si las pruebas independientes confirman estos avances, la inversión en postentrenamiento y la evaluación cuidadosa con software y flujos de seguridad reales podrían ser tan importantes como las comparaciones basadas únicamente en el número de parámetros.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Zhipu habría lanzado GLM 5.3 apenas unas horas después de que su científico jefe, Tang Jie, respondiera «sooooooon» a una pregunta sobre el modelo.
Zhipu habría lanzado GLM 5.3 apenas unas horas después de que su científico jefe, Tang Jie, respondiera «sooooooon» a una pregunta sobre el modelo. El mayor salto reportado aparece en tareas de programación de larga duración, uso de terminales y descubrimiento de vulnerabilidades, no en un aumento del tamaño de la base del modelo.
Zhipu afirma haber identificado 2.436 problemas de seguridad en 269 proyectos de código abierto, pero esas cifras proceden de la empresa y aún no cuentan con una auditoría independiente ampliamente verificada.