Zhipu AI presentó GLM 5.3, un modelo de pesos abiertos con 743.000 millones de parámetros que, según la empresa, mejora alrededor de un 50 % frente a GLM 5.2 principalmente gracias al postentrenamiento. GLM 5.3 obtuvo 28,3 puntos en Terminal Bench 3.0 y 66,9 en DeepSWE 1.1, frente a 4,6 y 46,2, respectivamente, en G...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Zhipu AI presentó GLM-5.3, un modelo fundacional de pesos abiertos con 743.000 millones de parámetros. A diferencia de muchos lanzamientos que presumen de una arquitectura más grande, la empresa asegura que el avance procede sobre todo del postentrenamiento: el modelo mantendría la misma escala informada que GLM-5.2, pero ofrecería mejores resultados en programación, ingeniería de software y tareas realizadas por agentes de IA.
La apuesta es pasar del asistente que propone fragmentos de código al agente capaz de inspeccionar un repositorio, ejecutar comandos, detectar errores, modificar archivos y seguir trabajando hasta completar un objetivo. Los resultados publicados por Zhipu apuntan en esa dirección, aunque siguen siendo cifras comunicadas por la propia compañía y deben contrastarse con pruebas independientes y con el uso en entornos reales.
GLM-5.3 conserva, según Zhipu, una escala de 743.000 millones de parámetros. La novedad principal no sería, por tanto, un modelo base más grande, sino una etapa de postentrenamiento diseñada para mejorar la planificación, el seguimiento de instrucciones, el uso de herramientas y la capacidad de mantener una tarea compleja durante varios pasos.
La distinción es importante para el desarrollo de modelos de IA: aumentar el número de parámetros no es la única forma de conseguir mejores resultados. Un postentrenamiento más eficaz puede enseñar al sistema a recuperarse de errores, encadenar acciones y trabajar con herramientas externas. La información disponible respalda la descripción general de Zhipu sobre su estrategia, pero no permite determinar de forma independiente cuánto aportó cada técnica concreta.
Zhipu afirma que GLM-5.3 mejora aproximadamente un 50 % frente a GLM-5.2 en su evaluación interna Z.ai Code Bench. El avance resulta especialmente visible en pruebas que exigen completar un trabajo de software prolongado:
Terminal-Bench 3.0 es especialmente relevante para la promesa de «programación agéntica», ya que evalúa la interacción con la terminal y el shell durante una tarea, no solo la generación de una respuesta estática. DeepSWE 1.1 se centra en problemas de ingeniería de software y ofrece una referencia más cercana a flujos de desarrollo completos.
Zhipu sostiene que la puntuación de 28,3 fue la más alta entre los modelos de código de pesos abiertos en el momento del anuncio y que superó a Kimi K3, de Moonshot AI. Al tratarse de una clasificación comunicada por la empresa, conviene leerla junto con la versión exacta de cada prueba, los prompts utilizados y las condiciones de acceso de los modelos comparados.
El objetivo de GLM-5.3 no se limita a responder preguntas sobre programación. Zhipu presenta el modelo como un sistema capaz de usar herramientas, operar software y completar secuencias de acciones más largas con una intervención humana reducida.
En la práctica, eso marca una diferencia entre un copiloto que responde a una solicitud concreta y un agente que puede explorar un proyecto, ejecutar comandos, diagnosticar fallos y continuar con el trabajo. La mejora en Terminal-Bench y DeepSWE es coherente con esa orientación, pero una puntuación de referencia no demuestra por sí sola que el sistema vaya a comportarse de forma fiable en entornos de producción desconocidos.
La compañía también afirma que el rendimiento de GLM-5.3 en programación y agentes se aproxima al de Claude Fable 5 y que, para tareas prácticas de desarrollo, supera a otros modelos chinos. Son afirmaciones de posicionamiento de Zhipu, no una clasificación independiente y definitiva del mercado.
Zhipu relaciona las mejoras de razonamiento y uso de herramientas con aplicaciones de ciberseguridad, incluida la identificación de vulnerabilidades. Entre los resultados difundidos figura un 84,5 % en CyberGym, una evaluación centrada en tareas de descubrimiento y validación de vulnerabilidades.
Esta capacidad tiene un carácter de doble uso. Las mismas habilidades que pueden ayudar a los equipos defensivos a localizar fallos también pueden hacer más delicado cualquier comportamiento autónomo inseguro. Por eso, los datos disponibles permiten describir el descubrimiento de vulnerabilidades como un área de capacidad informada por la empresa, pero no como una prueba de que GLM-5.3 sea un auditor de seguridad fiable ni de que pueda realizar explotación autónoma de forma segura.
La señal más importante de GLM-5.3 no es únicamente su cifra de parámetros. Es el énfasis de Zhipu en el postentrenamiento y en pruebas que miden si un modelo puede sostener una tarea de software durante varios pasos.
Antes de incorporarlo a un flujo de trabajo, los equipos técnicos deberían comprobar al menos lo siguiente:
GLM-5.3 es un lanzamiento de 743.000 millones de parámetros con el que Zhipu AI intenta demostrar que un postentrenamiento más eficaz puede transformar las capacidades de una misma base. El salto informado de 4,6 a 28,3 en Terminal-Bench 3.0 y de 46,2 a 66,9 en DeepSWE 1.1 deja clara su principal apuesta: agentes de programación capaces de afrontar tareas de software más largas y complejas.
Los resultados justifican probar el modelo con atención, especialmente en programación con pesos abiertos y flujos de trabajo basados en agentes. Pero la distancia entre un buen resultado de benchmark y una operación autónoma fiable sigue siendo considerable. La validación independiente, las pruebas en repositorios reales y unos límites de seguridad bien definidos serán los que determinen el alcance práctico de GLM-5.3.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Zhipu AI presentó GLM 5.3, un modelo de pesos abiertos con 743.000 millones de parámetros que, según la empresa, mejora alrededor de un 50 % frente a GLM 5.2 principalmente gracias al postentrenamiento.
Zhipu AI presentó GLM 5.3, un modelo de pesos abiertos con 743.000 millones de parámetros que, según la empresa, mejora alrededor de un 50 % frente a GLM 5.2 principalmente gracias al postentrenamiento. GLM 5.3 obtuvo 28,3 puntos en Terminal Bench 3.0 y 66,9 en DeepSWE 1.1, frente a 4,6 y 46,2, respectivamente, en GLM 5.2.
La compañía orienta el modelo a flujos prolongados de ingeniería de software, uso de herramientas y agentes capaces de operar programas con menos supervisión humana.