“Ox Alpha” apareció gratis y sin atribución en OpenRouter y OpenCode el 20 de agosto; seis días después, Z.ai confirmó que se trataba de GLM 5.3 Flash. El modelo es el primer GLM 5 nativamente multimodal de Z.ai: admite texto, imágenes y vídeo, y ofrece un contexto de 1.048.576 tokens.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
La incógnita que durante casi una semana movilizó a desarrolladores de todo el mundo terminó con un lanzamiento de producto. El 26 de agosto, Z.ai —la empresa también conocida como Zhipu AI— confirmó que el modelo anónimo “Ox Alpha” era en realidad GLM-5.3-Flash, su primer modelo de la serie GLM-5 con capacidades multimodales nativas. 2
5
9
La revelación convirtió una prueba pública de gran escala en una estrategia de lanzamiento poco convencional: el modelo ya había sido utilizado intensivamente por desarrolladores antes de que se conocieran su identidad, sus especificaciones y su fabricante. Después, Z.ai publicó sus pesos con licencia MIT y anunció una API de bajo coste. 5
9
16
“Ox Alpha” apareció el 20 de agosto en OpenRouter y OpenCode como un modelo gratuito y sin atribución clara. Desde el principio llamó la atención por su contexto de aproximadamente un millón de tokens y por aceptar entradas de texto, imágenes y vídeo. 4
5
9
La comunidad empezó a buscar pistas técnicas. Algunos desarrolladores detectaron comportamientos del tokenizador parecidos a los de GLM, mientras que ciertos errores de API apuntaban también hacia Zhipu AI. El tráfico creció rápidamente y el modelo se convirtió en una opción destacada para agentes de programación antes de que Z.ai reconociera públicamente su autoría. 4
5
9
Los informes sobre el volumen de uso son enormes, aunque no completamente coherentes entre sí. Algunas crónicas contemporáneas hablan de 42 billones de tokens procesados en seis días; otras mencionan 44 billones y 503.000 usuarios. Estas últimas cifras dependen de la fecha y del método de medición, y no están confirmadas de forma independiente por las fuentes más sólidas disponibles. 11
16
GLM-5.3-Flash es un modelo de pesos abiertos diseñado para programación, tareas con agentes y flujos de trabajo que combinan código con interfaces visuales. Su capacidad multimodal nativa le permite analizar no solo instrucciones escritas, sino también imágenes, vídeo, interfaces, resultados de renderizado y señales de interacción. 5
7
Su ventana de contexto alcanza 1.048.576 tokens, una capacidad especialmente útil para mantener en una misma tarea archivos, resultados de terminal, páginas web, estado de Git y objetivos de largo recorrido. 6
7
13
A nivel de arquitectura, es un sistema de mezcla de expertos —MoE, por sus siglas en inglés— con 320.000 millones de parámetros totales, aunque activa unos 18.000 millones por token durante la inferencia. También combina atención dispersa y atención lineal, una apuesta destinada a reducir el coste computacional y el consumo de memoria sin renunciar a un contexto extenso. 5
7
Z.ai afirma que GLM-5.3-Flash supera claramente a GLM-5.2 en ingeniería de software. En la prueba DeepSWE v1.1, la compañía comunica una puntuación de 63,4 frente a 46,2 para el modelo anterior. 7
La empresa también presenta una comparación de “inteligencia” cercana a Claude Opus 4.8: 29,0 frente a 29,5. Sin embargo, ese resultado es una afirmación de proveedor y no constituye por sí solo una prueba independiente de equivalencia general. Para valorar el modelo en condiciones reales habrá que observar evaluaciones reproducibles, estabilidad de la API y resultados en despliegues prolongados. 7
8
La tarifa de lista anunciada por Z.ai es de 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida. La página de precios de la compañía muestra actualmente una promoción temporal del 50 %, que deja esas tarifas en 0,075 y 0,25 dólares, respectivamente. 9
10
Los pesos se publicaron bajo la licencia MIT, lo que permite su uso local y comercial siempre que se respeten las condiciones de esa licencia. Esta combinación de pesos abiertos, contexto largo y precios reducidos sitúa a GLM-5.3-Flash en una posición especialmente atractiva para desarrolladores que necesitan probar agentes de programación a gran escala. 9
16
Z.ai y varios informes secundarios aseguran que la prueba de “Ox Alpha” funcionó íntegramente sobre aceleradores de inteligencia artificial fabricados en China, mediante una pila de servicio personalizada basada en SGLang que habría triplicado el rendimiento de extremo a extremo. 5
44
La afirmación tiene importancia estratégica porque sugiere que un modelo avanzado puede ofrecer inferencia competitiva con una dependencia menor de los aceleradores de Nvidia, en un contexto marcado por los controles estadounidenses a la exportación de chips. También enlaza con el trabajo previo atribuido a Zhipu en el uso de hardware Huawei Ascend para entrenar GLM-5. 5
44
Aun así, los detalles sobre el conjunto exacto de aceleradores, el multiplicador de rendimiento y la independencia total respecto de componentes extranjeros proceden de la empresa o de cuentas secundarias. No han sido auditados de manera independiente. 5
44
El lanzamiento pone en cuestión el modelo tradicional de ofrecer capacidades avanzadas exclusivamente a través de sistemas cerrados y caros. GLM-5.3-Flash combina pesos abiertos, multimodalidad, una ventana de contexto de un millón de tokens y una API con un precio muy inferior al de varias alternativas líderes de OpenAI y Anthropic. 1
2
9
También encaja con una estrategia china cada vez más visible: publicar pesos, reducir agresivamente los precios y utilizar pruebas “encubiertas” para obtener comentarios reales de desarrolladores antes del lanzamiento formal. Zhipu ya había empleado una táctica similar con el experimento Pony Alpha. Bloomberg ha descrito este impulso de los modelos chinos de pesos abiertos como un intento de acercarse a Anthropic y OpenAI. 1
2
9
Pero el lanzamiento no demuestra por sí solo que Z.ai haya establecido una ventaja definitiva en la frontera de la inteligencia artificial. Agosto de 2026 también estuvo marcado por otros lanzamientos de alta gama, entre ellos DeepSeek V4 Pro, Alibaba Qwen3.8-Max y xAI Grok 4.6. La comparación decisiva dependerá de pruebas independientes, costes operativos reales y fiabilidad en tareas complejas, no de una única tabla de clasificación.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
“Ox Alpha” apareció gratis y sin atribución en OpenRouter y OpenCode el 20 de agosto; seis días después, Z.ai confirmó que se trataba de GLM 5.3 Flash.
“Ox Alpha” apareció gratis y sin atribución en OpenRouter y OpenCode el 20 de agosto; seis días después, Z.ai confirmó que se trataba de GLM 5.3 Flash. El modelo es el primer GLM 5 nativamente multimodal de Z.ai: admite texto, imágenes y vídeo, y ofrece un contexto de 1.048.576 tokens.
Su arquitectura combina 320.000 millones de parámetros totales con solo 18.000 millones activos por token, junto con atención dispersa y lineal.