Z.ai confirmó el 26 de agosto de 2026 que Ox Alpha, el modelo anónimo disponible en OpenRouter y OpenCode, era GLM 5.3 Flash: un modelo multimodal de 320.000 millones de parámetros, con 18.000 millones activos por tok... GLM 5.3 Flash procesa texto, imágenes y vídeo, ofrece un contexto de aproximadamente un millón d...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
El misterio terminó el 26 de agosto de 2026: Z.ai confirmó que Ox Alpha, el modelo anónimo que se ofrecía a través de OpenRouter y OpenCode, era GLM-5.3-Flash. La compañía lo presentó como el primer modelo multimodal nativo de la familia GLM-5, con pesos abiertos, una ventana de contexto de un millón de tokens y un enfoque específico en programación y tareas prolongadas ejecutadas por agentes. 1540
Pero la noticia va más allá de descubrir qué modelo se escondía detrás del nombre Ox Alpha. Z.ai combinó una vista previa gratuita y sin atribución con un uso masivo por parte de desarrolladores. Después, convirtió ese experimento en un producto identificado y descargable. En la práctica, la empresa pudo poner a prueba su infraestructura con tráfico real mientras generaba expectación en torno al lanzamiento definitivo.
GLM-5.3-Flash es un modelo de mezcla de expertos (MoE) con 320.000 millones de parámetros totales y 18.000 millones de parámetros activos por token. Acepta de forma nativa texto, imágenes y vídeo, aunque su salida es texto. Su capacidad de contexto anunciada es de aproximadamente un millón de tokens; la cifra exacta puede variar según la plataforma. La documentación de Z.ai describe el diseño de un millón de tokens, mientras que OpenRouter muestra una ventana de 1.310.720 tokens. 12340
Z.ai publicó los pesos bajo la licencia MIT, lo que facilita considerablemente su despliegue y modificación frente a un sistema disponible únicamente mediante una API cerrada. Tras terminar la vista previa anónima, el modelo también apareció en OpenRouter con su nombre público. 348
Conviene no confundirlo con el GLM-5.3 de mayor tamaño anunciado a comienzos de agosto. Según los informes disponibles, GLM-5.3-Flash es un producto separado, un modelo 320B-A18B orientado a reducir costes, y no la misma versión que la línea GLM-5.3 de mayor escala. 10
Z.ai afirma que GLM-5.3-Flash mejora a GLM-5.2 y reduce el coste de prestación del servicio. En los resultados citados durante el lanzamiento, obtuvo 63,4 puntos en DeepSWE v1.1, frente a 46,2 de GLM-5.2. La compañía también informó de una puntuación de 29,0 en su prueba interna de programación, cerca del 29,5 atribuido a Claude Opus 4.8. 316
Estas cifras sirven para entender cómo quiere posicionarse Z.ai, pero no constituyen una confirmación independiente de que el modelo iguale al de Anthropic. Las definiciones de cada prueba, la configuración de evaluación, los prompts y la posibilidad de reproducir los resultados son factores decisivos.
La conclusión más prudente es que Z.ai está reclamando un rendimiento sólido en programación y tareas de agentes a un coste mucho menor; no que GLM-5.3-Flash haya superado de forma concluyente a los modelos punteros y cerrados.
La característica más llamativa de Ox Alpha era que los desarrolladores podían probarlo sin pagar durante la fase anónima. Esa etapa terminó cuando el modelo recibió una identidad pública. El precio de lista comunicado por Z.ai es de 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida. 13
Durante el lanzamiento, OpenRouter mostraba una tarifa promocional inferior: 0,075 dólares por millón de tokens de entrada y 0,25 dólares por millón de tokens de salida. 2 La diferencia es importante: la vista previa gratuita, el precio de lista de Z.ai y el descuento específico de una plataforma son tres condiciones de acceso distintas.
Incluso con el precio de lista, la economía del modelo es una parte esencial de su atractivo. Los agentes de programación pueden consumir grandes cantidades de contexto y generar mucho texto. Por eso, un coste menor por token puede influir en la elección de un modelo tanto como una pequeña ventaja en una clasificación.
Z.ai afirmó que GLM-5.3-Flash funcionaba íntegramente sobre aceleradores de inteligencia artificial fabricados en China. 15 Los informes sobre su sistema de prestación describen una plataforma personalizada basada en SGLang, con técnicas como cuantización, paralelismo tensorial, formatos mixtos de caché, división de capas y una arquitectura separada de codificación, preparación previa y decodificación. El objetivo declarado era mejorar el rendimiento de extremo a extremo dentro de las limitaciones del hardware nacional. 25
La afirmación amplía la narrativa previa de Z.ai sobre la familia GLM. La compañía ha dicho que entrenó modelos GLM en procesadores Huawei Ascend sin utilizar hardware de Nvidia. Además, distintos informes señalan que la inclusión de Z.ai en la lista de entidades de Estados Unidos restringe su acceso a los aceleradores Nvidia H100, H200 y B200. 26
La relevancia estratégica de esta afirmación es considerable, pero debe interpretarse como una declaración de la empresa respaldada por informes del sector, no como una comparación independiente y auditada del rendimiento de cada plataforma. El dato más sólido es que Z.ai está presentando su pila tecnológica como capaz de prestar servicio a un modelo multimodal de gran tamaño sin depender de las principales GPU de centros de datos de Nvidia.
El lanzamiento anónimo parece seguir un patrón de presentación deliberadamente discreto: publicar un modelo capaz sin revelar su autoría, ofrecerlo gratis a través de rutas populares para herramientas de programación, observar cómo lo utilizan los desarrolladores y revelar el producto cuando ya ha acumulado comentarios y experiencia de uso reales.
Z.ai ya había sido vinculada a una prueba anterior llamada “Pony Alpha”, basada en una idea parecida. Durante la fase de Ox Alpha, investigadores de la comunidad intentaron identificar el modelo mediante el comportamiento de su tokenizador, sus funciones de procesamiento de vídeo y los patrones de error de la API. 71113
Algunos informes publicados durante el lanzamiento también mencionaron cifras de uso extraordinarias y un fuerte entusiasmo entre desarrolladores. Sin embargo, el material disponible no verifica de forma independiente todas esas cifras ni cada una de las citas. Por tanto, deben entenderse como afirmaciones de la cobertura del lanzamiento, no como datos de adopción auditados. 14
GLM-5.3-Flash no demuestra que Z.ai haya superado a OpenAI o Anthropic en todo el abanico de capacidades de los modelos punteros. Sí muestra, en cambio, una combinación especialmente disruptiva: entrada multimodal, contexto muy largo, pesos abiertos bajo licencia MIT, especialización en agentes de programación y precios bajos en una misma versión. 1540
Para los desarrolladores, esa combinación puede reducir el coste de cambiar de proveedor y hacer más viables el alojamiento propio y las arquitecturas con varios proveedores. Para las empresas que ofrecen modelos cerrados, añade presión sobre los precios y los márgenes, sobre todo en cargas de trabajo de programación en las que el volumen de tokens, la latencia, el control del despliegue y la disponibilidad de la infraestructura pueden importar tanto como la posición en una clasificación.
La lección principal de Ox Alpha no es simplemente que un nuevo modelo haya conseguido llamar la atención. Es que una empresa puede probar un sistema de gran escala en condiciones reales, mantener el anonimato durante la fase inicial y revelar después un producto abierto y barato. Ese enfoque convierte el lanzamiento en una prueba de ingeniería, una campaña de adquisición de usuarios y una señal de competencia global al mismo tiempo.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Z.ai confirmó el 26 de agosto de 2026 que Ox Alpha, el modelo anónimo disponible en OpenRouter y OpenCode, era GLM 5.3 Flash: un modelo multimodal de 320.000 millones de parámetros, con 18.000 millones activos por tok...
Z.ai confirmó el 26 de agosto de 2026 que Ox Alpha, el modelo anónimo disponible en OpenRouter y OpenCode, era GLM 5.3 Flash: un modelo multimodal de 320.000 millones de parámetros, con 18.000 millones activos por tok... GLM 5.3 Flash procesa texto, imágenes y vídeo, ofrece un contexto de aproximadamente un millón de tokens y tiene un precio anunciado de 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens...
El lanzamiento encubierto permitió a Z.ai probar su infraestructura con cargas reales de agentes de programación antes de revelar la identidad del modelo, convirtiendo la prueba en un experimento técnico y una estrate...