Ox Alpha era GLM 5.3 Flash de Zhipu AI, confirmado el 26 de agosto de 2026 tras una prueba pública y anónima que comenzó el 20 de agosto. El modelo está orientado a programación, programación visual, tareas de agentes y trabajo con contexto extenso: ofrece una ventana de un millón de tokens, entradas nativas de text...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash es el modelo que estaba detrás del endpoint anónimo Ox Alpha, aparecido en OpenRouter y otras herramientas para desarrolladores el 20 de agosto de 2026. Zhipu AI —que opera internacionalmente como Z.ai— identificó el sistema el 26 de agosto, después de utilizar aquella versión sin marca como una prueba en condiciones reales para evaluar programación, capacidades multimodales y rendimiento como agente. 3
4
La revelación convirtió una semana de especulaciones en el lanzamiento de uno de los modelos abiertos más llamativos del momento: un sistema Mixture-of-Experts (MoE) de 320.000 millones de parámetros, con solo 18.000 millones activos por token, una ventana de contexto de aproximadamente un millón de tokens, entrada multimodal nativa y pesos publicados bajo la licencia MIT. 3
6
8
Ox Alpha apareció sin ficha técnica pública, fabricante identificado ni documentación detallada. Los desarrolladores se encontraron con un endpoint gratuito, de contexto largo y compatible con entradas multimodales, y empezaron a probarlo en tareas de programación y flujos de trabajo con agentes. Su rendimiento práctico generó suficiente interés como para alimentar todo tipo de conjeturas sobre el laboratorio responsable. 13
16
Zhipu explicó que la prueba se diseñó deliberadamente a ciegas. Al ocultar la identidad y las especificaciones del modelo, la empresa quería que los usuarios juzgaran el sistema por sus resultados, no por la reputación de la marca, el número de parámetros o la publicidad del lanzamiento. El tráfico obtenido permitió recopilar patrones de uso y comentarios procedentes de tareas reales de desarrollo de software y automatización con agentes antes de la presentación oficial. 13
15
Durante el experimento se habló de una capacidad gratuita cercana a los 100 billones de tokens diarios. Patrick Collison, cofundador de Stripe, estuvo entre los desarrolladores destacados a los que se atribuyó una valoración positiva de la calidad del modelo. Estas reacciones ayudaron a convertir el endpoint anónimo en un lanzamiento seguido de cerca, aunque el entusiasmo público no equivale a una evaluación controlada. 13
14
Zhipu también afirmó que el servicio funcionaba sobre aceleradores de inteligencia artificial fabricados en China. South China Morning Post informó de que la prueba utilizó un clúster de 100.000 chips de ese tipo y de que el modelo había procesado 62 billones de tokens antes de su lanzamiento formal. Las cifras varían frente a otros relatos sobre la capacidad y el uso del experimento, por lo que deben entenderse como datos comunicados por la empresa o por medios de comunicación, no como mediciones auditadas de forma independiente. 7
13
GLM-5.3-Flash es un modelo de mezcla de expertos, o MoE. Su conjunto total suma 320.000 millones de parámetros, pero solo se activan 18.000 millones para cada token. En términos prácticos, este diseño busca ofrecer la capacidad representacional de un modelo enorme sin aplicar todos sus parámetros en cada paso de inferencia. 3
4
El modelo tiene 45 capas y se presenta como el primer sistema nativamente multimodal de la serie GLM-5. Está diseñado para trabajar con texto, imágenes, vídeo, documentos visuales, archivos y entradas multimodales intercaladas. Esto resulta especialmente relevante en flujos donde un agente debe inspeccionar una interfaz, interpretar una captura de pantalla, leer un documento o valorar el resultado de la ejecución de un programa, en lugar de limitarse a procesar texto. 4
11
Zhipu anuncia una ventana de contexto de 1.048.576 tokens, normalmente descrita como una ventana de un millón de tokens. Esa capacidad está pensada para repositorios de software extensos, sesiones prolongadas con agentes, grandes colecciones documentales y tareas que combinan código con información visual o archivos. 3
4
El modelo se entrenó desde una nueva base, con una arquitectura y una receta de entrenamiento rediseñadas. Zhipu afirma haber utilizado un corpus multimodal de 30 billones de tokens, por lo que GLM-5.3-Flash se presenta como un modelo nuevo, construido alrededor de la eficiencia y la capacidad multimodal, y no simplemente como una versión reducida de GLM-5.3. 4
16
El modelo combina atención lineal y atención dispersa. La atención lineal pretende abaratar el procesamiento de secuencias largas, mientras que la atención dispersa conserva interacciones de mayor fidelidad allí donde son más importantes. El objetivo es equilibrar una capacidad sólida para trabajar con contextos largos con unos costes de inferencia más manejables. 4
16
Zhipu también describe un mecanismo llamado IndexPool, pensado para reducir el consumo de memoria y la latencia asociados a la indexación en contextos de gran longitud. La arquitectura incorpora además conexiones hiperdimensionales restringidas a variedades (manifold-constrained hyper-connections) como otra medida para mejorar la eficiencia al escalar. El valor real de estas técnicas depende de la configuración del servicio, la longitud de la secuencia, el hardware y el tipo de carga de trabajo. 4
16
Frente a GLM-5.3, Zhipu afirma que GLM-5.3-Flash reduce 3,01 veces el cálculo de atención y 4,44 veces el uso de la caché KV, manteniendo la calidad en contextos largos. Son cifras importantes para los desarrolladores, ya que el cálculo de atención y la memoria de la caché KV pueden convertirse en cuellos de botella en agentes que trabajan durante mucho tiempo. Sin embargo, esos porcentajes proceden principalmente de los materiales técnicos de la propia Zhipu y no deben interpretarse como mejoras universales verificadas de forma independiente. 4
El modelo está orientado principalmente a la programación, la programación visual, las tareas de agentes de larga duración y el uso de herramientas. Sus capacidades visuales nativas permiten que un agente observe interfaces, resultados de renderizado y respuestas a las interacciones, creando un ciclo continuo entre código, navegadores y entornos gráficos. 4
Los resultados de referencia comunicados por Zhipu incluyen:
Las puntuaciones respaldan el posicionamiento del modelo en ingeniería de software y agentes, pero las comparaciones requieren cautela. Los resultados de las pruebas con agentes pueden cambiar notablemente según las instrucciones, las herramientas disponibles, el andamiaje utilizado, el hardware, los límites de tiempo y la versión de la evaluación. Por eso, estas cifras deben entenderse como resultados comunicados por Zhipu, no como una clasificación definitiva frente a todos los modelos competidores. 4
15
Zhipu publicó los pesos de GLM-5.3-Flash en Hugging Face bajo la permisiva licencia MIT, incluida una versión en formato BF16. La documentación del modelo señala compatibilidad con herramientas de servicio como SGLang y vLLM, lo que ofrece a las organizaciones una vía para desplegarlo localmente o gestionarlo por su cuenta, sin depender exclusivamente de la API alojada de Z.ai. 3
6
8
Esta apertura cambia la propuesta práctica. Los desarrolladores pueden probar el modelo con sus propios repositorios, documentos, interfaces visuales y entornos de agentes, mientras que los equipos de infraestructura pueden estudiar directamente los costes de servicio y los requisitos de hardware. Aun así, sus 320.000 millones de parámetros totales hacen que el despliegue sea un proyecto de ingeniería considerable: que solo se activen 18.000 millones por token reduce el trabajo computacional, pero no convierte automáticamente el punto de control completo en un modelo ligero.
El experimento de Ox Alpha fue algo más que una maniobra publicitaria. Permitió comprobar si los desarrolladores seguirían utilizando el modelo cuando desconocían su nombre, el número de parámetros y la empresa responsable. Eso generó una forma de retroalimentación especialmente útil: usuarios reales aportaron cargas de trabajo y opiniones antes de la presentación formal. 13
15
Al mismo tiempo, la prueba tiene límites claros. El acceso gratuito puede atraer un volumen de tráfico inusualmente alto, los elogios públicos pueden estar influidos por la novedad y un experimento anónimo no controla las instrucciones ni compara todos los sistemas bajo condiciones idénticas. La conclusión más sólida es, por tanto, más concreta: GLM-5.3-Flash despertó un interés considerable entre los desarrolladores antes de que se conociera su identidad, y Zhipu aprovechó esa experiencia para validar y ajustar el lanzamiento.
GLM-5.3-Flash es la identidad revelada de Ox Alpha: un modelo GLM de pesos abiertos y multimodalidad nativa, diseñado para programación y tareas con agentes de forma eficiente. Sus especificaciones principales son una arquitectura MoE de 320.000 millones de parámetros totales y 18.000 millones activos, 45 capas, una ventana de contexto de un millón de tokens, atención híbrida lineal y dispersa, y pesos publicados bajo licencia MIT. 3
4
11
Su promesa más importante no es únicamente la escala. Es la combinación de contexto largo, entrada visual, uso de herramientas y una reducción declarada de los costes de servicio en un modelo que los desarrolladores pueden descargar y ejecutar por su cuenta. El lanzamiento a ciegas proporcionó comentarios de usuarios poco habituales para una presentación de este tipo, pero todavía se necesitan evaluaciones independientes y reproducibles para determinar cómo se traducen esas afirmaciones arquitectónicas y esos resultados de referencia en el rendimiento de producción.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Ox Alpha era GLM 5.3 Flash de Zhipu AI, confirmado el 26 de agosto de 2026 tras una prueba pública y anónima que comenzó el 20 de agosto.
Ox Alpha era GLM 5.3 Flash de Zhipu AI, confirmado el 26 de agosto de 2026 tras una prueba pública y anónima que comenzó el 20 de agosto. El modelo está orientado a programación, programación visual, tareas de agentes y trabajo con contexto extenso: ofrece una ventana de un millón de tokens, entradas nativas de texto, imágenes, vídeo y archivos, y pesos...
Zhipu afirma que su diseño híbrido de atención lineal y dispersa reduce 3,01 veces el cálculo de atención y 4,44 veces el uso de la caché KV frente a GLM 5.3; todavía hacen falta evaluaciones independientes para compr...