Ox Alpha fue la versión de prueba anónima de GLM 5.3 Flash, confirmada por Z.ai el 26 de agosto de 2026; no era un modelo de un laboratorio aún desconocido. El modelo llegó con 1.048.576 tokens de contexto, entrada de texto, imagen y vídeo, uso de herramientas y acceso gratuito durante aproximadamente una semana.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model “Ox Alpha” (or “Niu Lai”), launched quietly on OpenRouter and OpenCode on August 20, 2026 and offered free fo. Article summary: Ox Alpha was a short anonymous “stealth” preview, not a still-unidentified new lab model: Z.ai subsequently identified it as GLM-5.3-Flash, a GLM-family model. Its strong early agentic-coding showing and unusually genero. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ox Alpha fue la prueba anónima de GLM-5.3-Flash, un modelo de la familia GLM de Z.ai. Apareció el 20 de agosto de 2026 en OpenRouter y OpenCode bajo el proveedor «Stealth», con una ventana de contexto de 1.048.576 tokens, entrada multimodal de texto, imagen y vídeo, uso nativo de herramientas y acceso sin coste durante el periodo de prueba. Z.ai confirmó después que había probado GLM-5.3-Flash de forma anónima bajo el identificador ox-alpha antes de publicar el modelo con su nombre definitivo. 110
El episodio se convirtió en un ejemplo de cómo la distribución, el acceso especialmente generoso y las funciones orientadas a agentes pueden convertir un modelo de IA en un fenómeno antes de que su desarrollador publique una ficha técnica convencional o una batería completa de evaluaciones.
La ficha anónima presentaba Ox Alpha como un modelo de razonamiento pensado para programar, ejecutar tareas agénticas prolongadas y afrontar cargas de trabajo de producción. Sus especificaciones principales eran ambiciosas para una vista previa gratuita:
stealth/ox-alphaOpenRouter y OpenCode comunicaron plazos ligeramente distintos. OpenRouter apuntó a un periodo más corto en su propia ruta, mientras que OpenCode habló de aproximadamente una semana desde el 20 de agosto. Por eso, el final del acceso gratuito podía situarse aproximadamente entre el 24 y el 27 de agosto, en lugar de existir una única fecha de cierre para todos los usuarios. 2412
Una ventana de contexto de un millón de tokens no hace automáticamente mejor a un modelo, pero sí amplía los flujos de trabajo posibles. Un agente de programación puede conservar más partes de un repositorio, resultados de herramientas, registros y contexto visual en una misma sesión, sin tener que resumir o descartar información continuamente. La entrada de vídeo también abrió la puerta a pruebas de interfaces y otros procesos que van más allá de generar código a partir de texto. 343
El atractivo inicial de Ox Alpha era práctico, no solo especulativo. Los desarrolladores podían probar un modelo de programación multimodal, con contexto muy extenso y acceso a herramientas, sin pagar por cada token y con límites relativamente amplios. Eso redujo la barrera de entrada para experimentar con reparación de repositorios, interacción con navegadores y tareas de ingeniería de software de varios pasos.
Su visibilidad creció con rapidez. En OpenCode llegó a interrumpir brevemente la racha de 56 días de DeepSeek en lo alto de la clasificación, mientras varios informes describían un pico excepcional de demanda en un solo día. Durante el lanzamiento circularon cifras de capacidad y consumo de tokens muy elevadas, pero no todas fueron auditadas de forma independiente; conviene interpretarlas como señales de interés intenso, no como mediciones exactas de escala productiva. 114
La diferencia es importante: la popularidad durante una prueba gratuita mezcla capacidad, novedad, precio y disponibilidad. Por sí sola, no demuestra que un modelo sea el mejor sistema en términos generales.
La afirmación más difundida fue un resultado del 80 % en DeepSWE, obtenido tras resolver 8 de 10 tareas. Es una señal alentadora, pero una muestra de diez tareas es demasiado pequeña para establecer una posición estable en una clasificación. Una evaluación más amplia situó el resultado en torno al 63 %, mientras que la cifra oficial posterior de Z.ai para GLM-5.3-Flash fue del 63,4 % en DeepSWE v1.1. 7634
Otras pruebas sobre el conjunto completo produjeron cifras inferiores, entre ellas un 58,4 % reportado después de ejecutar 113 tareas. Esa evaluación atribuyó una parte significativa de los fallos a problemas de formato de salida y de implementación. El caso muestra hasta qué punto los benchmarks de agentes dependen de la configuración del sistema de evaluación, el acceso a herramientas, los límites de tiempo y los criterios utilizados para considerar una tarea como superada. 4142
La conclusión más prudente es, por tanto, más limitada que el titular viral: Ox Alpha demostró una capacidad notable para programar mediante agentes y, en algunas evaluaciones, se acercó a modelos cerrados de primera línea. Pero los datos no prueban que superara de forma constante a Claude Fable 5 ni a todos los demás modelos punteros.
Las comparaciones emplearon subconjuntos de tareas, infraestructuras de agentes y condiciones de evaluación diferentes. Una prueba inicial de diez tareas podía producir un 80 % sin representar el comportamiento en todo el benchmark. Una ejecución más amplia cercana al 63 % ofrecía una imagen distinta, mientras que un resultado de alrededor del 58,4 % podía incluir penalizaciones adicionales por formato o por el comportamiento del sistema de evaluación.
Posteriormente, miembros del equipo de DeepSWE fueron citados describiendo la capacidad global del modelo como comparable, en términos generales, a Claude Opus 4.8, no como una prueba definitiva de que hubiera superado a Claude Fable 5. Los resultados de referencia deben presentarse junto con su alcance y configuración, no como si fueran puntuaciones intercambiables dentro de una única clasificación limpia. 35
El entusiasmo de algunos usuarios destacados encajaba con el perfil de trabajo de Ox Alpha. Patrick Collison lo describió como «muy impresionante» después de utilizarlo mediante un sistema de agentes, mientras que el fundador de HermesAgent afirmó que había superado varios estándares de evaluación internos del equipo. 3335
Estas reacciones son útiles como testimonios de utilidad práctica, sobre todo en programación y tareas agénticas. No equivalen a una conclusión controlada y transversal de que Ox Alpha fuera superior en todos los escenarios. Un modelo puede resultar especialmente eficaz en un flujo concreto por su contexto, velocidad, comportamiento al llamar a herramientas, compatibilidad multimodal o coste, aunque su posición agregada en los benchmarks siga siendo incierta.
Antes de la confirmación oficial, investigadores compararon el comportamiento observable de Ox Alpha con modelos candidatos de los equipos MiMo de Xiaomi, Google DeepMind y Zhipu AI.
Xiaomi parecía una posibilidad razonable, en parte porque su equipo MiMo ya había utilizado una prueba anónima llamada «Hunter Alpha». Sin embargo, varios análisis señalaron una diferencia de capacidades: los modelos MiMo estaban asociados con soporte de audio, mientras que Ox Alpha aceptaba texto, imágenes y vídeo, pero no audio. Xiaomi siguió siendo una hipótesis interesante, aunque no una atribución sólida. 2229
Algunas pistas y publicaciones relacionadas con Google alimentaron nuevas especulaciones, pero los indicios disponibles no demostraban que DeepMind hubiera creado u operado el endpoint. Seguían siendo señales circunstanciales, no pruebas de identidad.
El caso previo más fuerte apuntaba a la familia GLM de Zhipu. Pruebas de la comunidad informaron de que los recuentos de tokens de Ox Alpha coincidían con el comportamiento de GLM-5.3 en distintos tipos de instrucciones, salvo por un desplazamiento fijo aparente de unos 75 tokens. Pruebas independientes con vídeo encontraron un consumo de tokens coherente con los modelos visuales de GLM en varias características de codificación. 1821
También se señalaron otras pistas:
reasoning_effort parecido a una respuesta de la API de GLM;Cada indicio, por separado, podía explicarse por el enrutamiento, una capa intermedia, infraestructura compartida o incluso una imitación. En conjunto, hicieron cada vez más convincente la teoría de GLM, pero no sustituían a una declaración oficial. La prueba decisiva llegó cuando Z.ai identificó Ox Alpha como GLM-5.3-Flash y documentó el lanzamiento del modelo con su nombre definitivo. 1043
La confirmación convirtió Ox Alpha de un misterio de atribución en una vista previa de producto. La documentación de Z.ai describe GLM-5.3-Flash como un modelo híbrido con 320.000 millones de parámetros totales y 18.000 millones activados, además de capacidades visuales nativas para observar interfaces, interpretar resultados renderizados y utilizar la información de interacción. El objetivo es cerrar el ciclo entre código, navegadores e interfaces gráficas. 43
El lanzamiento con nombre propio también resolvió la principal debilidad de un endpoint anónimo: la incertidumbre sobre su continuidad. GLM-5.3-Flash fue descrito como publicado bajo la licencia MIT, con pesos disponibles para quienes necesiten mayor control sobre el despliegue. 1950
Eso no significa que cualquier implementación sea automáticamente segura o barata. Los equipos aún deben valorar los requisitos de hardware, el rendimiento de inferencia, las condiciones de la API, la privacidad, los límites de uso, la fiabilidad de las llamadas a herramientas y la consistencia de las respuestas en sus propios entornos.
La prueba gratuita generó atención, pero la adopción a largo plazo dependerá de factores de producto más duraderos:
La lección central de Ox Alpha no es simplemente que un modelo anónimo derrotara durante unos días a un competidor famoso. Es que un diseño de producto convincente puede propagarse con enorme rapidez cuando los desarrolladores tienen la posibilidad de probarlo a escala. La historia de los benchmarks fue más matizada de lo que sugerían los primeros titulares, pero la combinación de contexto extenso, multimodalidad, uso de herramientas, programación agéntica y acceso barato justificaba la atención.
Ahora que la identidad está resuelta y Ox Alpha ha pasado a llamarse GLM-5.3-Flash, queda la prueba verdaderamente importante: comprobar si esa combinación sigue siendo útil cuando la novedad y el acceso gratuito dejen de hacer el trabajo.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Ox Alpha fue la versión de prueba anónima de GLM 5.3 Flash, confirmada por Z.ai el 26 de agosto de 2026; no era un modelo de un laboratorio aún desconocido.
Ox Alpha fue la versión de prueba anónima de GLM 5.3 Flash, confirmada por Z.ai el 26 de agosto de 2026; no era un modelo de un laboratorio aún desconocido. El modelo llegó con 1.048.576 tokens de contexto, entrada de texto, imagen y vídeo, uso de herramientas y acceso gratuito durante aproximadamente una semana.
La cifra viral del 80 % en DeepSWE procedía de solo 8 tareas superadas de 10. Las evaluaciones más amplias se situaron alrededor del 63 %, y la cifra oficial de GLM 5.3 Flash fue del 63,4 % en DeepSWE v1.1.