Ox Alpha superó 8 de 10 tareas en la prueba limitada de DeepSWE realizada por Ben Davis, frente al 65% de Claude Fable 5 y el 52% de GPT 5.6 Sol; la muestra es demasiado pequeña para demostrar una victoria general. El modelo ofrecía una ventana de contexto de 1.048.576 tokens, entrada de texto, imágenes y vídeo, ade...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Ox Alpha se entiende mejor como una vista previa pública de un modelo anónimo, no como el lanzamiento verificado de un nuevo modelo de frontera. Apareció en OpenRouter el 20 de agosto de 2026, con acceso gratuito durante una semana y unas especificaciones orientadas a programación, tareas agénticas de larga duración y flujos de trabajo multimodales. Sus características técnicas hacen plausible un origen relacionado con la familia GLM de Zhipu AI —también conocida como Z.ai—, pero esa atribución sigue siendo una inferencia, no un hecho anunciado.
OpenRouter incluyó stealth/ox-alpha como un modelo de terceros cuyo desarrollador y operador decidieron permanecer en el anonimato durante la vista previa. La plataforma afirma que se limita a enrutar las solicitudes: no es el desarrollador, propietario ni proveedor del modelo.
Sus especificaciones anunciadas eran especialmente ambiciosas para un servicio gratuito:
OpenCode también ofreció acceso a Ox Alpha desde su modalidad gratuita. En su anuncio habló de límites generosos y de un uso «casi ilimitado», junto con una capacidad declarada de 100 billones de tokens al día. Esa cifra es una afirmación del operador, no una medición de rendimiento auditada de forma independiente.
El desarrollador Ben Davis probó Ox Alpha con 10 tareas extraídas del benchmark de ingeniería de software DeepSWE. Según sus resultados, el modelo superó ocho, lo que equivale aproximadamente a un 80%. En esa misma comparación limitada, Claude Fable 5 obtuvo un 65% y GPT-5.6 Sol, un 52%.
El dato llama la atención, pero no debe presentarse como una victoria oficial en DeepSWE. La versión 1.1 del benchmark contiene 113 tareas originales de ingeniería de software y cubre 91 repositorios, por lo que el experimento solo abarcó una pequeña parte del conjunto completo.
Además, la comparación tiene varias limitaciones importantes:
La instantánea de la tabla pública disponible entonces situaba a Claude Opus 5 en primer lugar, con un 73,6%; a GPT-5.6 Sol en segundo, con un 72,7%; y a Claude Fable 5 con un 69,7%. La conclusión prudente es más concreta: Ox Alpha mostró un rendimiento muy sólido en el experimento de 10 tareas de Davis, pero ese resultado no demuestra que fuera el mejor modelo de programación de propósito general.
La principal teoría de atribución conecta Ox Alpha con Zhipu AI, o Z.ai, y con su familia de modelos GLM. La hipótesis se basa en el análisis de sus patrones de comportamiento, no en un anuncio de la compañía.
En una prueba difundida, un investigador comparó el comportamiento de tokenización de Ox Alpha y GLM-5.3 utilizando 25 instrucciones. Los recuentos subyacentes coincidían después de tener en cuenta una envoltura constante de 75 tokens. Pruebas independientes con vídeo también habrían detectado coincidencias en el tratamiento de los tokens visuales, el muestreo de fotogramas, el escalado según la duración y la gestión de la resolución.
Otros parecidos señalados incluyen el estilo de las respuestas, el comportamiento de la API y la forma de gestionar la entrada de audio. Analizada por separado, cualquiera de estas pistas podría explicarse por una envoltura compartida, una infraestructura común o una imitación. En conjunto, los analistas consideran que forman un patrón más compatible con la línea multimodal unificada de GLM de Zhipu.
El historial de Zhipu con lanzamientos anónimos o de estilo stealth, incluido el nombre Pony Alpha, aporta contexto circunstancial. Sin embargo, no demuestra que la compañía haya creado Ox Alpha.
Durante el periodo cubierto por los informes, ninguna empresa había reclamado públicamente la autoría de Ox Alpha y Zhipu no había confirmado la atribución. Se han especulado variantes concretas de GLM, pero las pruebas disponibles no permiten establecer si Ox Alpha es un modelo aún no anunciado, una variante de producción, un sistema ajustado para una tarea específica o un modelo operado de forma independiente sobre una infraestructura relacionada.
La descripción más defendible es, por tanto, la siguiente: Ox Alpha probablemente deriva de GLM y podría estar conectado con Zhipu, pero su creador y su identidad exacta no estaban verificados. Los porcentajes de confianza difundidos por analistas individuales no deben confundirse con una identificación oficial.
Las condiciones de privacidad de Ox Alpha son uno de los detalles prácticos más relevantes para los desarrolladores. La ficha del modelo en OpenRouter indicaba que el proveedor subyacente conserva las instrucciones y las respuestas, aunque no las utiliza para entrenar sus modelos.
Esto no es lo mismo que la política general de recopilación de datos de OpenRouter. La plataforma afirma que no almacena las instrucciones ni las respuestas salvo que el usuario active voluntariamente el registro de entradas y salidas. También documenta por separado las políticas de cada proveedor, de modo que la capa de enrutamiento y el proveedor del modelo pueden aplicar reglas de conservación distintas.
Mientras tanto, OpenCode promocionó Ox Alpha con «retención cero de datos». Esa promesa podría describir la gestión que realiza OpenCode, pero no anula automáticamente la declaración de retención del proveedor asociada a la ruta de OpenRouter. En otras palabras, «OpenCode no conserva los datos» y «el proveedor subyacente conserva las instrucciones y respuestas» pueden referirse a fases diferentes de una misma solicitud.
Hasta que los proveedores publiquen una política única y contractualmente clara sobre el tratamiento de datos, lo prudente es asumir que el proveedor del modelo puede conservar el contenido enviado. Los desarrolladores deberían evitar compartir código propietario, credenciales, datos personales o información regulada solo porque el servicio sea gratuito o porque se anuncie que no utiliza las instrucciones para entrenar.
Ox Alpha destacó por tres motivos: una vista previa gratuita y de corta duración, una ventana de contexto y unas capacidades multimodales inusualmente amplias, y un resultado inicial muy llamativo en programación. Pero las pruebas disponibles respaldan una lectura moderada, no la afirmación de que un laboratorio desconocido derrotó de forma concluyente a los modelos de frontera establecidos.
El 80% de DeepSWE procedía de ocho tareas superadas de un total de 10, no del benchmark completo de 113 tareas. La clasificación pública seguía situando por delante a Claude Opus 5 y Ox Alpha aún no había completado el proceso oficial de evaluación.
Sus huellas técnicas hacen que la conexión con Zhipu y GLM sea la explicación más plausible, pero ninguna confirmación pública establecía la autoría. Para experimentar, Ox Alpha era un modelo interesante. Para sistemas de producción o código sensible, su propiedad anónima, la retención a nivel del proveedor y su identidad sin resolver aconsejaban actuar con cautela.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Ox Alpha superó 8 de 10 tareas en la prueba limitada de DeepSWE realizada por Ben Davis, frente al 65% de Claude Fable 5 y el 52% de GPT 5.6 Sol; la muestra es demasiado pequeña para demostrar una victoria general.
Ox Alpha superó 8 de 10 tareas en la prueba limitada de DeepSWE realizada por Ben Davis, frente al 65% de Claude Fable 5 y el 52% de GPT 5.6 Sol; la muestra es demasiado pequeña para demostrar una victoria general. El modelo ofrecía una ventana de contexto de 1.048.576 tokens, entrada de texto, imágenes y vídeo, además de una vista previa gratuita de una semana.
OpenRouter indica que el proveedor conserva los mensajes y las respuestas, aunque no los usa para entrenar; OpenCode, por su parte, promocionó el servicio como de retención cero de datos.