Sus especificaciones anunciadas eran especialmente ambiciosas para un servicio gratuito:
OpenCode también ofreció acceso a Ox Alpha desde su modalidad gratuita. En su anuncio habló de límites generosos y de un uso «casi ilimitado», junto con una capacidad declarada de 100 billones de tokens al día. Esa cifra es una afirmación del operador, no una medición de rendimiento auditada de forma independiente.
El desarrollador Ben Davis probó Ox Alpha con 10 tareas extraídas del benchmark de ingeniería de software DeepSWE. Según sus resultados, el modelo superó ocho, lo que equivale aproximadamente a un 80%. En esa misma comparación limitada, Claude Fable 5 obtuvo un 65% y GPT-5.6 Sol, un 52%.
El dato llama la atención, pero no debe presentarse como una victoria oficial en DeepSWE. La versión 1.1 del benchmark contiene 113 tareas originales de ingeniería de software y cubre 91 repositorios, por lo que el experimento solo abarcó una pequeña parte del conjunto completo.
Además, la comparación tiene varias limitaciones importantes:
La instantánea de la tabla pública disponible entonces situaba a Claude Opus 5 en primer lugar, con un 73,6%; a GPT-5.6 Sol en segundo, con un 72,7%; y a Claude Fable 5 con un 69,7%. La conclusión prudente es más concreta: Ox Alpha mostró un rendimiento muy sólido en el experimento de 10 tareas de Davis, pero ese resultado no demuestra que fuera el mejor modelo de programación de propósito general.
La principal teoría de atribución conecta Ox Alpha con Zhipu AI, o Z.ai, y con su familia de modelos GLM. La hipótesis se basa en el análisis de sus patrones de comportamiento, no en un anuncio de la compañía.
En una prueba difundida, un investigador comparó el comportamiento de tokenización de Ox Alpha y GLM-5.3 utilizando 25 instrucciones. Los recuentos subyacentes coincidían después de tener en cuenta una envoltura constante de 75 tokens. Pruebas independientes con vídeo también habrían detectado coincidencias en el tratamiento de los tokens visuales, el muestreo de fotogramas, el escalado según la duración y la gestión de la resolución.
Otros parecidos señalados incluyen el estilo de las respuestas, el comportamiento de la API y la forma de gestionar la entrada de audio. Analizada por separado, cualquiera de estas pistas podría explicarse por una envoltura compartida, una infraestructura común o una imitación. En conjunto, los analistas consideran que forman un patrón más compatible con la línea multimodal unificada de GLM de Zhipu.
El historial de Zhipu con lanzamientos anónimos o de estilo stealth, incluido el nombre Pony Alpha, aporta contexto circunstancial. Sin embargo, no demuestra que la compañía haya creado Ox Alpha.
Durante el periodo cubierto por los informes, ninguna empresa había reclamado públicamente la autoría de Ox Alpha y Zhipu no había confirmado la atribución. Se han especulado variantes concretas de GLM, pero las pruebas disponibles no permiten establecer si Ox Alpha es un modelo aún no anunciado, una variante de producción, un sistema ajustado para una tarea específica o un modelo operado de forma independiente sobre una infraestructura relacionada.
La descripción más defendible es, por tanto, la siguiente: Ox Alpha probablemente deriva de GLM y podría estar conectado con Zhipu, pero su creador y su identidad exacta no estaban verificados. Los porcentajes de confianza difundidos por analistas individuales no deben confundirse con una identificación oficial.
Las condiciones de privacidad de Ox Alpha son uno de los detalles prácticos más relevantes para los desarrolladores. La ficha del modelo en OpenRouter indicaba que el proveedor subyacente conserva las instrucciones y las respuestas, aunque no las utiliza para entrenar sus modelos.
Esto no es lo mismo que la política general de recopilación de datos de OpenRouter. La plataforma afirma que no almacena las instrucciones ni las respuestas salvo que el usuario active voluntariamente el registro de entradas y salidas. También documenta por separado las políticas de cada proveedor, de modo que la capa de enrutamiento y el proveedor del modelo pueden aplicar reglas de conservación distintas.
Mientras tanto, OpenCode promocionó Ox Alpha con «retención cero de datos». Esa promesa podría describir la gestión que realiza OpenCode, pero no anula automáticamente la declaración de retención del proveedor asociada a la ruta de OpenRouter. En otras palabras, «OpenCode no conserva los datos» y «el proveedor subyacente conserva las instrucciones y respuestas» pueden referirse a fases diferentes de una misma solicitud.
Hasta que los proveedores publiquen una política única y contractualmente clara sobre el tratamiento de datos, lo prudente es asumir que el proveedor del modelo puede conservar el contenido enviado. Los desarrolladores deberían evitar compartir código propietario, credenciales, datos personales o información regulada solo porque el servicio sea gratuito o porque se anuncie que no utiliza las instrucciones para entrenar.
Ox Alpha destacó por tres motivos: una vista previa gratuita y de corta duración, una ventana de contexto y unas capacidades multimodales inusualmente amplias, y un resultado inicial muy llamativo en programación. Pero las pruebas disponibles respaldan una lectura moderada, no la afirmación de que un laboratorio desconocido derrotó de forma concluyente a los modelos de frontera establecidos.
El 80% de DeepSWE procedía de ocho tareas superadas de un total de 10, no del benchmark completo de 113 tareas. La clasificación pública seguía situando por delante a Claude Opus 5 y Ox Alpha aún no había completado el proceso oficial de evaluación.
Sus huellas técnicas hacen que la conexión con Zhipu y GLM sea la explicación más plausible, pero ninguna confirmación pública establecía la autoría. Para experimentar, Ox Alpha era un modelo interesante. Para sistemas de producción o código sensible, su propiedad anónima, la retención a nivel del proveedor y su identidad sin resolver aconsejaban actuar con cautela.
Sus especificaciones anunciadas eran especialmente ambiciosas para un servicio gratuito:
OpenCode también ofreció acceso a Ox Alpha desde su modalidad gratuita. En su anuncio habló de límites generosos y de un uso «casi ilimitado», junto con una capacidad declarada de 100 billones de tokens al día. Esa cifra es una afirmación del operador, no una medición de rendimiento auditada de forma independiente.
El desarrollador Ben Davis probó Ox Alpha con 10 tareas extraídas del benchmark de ingeniería de software DeepSWE. Según sus resultados, el modelo superó ocho, lo que equivale aproximadamente a un 80%. En esa misma comparación limitada, Claude Fable 5 obtuvo un 65% y GPT-5.6 Sol, un 52%.
El dato llama la atención, pero no debe presentarse como una victoria oficial en DeepSWE. La versión 1.1 del benchmark contiene 113 tareas originales de ingeniería de software y cubre 91 repositorios, por lo que el experimento solo abarcó una pequeña parte del conjunto completo.
Además, la comparación tiene varias limitaciones importantes:
La instantánea de la tabla pública disponible entonces situaba a Claude Opus 5 en primer lugar, con un 73,6%; a GPT-5.6 Sol en segundo, con un 72,7%; y a Claude Fable 5 con un 69,7%. La conclusión prudente es más concreta: Ox Alpha mostró un rendimiento muy sólido en el experimento de 10 tareas de Davis, pero ese resultado no demuestra que fuera el mejor modelo de programación de propósito general.
La principal teoría de atribución conecta Ox Alpha con Zhipu AI, o Z.ai, y con su familia de modelos GLM. La hipótesis se basa en el análisis de sus patrones de comportamiento, no en un anuncio de la compañía.
En una prueba difundida, un investigador comparó el comportamiento de tokenización de Ox Alpha y GLM-5.3 utilizando 25 instrucciones. Los recuentos subyacentes coincidían después de tener en cuenta una envoltura constante de 75 tokens. Pruebas independientes con vídeo también habrían detectado coincidencias en el tratamiento de los tokens visuales, el muestreo de fotogramas, el escalado según la duración y la gestión de la resolución.
Otros parecidos señalados incluyen el estilo de las respuestas, el comportamiento de la API y la forma de gestionar la entrada de audio. Analizada por separado, cualquiera de estas pistas podría explicarse por una envoltura compartida, una infraestructura común o una imitación. En conjunto, los analistas consideran que forman un patrón más compatible con la línea multimodal unificada de GLM de Zhipu.
El historial de Zhipu con lanzamientos anónimos o de estilo stealth, incluido el nombre Pony Alpha, aporta contexto circunstancial. Sin embargo, no demuestra que la compañía haya creado Ox Alpha.
Durante el periodo cubierto por los informes, ninguna empresa había reclamado públicamente la autoría de Ox Alpha y Zhipu no había confirmado la atribución. Se han especulado variantes concretas de GLM, pero las pruebas disponibles no permiten establecer si Ox Alpha es un modelo aún no anunciado, una variante de producción, un sistema ajustado para una tarea específica o un modelo operado de forma independiente sobre una infraestructura relacionada.
La descripción más defendible es, por tanto, la siguiente: Ox Alpha probablemente deriva de GLM y podría estar conectado con Zhipu, pero su creador y su identidad exacta no estaban verificados. Los porcentajes de confianza difundidos por analistas individuales no deben confundirse con una identificación oficial.
Las condiciones de privacidad de Ox Alpha son uno de los detalles prácticos más relevantes para los desarrolladores. La ficha del modelo en OpenRouter indicaba que el proveedor subyacente conserva las instrucciones y las respuestas, aunque no las utiliza para entrenar sus modelos.
Esto no es lo mismo que la política general de recopilación de datos de OpenRouter. La plataforma afirma que no almacena las instrucciones ni las respuestas salvo que el usuario active voluntariamente el registro de entradas y salidas. También documenta por separado las políticas de cada proveedor, de modo que la capa de enrutamiento y el proveedor del modelo pueden aplicar reglas de conservación distintas.
Mientras tanto, OpenCode promocionó Ox Alpha con «retención cero de datos». Esa promesa podría describir la gestión que realiza OpenCode, pero no anula automáticamente la declaración de retención del proveedor asociada a la ruta de OpenRouter. En otras palabras, «OpenCode no conserva los datos» y «el proveedor subyacente conserva las instrucciones y respuestas» pueden referirse a fases diferentes de una misma solicitud.
Hasta que los proveedores publiquen una política única y contractualmente clara sobre el tratamiento de datos, lo prudente es asumir que el proveedor del modelo puede conservar el contenido enviado. Los desarrolladores deberían evitar compartir código propietario, credenciales, datos personales o información regulada solo porque el servicio sea gratuito o porque se anuncie que no utiliza las instrucciones para entrenar.
Ox Alpha destacó por tres motivos: una vista previa gratuita y de corta duración, una ventana de contexto y unas capacidades multimodales inusualmente amplias, y un resultado inicial muy llamativo en programación. Pero las pruebas disponibles respaldan una lectura moderada, no la afirmación de que un laboratorio desconocido derrotó de forma concluyente a los modelos de frontera establecidos.
El 80% de DeepSWE procedía de ocho tareas superadas de un total de 10, no del benchmark completo de 113 tareas. La clasificación pública seguía situando por delante a Claude Opus 5 y Ox Alpha aún no había completado el proceso oficial de evaluación.
Sus huellas técnicas hacen que la conexión con Zhipu y GLM sea la explicación más plausible, pero ninguna confirmación pública establecía la autoría. Para experimentar, Ox Alpha era un modelo interesante. Para sistemas de producción o código sensible, su propiedad anónima, la retención a nivel del proveedor y su identidad sin resolver aconsejaban actuar con cautela.