OpenCode tilbød også tilgang gjennom gratistjenesten sin. I kunngjøringen ble det lovet romslige grenser og «nær ubegrenset bruk», med en oppgitt kapasitet på 100 billioner token per dag. Dette er en påstand fra operatøren, ikke en uavhengig kontrollert måling av faktisk gjennomstrømming.
Utvikleren Ben Davis testet Ox Alpha på ti oppgaver hentet fra DeepSWE, en programvareutviklingsbenchmark for krevende, langvarige kodeoppgaver. Modellen skal ha bestått åtte av dem, tilsvarende omtrent 80 prosent. I den samme begrensede sammenligningen fikk Claude Fable 5 65 prosent, mens GPT-5.6 Sol fikk 52 prosent.
Resultatet er oppsiktsvekkende, men bør ikke omtales som en offisiell DeepSWE-seier. DeepSWE v1.1 består av 113 originale, langvarige programvareoppgaver fordelt på 91 kodebaser. Testen på ti oppgaver dekket dermed bare en liten del av hele benchmarken.
Det er også flere metodiske forbehold:
I den offentlige rangeringen som var tilgjengelig på dette tidspunktet, lå Claude Opus 5 øverst med 73,6 prosent, fulgt av GPT-5.6 Sol med 72,7 prosent og Claude Fable 5 med 69,7 prosent.
Den forsiktige konklusjonen er derfor at Ox Alpha så svært sterk ut i Davis’ test med ti oppgaver. Resultatet beviser likevel ikke at modellen var den beste generelle kodeassistenten.
Den ledende teorien knytter Ox Alpha til Zhipu AI/Z.ai og selskapets GLM-modeller. Grunnlaget er såkalt atferds- eller modellfingeravtrykk, ikke en kunngjøring fra selskapet.
I én rapportert test ble tokeniseringen i Ox Alpha sammenlignet med GLM-5.3 på 25 ulike instruksjoner. De underliggende token-tallene skal ha vært identiske etter at man tok høyde for en fast innpakning på 75 token. Separate videotester skal også ha vist samme oppførsel når det gjelder visuelle token, blant annet likheter i bildeutvalg, skalering etter videolengde og håndtering av oppløsning.
Andre rapporterte likheter gjelder svarstil, API-oppførsel og hvordan modellen håndterer lydinndata. Hvert enkelt spor kan i prinsippet skyldes en felles innpakning, delt infrastruktur eller etterligning. Til sammen mener analytikere likevel at sporene danner et mønster som passer med Zhipus samlede multimodale GLM-linje.
At Zhipu tidligere har brukt anonyme eller skjulte lanseringer – blant annet navnet Pony Alpha – gir teorien noe kontekst. Det er likevel ikke et bevis på at Zhipu står bak Ox Alpha.
Ingen virksomhet hadde offentlig tatt på seg ansvaret for Ox Alpha i perioden rapportene dekker, og Zhipu hadde ikke bekreftet koblingen. Det har blitt spekulert i konkrete GLM-varianter, men de tilgjengelige opplysningene fastslår ikke om Ox Alpha er en uutgitt modell, en produksjonsvariant, et finjustert system eller en uavhengig modell som bruker beslektet infrastruktur.
Den mest holdbare beskrivelsen er derfor: Ox Alpha er trolig GLM-avledet og kan være knyttet til Zhipu, men skaperen og den nøyaktige modellidentiteten var ikke bekreftet. Prosentanslag fra enkeltanalytikere bør ikke behandles som en offisiell identifisering.
Personvernformuleringene rundt Ox Alpha er blant de viktigste praktiske detaljene for utviklere. Modelloppføringen på OpenRouter sa at forespørsler og svar lagres av den underliggende leverandøren, men ikke brukes til trening.
Dette er noe annet enn OpenRouters generelle regler for datainnsamling. Der heter det at OpenRouter selv ikke lagrer instruksjoner eller svar med mindre brukeren aktivt velger logging av inn- og utdata. OpenRouter beskriver også leverandørenes retningslinjer separat. Rutingslaget og selve modellleverandøren kan derfor ha ulike regler for lagring.
OpenCode markedsførte samtidig Ox Alpha med «null datalagring». Det kan vise til hvordan OpenCode selv håndterer forespørsler, men opphever ikke automatisk opplysningen om at leverandøren bak modellen lagrer data når forespørselen går via OpenRouter.
Med andre ord kan «OpenCode lagrer ikke data» og «modellleverandøren lagrer forespørsler og svar» begge beskrive ulike deler av den samme forespørselsveien.
Inntil leverandørene publiserer én tydelig og bindende behandlingsavtale, er det klokt å anta at modellleverandøren kan lagre innholdet som sendes inn. Utviklere bør derfor unngå å legge inn proprietær kildekode, passord, personopplysninger eller regulerte data bare fordi tjenesten er gratis eller opplyser at innholdet ikke brukes til trening.
Ox Alpha ble lagt merke til av tre grunner: en kortvarig gratis forhåndsvisning, et uvanlig stort kontekstvindu med multimodale funksjoner og et oppsiktsvekkende tidlig resultat i programmering.
Men dokumentasjonen støtter en mer nøktern tolkning enn påstanden om at et ukjent laboratorium definitivt har slått de etablerte toppmodellene.
80-prosentstallet i DeepSWE kom fra åtte beståtte oppgaver av ti – ikke fra hele benchmarken på 113 oppgaver. Den offentlige resultatlisten hadde fortsatt Claude Opus 5 på topp, og Ox Alpha hadde ikke gjennomført den offisielle evalueringen.
De tekniske fingeravtrykkene gjør en kobling til Zhipu og GLM til den ledende forklaringen, men ingen offentlig bekreftelse fastslo hvem som sto bak. For eksperimentering var Ox Alpha en spennende modell å prøve. For produksjonssystemer eller sensitiv kode var den anonyme eieren, leverandørens lagringspraksis og den uavklarte identiteten gode grunner til å gå varsomt fram.