OpenCode tilbød også adgang gennem sin gratis pakke. I en annoncering blev der lovet generøse grænser og »næsten ubegrænset brug« samt en kapacitet på 100 billioner tokens om dagen. Det sidste er en påstand fra operatøren – ikke en uafhængigt revideret måling af den faktiske gennemstrømning.
Udvikleren Ben Davis testede Ox Alpha på 10 opgaver udvalgt fra DeepSWE, en softwareudviklingsbenchmark, der måler, hvor godt AI-agenter kan arbejde med længerevarende problemer i rigtige kodebaser. Ox Alpha bestod angiveligt otte af opgaverne, svarende til cirka 80 procent. I den samme begrænsede sammenligning opnåede Claude Fable 5 65 procent, mens GPT-5.6 Sol nåede 52 procent.
Det er et iøjnefaldende resultat, men det bør ikke omtales som en officiel DeepSWE-sejr. DeepSWE v1.1 består af 113 originale, langvarige softwareopgaver fordelt på 91 repositories, så testen dækkede kun en lille del af benchmarken.
Der er også flere metodiske forbehold:
Den offentlige leaderboard-oversigt, der var tilgængelig på det tidspunkt, havde Claude Opus 5 på førstepladsen med 73,6 procent, efterfulgt af GPT-5.6 Sol med 72,7 procent og Claude Fable 5 med 69,7 procent. Den forsigtige konklusion er derfor, at Ox Alpha så meget stærk ud i Davis’ test med 10 opgaver – men at resultatet ikke beviser, at modellen generelt var den bedste til kodning.
Den førende teori forbinder Ox Alpha med Zhipu AI, også kendt som Z.ai, og virksomhedens GLM-modelfamilie. Teorien bygger på adfærds- og systemanalyse, ikke på en meddelelse fra virksomheden.
I en rapporteret test blev Ox Alphas tokenisering sammenlignet med GLM-5.3 på tværs af 25 prompts. De underliggende tokenoptællinger matchede angiveligt, når man tog højde for en fast wrapper på 75 tokens. Separate videotests viste angiveligt også samme type visuelle tokenmønster – blandt andet ligheder i billedsampling, skalering efter videolængde og håndtering af opløsning.
Andre rapporterede ligheder handler om svarstil, API-adfærd og modellens håndtering af lydinput. Hver enkelt ledetråd kan i sig selv skyldes en fælles wrapper, fælles infrastruktur eller efterligning. Tilsammen mener analytikere dog, at mønsteret passer bedre med Zhipus samlede multimodale GLM-linje.
Zhipus tidligere brug af anonyme eller »stealth«-præsentationer, blandt andet under navnet Pony Alpha, giver yderligere kontekst. Det beviser dog ikke, at Zhipu har skabt Ox Alpha.
Ingen virksomhed havde offentligt taget ejerskab over Ox Alpha i den periode, rapporterne dækker, og Zhipu havde ikke bekræftet forbindelsen. Der har været spekulationer om konkrete GLM-varianter, men de tilgængelige oplysninger fastslår ikke, om Ox Alpha er en endnu ikke lanceret model, en produktionsvariant, et finjusteret system eller en selvstændigt drevet model, der benytter beslægtet infrastruktur.
Den mest holdbare beskrivelse er derfor: Ox Alpha er sandsynligvis GLM-afledt og kan være forbundet med Zhipu, men skaberen og den præcise modelidentitet var ikke verificeret. Procentsatser for sikkerhed, som enkelte analytikere har delt, bør ikke opfattes som en officiel identifikation.
Ox Alphas privatlivsvilkår er blandt de vigtigste praktiske detaljer for udviklere. Modellens side på OpenRouter oplyste, at prompts og svar gemmes af den underliggende udbyder, men ikke bruges til træning.
Det er ikke det samme som OpenRouters generelle politik for dataindsamling. Den siger, at OpenRouter ikke selv gemmer prompts eller svar, medmindre brugeren aktivt tilvælger input- og outputlogning. OpenRouter beskriver samtidig udbydernes politikker separat, så routinglaget og selve modeludbyderen kan have forskellige regler for opbevaring.
OpenCode markedsførte derimod Ox Alpha med »nul datalagring«. Det løfte kan beskrive OpenCodes egen håndtering af forespørgsler, men det ophæver ikke automatisk oplysningen om, at udbyderen på OpenRouter-ruten gemmer prompts og svar. Med andre ord kan »OpenCode gemmer ikke data« og »den underliggende modeludbyder gemmer prompts og svar« godt beskrive to forskellige trin i den samme forespørgsel.
Indtil udbyderne offentliggør én samlet og kontraktligt tydelig databehandlingspolitik, er det klogest at gå ud fra, at modeludbyderen kan gemme det indsendte indhold. Udviklere bør derfor undgå at sende proprietær kildekode, adgangsnøgler, persondata eller regulerede oplysninger, blot fordi tjenesten er gratis eller lover ikke at træne på prompts.
Ox Alpha var bemærkelsesværdig af tre grunde: en kortvarig gratis forhåndstest, et usædvanligt stort kontekstvindue med multimodal understøttelse og et markant tidligt resultat i en kodetest. Men oplysningerne støtter en afbalanceret vurdering – ikke påstanden om, at et ukendt laboratorium endegyldigt har slået de etablerede frontlinjemodeller.
De 80 procent i DeepSWE kom fra otte beståede opgaver ud af 10, ikke fra hele benchmarkens 113 opgaver. Den offentlige leaderboard viste fortsat Claude Opus 5 i front, og Ox Alpha havde ikke gennemført den officielle evalueringsproces.
De tekniske fingeraftryk gør en forbindelse til Zhipu/GLM til den førende forklaring, men ingen offentlig bekræftelse fastslog, hvem der stod bag. Til eksperimenter var Ox Alpha en interessant model at afprøve. Til produktionssystemer eller følsom kode var det anonyme ejerskab, udbyderens datalagring og den uafklarede identitet derimod gode grunde til at gå varsomt frem.