Det som først så ut som et mysterium, er nå oppklart: Ox Alpha var ikke en langsiktig anonym modell fra en ukjent aktør, men en kortvarig, anonym forhåndsvisning fra Z.ai – tidligere kjent som Zhipu AI. Modellen dukket opp på OpenRouter 20. august 2026 under navnet stealth/ox-alpha. Seks dager senere bekreftet Z.ai at den offisielle modellen var GLM-5.3-Flash.
2
5
10
Oppmerksomheten skyldtes ikke bare hemmelighetskremmeriet. I prøveperioden kunne utviklere bruke en avansert resonneringsmodell gratis til programmering og agentbaserte arbeidsflyter. Tidlige tester tydet samtidig på at den var svært kapabel i reelle programvareoppgaver.
Hva var Ox Alpha?
OpenRouter beskrev Ox Alpha som en resonneringsmodell for koding, langvarig agentarbeid og produksjonsbelastning. Den skulle være egnet til større programvareprosjekter, kompliserte resonnementer og arbeidsflyter der tekst kombineres med visuelt innhold.
30
39
Forhåndsvisningen hadde blant annet disse spesifikasjonene:
- Modell-ID:
stealth/ox-alpha
- Lansert: 20. august 2026
- Kontekstvindu: 1 048 576 tokens – omtrent én million
- Maksimal output: 131 072 tokens
- Input: tekst, bilder og video
- Funksjoner: verktøy- og funksjonskall samt strukturert output
- Pris: Gratis for både input og output i prøveperioden
6
12
14
Det gjorde modellen interessant for store kodebaser, lange samtaler, videoanalyse og automatiserte oppgaver i flere trinn. Samtidig er ikke et stort kontekstvindu og en gratis prøveperiode i seg selv bevis på at en modell er best i klassen. Det var de tidlige resultatene innen programvareutvikling som virkelig satte fart på interessen.
Hvor kom navnet «Niu Lai» fra?
«Ox» kan kobles til det kinesiske ordet «niu» (牛), som blant annet betyr okse eller storfe. Kinesiske utviklere begynte derfor raskt å omtale modellen som «Niu Lai» (牛来).
Kallenavnet spilte også på en kinesisk animasjonsfilm med samme navn, omtrent oversatt til «Her kommer oksen», som ble et populært nettfenomen sommeren 2026.
15
«Niu Lai» var altså et brukerskapt kallenavn, ikke et offisielt produktnavn. Det er heller ikke dokumentert noe produkt- eller opphavsrettslig forhold mellom modellen og filmen.
14
15
En tidlig DeepSWE-test ga 8 av 10
Den mest omtalte tidlige testen kom fra en liten, uavhengig gjennomgang. Ox Alpha løste åtte av ti oppgaver i DeepSWE, tilsvarende en Pass@1-score på 80 prosent. I samme tidlige sammenligning fikk Claude Fable 5 65 prosent, mens GPT-5.6 Sol fikk 52 prosent.
1
3
48
| Modell |
Tidlig resultat på ti DeepSWE-oppgaver |
| Ox Alpha |
8 av 10 (80 %) |
| Claude Fable 5 |
65 % |
| GPT-5.6 Sol |
52 % |
DeepSWE tester om en agent kan forstå en ekte kodebase, finne årsaken til et problem og levere en fungerende løsning – ikke bare skrive kode ut fra en isolert oppgavetekst.
49
57
Det gjør 80-prosentresultatet interessant. Men ti oppgaver er et svært lite grunnlag. Oppgaveutvalg, instruksjoner, modellinnstillinger og evalueringsoppsett kan alle påvirke utfallet. Den mest presise konklusjonen er derfor at Ox Alpha gjorde det svært godt i en tidlig test med ti oppgaver, ikke at modellen dermed slo alle konkurrenter i alle situasjoner.
Senere ble det rapportert at modellen løste 63 av de 113 oppgavene i den fullstendige DeepSWE-testen, og at resultatet lå nær Claude Opus 4.8.
5 En full test er mer informativ enn et tidlig utvalg på ti oppgaver, men de offentlig tilgjengelige rapportene beskriver ikke evalueringsoppsettet godt nok til at resultatet kan regnes som uavhengig og endelig verifisert.
Hvorfor havnet modellen øverst på OpenRouter?
Ox Alpha traff flere virale knapper samtidig: anonym avsender, gratis tilgang, et kontekstvindu på rundt én million tokens, multimodale input-funksjoner og en tydelig profil rettet mot koding og agentoppgaver.
3
6
10
Modellen klatret raskt til toppen av OpenRouters bruksliste. Bloomberg beskrev lanseringen som en av de største i markedsplassens historie og rapporterte at bruken var mer enn dobbelt så høy som for DeepSeek. Andre omtaler viste også til at modellen kortvarig brøt DeepSeeks sammenhengende topplassering på utviklerplattformen OpenCode og satte rekord i daglig bruk.
5
10
16
Her er det likevel viktig å skille mellom ulike måleenheter. OpenRouter-rangeringer, OpenCode-statistikk, antall økter og tokenforbruk er ikke det samme som antall brukere – og heller ikke det samme som en ytelsesrangering. Det som kan fastslås, er at kombinasjonen av gratis tilgang og gode tidlige resultater skapte uvanlig stor interesse blant utviklere.
Stripe-sjef Patrick Collison omtalte også modellen som «veldig imponerende».
59 Kommentaren bidro til oppmerksomheten, men var ikke en uavhengig evaluering av ytelsen.
Tekniske spor pekte mot Zhipu
Før Z.ai bekreftet identiteten, forsøkte utviklere å avsløre modellen gjennom såkalt black-box-analyse: De undersøkte hvordan tjenesten oppførte seg uten tilgang til modellens vekter eller interne dokumentasjon.
1. En fast forskjell på rundt 75 tokens
Forskere sammenlignet token-tellinger fra Ox Alpha med GLM-5.3 på en rekke tekst-, kode- og emojitester. Rapportene viste svært høy overensstemmelse, med en fast forskjell på omtrent 75 tokens.
1
17
Når avviket holder seg stabilt på tvers av språk og innhold, kan det tyde på at tjenesten legger til en systemmelding eller annen innpakning. Det betyr ikke nødvendigvis at selve ordforrådet eller modellvektene er identiske. En større analyse rapporterte senere eksakt samsvar i 95 av 95 målinger.
18
Tokenizeren alene kan derfor ikke bevise at to modeller er den samme, men den kan være et sterkt signal om at de bruker samme ordforråd eller en svært lik tjenesteløsning.
2. Video ble behandlet på samme måte som i GLM-5V-Turbo
Et annet spor kom fra video-input. I flere tester skal Ox Alpha og Zhipus GLM-5V-Turbo ha brukt nøyaktig samme antall tokens på video, med tilsvarende regler for bildeutvalg, varighet og oppløsning.
17
24
Slik oppførsel er vanskeligere å etterligne gjennom vanlig promptdesign enn tonefall eller tekststil. Derfor ble videosporet av mange vurdert som et mer særpreget teknisk bevis. Det var likevel fortsatt en ekstern slutning, ikke en offentlig bekreftelse fra leverandøren.
3. Lignende API-feil og responsmønstre
Utviklere rapporterte også likheter i API-feilmeldinger, reaksjoner på resonneringsinnstillinger og modellens generelle output.
2
4 Samlet med tokenizer- og videotestene gjorde dette teorien om en forhåndslansering fra Zhipu svært troverdig.
Påstanden om «99 prosent sikkerhet» var imidlertid en enkelt observatørs vurdering av beviskjeden, ikke en offentlig, statistisk verifisert sannsynlighet.
27 Forsiktige antydninger fra personer knyttet til Google DeepMind satte også i gang spekulasjoner om Gemini, men disse ble aldri bekreftet.
Den avgjørende avklaringen kom 26. august: Z.ai bekreftet at modellen tilhørte GLM-serien og lanserte den under navnet GLM-5.3-Flash.
5
10
Del av en større «Stealth Alpha»-strategi
Ox Alpha var ikke den første anonyme Alpha-modellen på OpenRouter. Tidligere eksempler som er blitt knyttet til kinesiske selskaper, inkluderer:
- Pony Alpha → Zhipu GLM-5
- Hunter Alpha → Xiaomi MiMo-V2-Pro
- Elephant Alpha → Ant Groups Inclusion AI
- Owl Alpha → Meituans LongCat-2.0
3
8
33
Mønsteret er omtrent det samme: En modell blir gjort tilgjengelig under et anonymt eller halvanonymt kodenavn, ofte gratis, før utviklere får teste den i reelle arbeidsflyter. Etter en kort periode kobles modellen til det offisielle merkenavnet.
34
38
Det kan ha flere praktiske fordeler:
- Mindre merkevare- og opprinnelsesbias. Brukerne tester modellen før de vet hvem som står bak.
- Tilbakemeldinger fra virkelige arbeidsflyter. Utviklere tar modellen inn i kodebaser, verktøykall og automatiserte prosesser.
- Organisk spredning. En gratis og anonym modell med gode resultater skaper naturlig nysgjerrighet.
- Testing av infrastrukturen. Stor trafikk kan avdekke problemer med kapasitet, lange kontekster og agentbasert bruk.
Dette er plausible forklaringer på strategien, ikke motiver som alle modellutviklere nødvendigvis har bekreftet offentlig. For Ox Alpha er effekten likevel tydelig: Den korte, gratis prøveperioden skapte omfattende bruk, teknisk detektivarbeid og internasjonal oppmerksomhet før Z.ai knyttet modellen til GLM-navnet.
8
9
10
Konklusjon: Det mest interessante var lanseringen
Ox Alpha-historien har to faser. Først var det en gratis, multimodal og anonym modell med lang kontekst på OpenRouter. Deretter ble den til Z.ai-produktet GLM-5.3-Flash.
2
10
Resultatet på 80 prosent i den tidlige DeepSWE-testen viser at modellen var konkurransedyktig i et utvalg av reelle programvareoppgaver. Men både testen med ti oppgaver og den senere rapporten fra 113 oppgaver må vurderes ut fra hvor godt evalueringsoppsettet er dokumentert.
Den større nyheten er kanskje selve lanseringsformen. Anonyme forhåndsvisninger blir brukt som en offentlig testarena der modelltrening, infrastruktur og utviklervekst møtes. For utviklere er den praktiske lærdommen enkel: Test modellene på egne kodebaser, verktøykjeder og datagrenseflater – ikke bare på én viral poengsum eller en topplassering.
Ox Alpha viste at tekniske fingeravtrykk kan avsløre mye om en svart boks. Samtidig understreket historien hvor viktig det er å skille mellom en sterk sannsynlighetsvurdering og en faktisk bekreftelse fra selskapet selv.