Ox Alpha var en anonym forhåndsversjon av Z.ai modellen GLM 5.3 Flash, bekreftet 26. Modellen avbrøt kort DeepSeeks 56 dager lange seiersrekke på OpenCode og skapte svært høy etterspørsel, men fullstendige tester plasserte den nærmere Claude Opus 4.8 enn som et bevis på suverenitet over alle konkurren...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model “Ox Alpha” (or “Niu Lai”), launched quietly on OpenRouter and OpenCode on August 20, 2026 and offered free fo. Article summary: Ox Alpha was a short anonymous “stealth” preview, not a still-unidentified new lab model: Z.ai subsequently identified it as GLM-5.3-Flash, a GLM-family model. Its strong early agentic-coding showing and unusually genero. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ox Alpha var en kortvarig, anonym forhåndsversjon av GLM-5.3-Flash, en modell i GLM-familien fra Z.ai. Den dukket opp på OpenRouter og OpenCode 20. august 2026 under leverandørnavnet «Stealth». Modellen hadde et kontekstvindu på 1 048 576 tokens, kunne ta imot tekst, bilder og video, støttet verktøykall og var gratis å bruke under forhåndstesten. Z.ai bekreftet senere at selskapet hadde testet GLM-5.3-Flash anonymt som ox-alpha før den navngitte lanseringen. 110
Lanseringen ble dermed et interessant eksempel på hvordan distribusjon, sjenerøs tilgang og funksjoner rettet mot AI-agenter kan gjøre en modell til et fenomen før utvikleren publiserer et vanlig modellkort eller et komplett benchmarkgrunnlag.
Den anonyme oppføringen beskrev Ox Alpha som en resonneringsmodell for programmering, langvarig agentarbeid og produksjonslaster. Hovedspesifikasjonene var uvanlig ambisiøse for en gratis forhåndsvisning:
stealth/ox-alphaOpenRouter og OpenCode oppga ikke helt samme tidsrom for gratistilgangen. OpenRouter viste til en kortere periode på sin rute, mens OpenCode beskrev tilgangen som omtrent én uke fra 20. august. Den omtrentlige grensen for gratistilbudet lå derfor rundt 24.–27. august, avhengig av plattform. 2412
Et kontekstvindu på én million tokens gjør ikke automatisk en modell bedre. Men det endrer hvilke arbeidsflyter utviklere kan forsøke. En kodeagent kan beholde mer av et kodeprosjekt, verktøyutdata, logger og visuell kontekst i samme økt, i stedet for å oppsummere eller kaste bort informasjon underveis. Videoinndata gjorde dessuten Ox Alpha relevant for grensesnittstesting og andre oppgaver som går utover tekstbasert kodegenerering. 343
Den første interessen var først og fremst praktisk. Utviklere kunne teste en multimodal kode- og agentmodell med svært lang kontekst, verktøystøtte og null tokenkostnad. Det senket terskelen for å prøve ut oppgaver som reparasjon av kodebaser, nettleserinteraksjon og langvarige programvareprosesser.
Synligheten økte raskt. Ox Alpha avbrøt kort DeepSeeks 56 dager lange rekke på toppen av en rangering i OpenCode, samtidig som det ble meldt om en uvanlig stor brukstopp på én dag. Påstander om svært høy kapasitet og enorme tokenmengder sirkulerte under lanseringen, men ikke alle var uavhengig kontrollert. De bør derfor først og fremst leses som tegn på intens interesse – ikke som presise mål på produksjonsskala. 114
Det er et viktig skille. Popularitet under en gratis prøveperiode måler en blanding av kvalitet, nyhet, pris og tilgjengelighet. Den beviser ikke alene at modellen totalt sett er best.
Den mest delte tidlige påstanden var et resultat på 80 prosent i DeepSWE, basert på åtte løste oppgaver av ti. Det er et interessant signal, men ti oppgaver er for lite til å gi en stabil plassering på en rangering. En større evaluering ble rapportert til rundt 63 prosent, mens Z.ai senere oppga 63,4 prosent på DeepSWE v1.1 for GLM-5.3-Flash. 7634
Andre fullskala vurderinger ga lavere resultater, blant annet 58,4 prosent på 113 oppgaver. Denne evalueringen knyttet en betydelig del av feilene til formatkrav og implementasjonsproblemer. Det illustrerer hvor følsomme agentbaserte tester er for oppsettet: verktøytilgang, testmiljø, tidsgrenser og kriteriene for hva som teller som løst. 4142
Den mest forsvarlige konklusjonen er derfor smalere enn den virale overskriften: Ox Alpha viste sterke ferdigheter i kodeagenter og havnet i nærheten av ledende lukkede modeller i enkelte evalueringer. Men materialet beviser ikke at modellen konsekvent slo Claude Fable 5 eller alle andre frontmodeller.
Testene brukte ulike oppgavesett, agentoppsett og evalueringsbetingelser. Et tidlig utvalg på ti oppgaver kunne gi 80 prosent uten å være representativt for hele benchmarken. En større kjøring på rundt 63 prosent forteller en annen historie, mens et resultat nær 58,4 prosent også kan inneholde ekstra straff for format- eller rammeverksfeil.
DeepSWE-teamet ble senere omtalt som at det vurderte modellens samlede evner til å være omtrent på nivå med Claude Opus 4.8, heller enn som et sikkert bevis på at den overgikk Claude Fable 5. Benchmarktall bør derfor alltid presenteres sammen med utvalg og testoppsett – ikke som om alle tallene var direkte sammenlignbare. 35
Begeistringen fra kjente brukere passet godt med modellens praktiske profil. Patrick Collison beskrev Ox Alpha som «svært imponerende» etter å ha brukt den gjennom et agentoppsett, mens grunnleggeren av HermesAgent sa at modellen overgikk flere av teamets interne evalueringsstandarder. 3335
Slike reaksjoner er relevante som erfaringer fra faktisk bruk, særlig innen programmering og agentoppgaver. De er likevel ikke det samme som en kontrollert, tverrgående konklusjon om at Ox Alpha var best på alt. En modell kan være svært nyttig i en bestemt arbeidsflyt på grunn av kontekstlengde, verktøykall, hastighet, støtte for flere medietyper eller pris – selv om den samlede benchmarkplasseringen fortsatt er usikker.
Før den offisielle avsløringen sammenlignet forskere og utviklere Ox Alphas observerbare oppførsel med mulige modeller fra Xiaomis MiMo-team, Google DeepMind og Zhipu AI.
Xiaomi ble ansett som mulig blant annet fordi MiMo-teamet tidligere hadde gjennomført en anonym test kalt «Hunter Alpha». Samtidig ble det påpekt en viktig forskjell: MiMo-modeller var forbundet med lydstøtte, mens Ox Alpha tok imot tekst, bilder og video – men ikke lyd. Xiaomi var derfor en interessant teori, ikke en sterk identifisering. 2229
Hint og innlegg med tilknytning til Google førte til mer spekulasjon, men de tilgjengelige sporene viste ikke at DeepMind hadde utviklet eller driftet endepunktet. De forble indirekte tegn, ikke bevis.
Det sterkeste sporet før avsløringen pekte mot Zhipus GLM-familie. Tester i miljøet viste at tokenbruken i Ox Alpha samsvarte med GLM-5.3 på tvers av ulike spørsmål, bortsett fra et fast, tilsynelatende tillegg på rundt 75 tokens. Separate videotester fant også tokenforbruk som samsvarte med GLM-visjonsmodeller på flere egenskaper ved kodingen. 1821
Andre rapporterte spor var:
reasoning_effort-feil som lignet et GLM API-svar;Hvert enkelt spor kunne skyldes ruting, et mellomlag, delt infrastruktur eller etterligning. Samlet gjorde de GLM-teorien stadig mer overbevisende, men de erstattet ikke en offisiell bekreftelse. Det avgjørende beviset kom da Z.ai identifiserte Ox Alpha som GLM-5.3-Flash og dokumenterte den navngitte lanseringen. 1043
Avsløringen gjorde Ox Alpha fra et attribusjonsmysterium til en produktforhåndsvisning. Z.ai beskriver GLM-5.3-Flash som en hybridmodell med 320 milliarder totale parametere og 18 milliarder aktive parametere, samt innebygde visuelle ferdigheter som lar den observere grensesnitt, se renderte resultater og bruke tilbakemeldinger fra interaksjoner. 43
Den navngitte lanseringen løste også hovedproblemet med et anonymt endepunkt: usikkerhet om hva som ville skje videre. Rapporter beskriver GLM-5.3-Flash som utgitt under MIT-lisensen, med vekter tilgjengelig for utviklere som ønsker større kontroll over driften. 1950
Det betyr ikke at enhver installasjon automatisk blir trygg eller billig. Utviklere må fortsatt vurdere maskinvarekrav, inferensytelse, API-vilkår, personvern, hastighetsgrenser, påliteligheten i verktøykall og hvor stabilt modellen oppfører seg i deres egne arbeidslaster.
Gratis tilgang skapte oppmerksomheten, men langsiktig bruk vil avhenge av mer varige produktegenskaper:
Hovedlærdommen fra Ox Alpha er derfor ikke at en anonym modell i noen dager slo en berømt konkurrent. Det interessante er hvordan en modell med en attraktiv arbeidsflyt kan spre seg raskt når utviklere får teste den i stor skala. Benchmarkhistorien var mer nyansert enn de første overskriftene, men kombinasjonen av lang kontekst, multimodalitet, verktøybruk, agentbasert koding og lav pris var sterk nok til å skape reell interesse. Nå som identiteten er avklart som GLM-5.3-Flash, gjenstår det viktigste spørsmålet: Er kombinasjonen fortsatt nyttig når nyhetens interesse og gratis tilgang ikke lenger gjør jobben?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha var en anonym forhåndsversjon av Z.ai modellen GLM 5.3 Flash, bekreftet 26.
Ox Alpha var en anonym forhåndsversjon av Z.ai modellen GLM 5.3 Flash, bekreftet 26. Modellen avbrøt kort DeepSeeks 56 dager lange seiersrekke på OpenCode og skapte svært høy etterspørsel, men fullstendige tester plasserte den nærmere Claude Opus 4.8 enn som et bevis på suverenitet over alle konkurren...
GLM 5.3 Flash viderefører kombinasjonen av én million tokens i kontekst, visuelle ferdigheter og agentbasert koding.