Z.ai bekreftet 26. august 2026 at den anonyme gratismodellen Ox Alpha var GLM 5.3 Flash – en multimodal MoE modell med 320 milliarder parametere, hvor 18 milliarder aktiveres per token.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mysteriet fikk sin løsning 26. august 2026: Z.ai bekreftet at Ox Alpha, den anonyme modellen som var tilgjengelig via OpenRouter og OpenCode, var GLM-5.3-Flash. Z.ai beskriver den som den første genuint multimodale modellen i GLM-5-familien, med åpne vekter, et kontekstvindu på én million token og særlig vekt på programmering og langvarige agentoppgaver. 1540
Det mest interessante handler likevel om mer enn modellens identitet. Ox Alpha kombinerte en gratis og anonym forhåndstest med bruk i stor skala blant utviklere. Deretter ble modellen lansert som et navngitt produkt som kan lastes ned. På den måten fikk Z.ai testet infrastrukturen under reell belastning, samtidig som selskapet bygget forventning rundt lanseringen.
GLM-5.3-Flash er en mixture-of-experts-modell med 320 milliarder parametere totalt og 18 milliarder aktive parametere per token. Den tar inn tekst, bilder og video direkte, men produserer tekst som svar. Den oppgitte kontekstevnen er rundt én million token. Den nøyaktige grensen varierer imidlertid mellom plattformene: Z.ai dokumenterer et design på én million token, mens OpenRouter oppgir et kontekstvindu på 1 310 720 token. 12340
Z.ai publiserte vektene under MIT-lisensen, noe som gjør modellen langt enklere å ta i bruk og drifte selv enn en tradisjonell, lukket API-tjeneste. Etter at den anonyme forhåndstesten var over, ble modellen også oppført under sitt offentlige navn på OpenRouter. 348
GLM-5.3-Flash må ikke forveksles med den større GLM-5.3-modellen som ble annonsert tidligere i august. Omtalen beskriver Flash som en separat og rimeligere 320B-A18B-modell, ikke som samme produktvariant som den større GLM-5.3-linjen. 10
Z.ai sier at GLM-5.3-Flash er bedre enn GLM-5.2, samtidig som den koster mindre å kjøre. I resultatene som ble oppgitt rundt lanseringen, fikk modellen 63,4 poeng i DeepSWE v1.1, mot 46,2 for GLM-5.2. Z.ai rapporterte også 29,0 poeng på sin interne kodebenchmark, mot 29,5 som ble rapportert for Claude Opus 4.8. 316
Tallene sier noe om hvordan Z.ai posisjonerer modellen, men de bekrefter ikke uavhengig at den er på nivå med Anthropics modell. Benchmarkens utforming, testoppsett, instruksjoner og muligheten for å gjenta evalueringen har mye å si. Den mest forsiktige konklusjonen er derfor at Z.ai hevder å tilby sterk kode- og agentytelse til langt lavere kostnad – ikke at GLM-5.3-Flash entydig har passert de lukkede frontmodellene.
Det mest iøynefallende ved Ox Alpha var at utviklere kunne prøve modellen uten å betale i den anonyme perioden. Denne fasen tok slutt da modellen fikk sin offentlige identitet. Z.ai oppga en listepris på $0.15 per million input-token og $0.50 per million output-token. 13
OpenRouter viste samtidig en lavere introduksjonspris på $0.075 per million input-token og $0.25 per million output-token. 2 Forskjellen er viktig: Den gratis forhåndstesten, Z.ai sin ordinære listepris og en tidsbegrenset rabatt på én plattform er tre ulike tilgangsvilkår.
Selv til listepris er økonomien en sentral del av modellens appell. Kodeagenter kan bruke store mengder kontekst og produsere mange token. Da kan lave tokenkostnader påvirke valg av modell minst like mye som et lite forsprang på en benchmark.
Z.ai sier at GLM-5.3-Flash kjørte utelukkende på AI-akseleratorer produsert i Kina. 15 Omtale av systemet beskriver en tilpasset stakk basert på SGLang, med blant annet kvantisering, tensorparallellisme, blandede cache-formater, lagdeling og en separat encode–prefill–decode-arkitektur. Målet skal ha vært bedre ytelse fra ende til ende, samtidig som systemet måtte tilpasses begrensningene i innenlandsk maskinvare. 25
Dette bygger videre på Z.ai sitt tidligere budskap rundt GLM-familien. Selskapet har sagt at modellene ble trent på Huawei Ascend-prosessorer uten Nvidia-maskinvare. Omtale peker også på at Z.ai står på USAs Entity List, noe som begrenser tilgangen til Nvidias H100-, H200- og B200-akseleratorer. 26
Påstanden om kinesisk maskinvare er strategisk viktig, men bør leses som en uttalelse fra selskapet og bransjerapportering – ikke som en fullstendig, uavhengig revisjon av maskinvareytelsen. Det best dokumenterte poenget er at Z.ai presenterer modellstakken som i stand til å betjene en stor multimodal modell uten å være avhengig av Nvidias fremste datasenter-GPU-er.
Den anonyme lanseringen ser ut til å ha fulgt en bevisst oppskrift: Slipp en kapabel modell uten avsender, tilby den gratis gjennom populære kodeverktøy, se hvordan utviklere bruker den, og avslør produktet etter at systemet har samlet inn tilbakemeldinger fra virkeligheten. Z.ai har også blitt knyttet til en tidligere «Pony Alpha»-test med en lignende idé. Samtidig forsøkte folk i teknologimiljøet å identifisere Ox Alpha gjennom tokenizermønstre, videobehandling og feilmeldinger fra API-et. 71113
Enkelte rapporter fra lanseringsperioden viste dessuten til svært høye brukstall og stor entusiasme blant utviklere. Det tilgjengelige materialet bekrefter imidlertid ikke uavhengig alle tallene eller sitatene. Slike opplysninger bør derfor behandles som lanseringsrapportering, ikke som reviderte adopsjonstall. 14
GLM-5.3-Flash beviser ikke at Z.ai har gått forbi OpenAI eller Anthropic på tvers av hele spekteret av egenskaper i frontmodellene. Det modellen viser, er en mer forstyrrende kombinasjon: multimodal input, svært lang kontekst, åpne vekter under MIT-lisensen, spesialisering mot kodeagenter og lave API-priser i én og samme lansering. 1540
For utviklere kan dette gjøre det enklere å bytte leverandør, kjøre modellen selv eller sette opp løsninger med flere modelltilbydere. For leverandører av lukkede modeller øker presset på pris og marginer – særlig i kodearbeidsflyter, der tokenforbruk, responstid, kontroll over driften og tilgang til vektene kan være like viktig som plasseringen på en resultatliste.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai bekreftet 26. august 2026 at den anonyme gratismodellen Ox Alpha var GLM 5.3 Flash – en multimodal MoE modell med 320 milliarder parametere, hvor 18 milliarder aktiveres per token.
Z.ai bekreftet 26. august 2026 at den anonyme gratismodellen Ox Alpha var GLM 5.3 Flash – en multimodal MoE modell med 320 milliarder parametere, hvor 18 milliarder aktiveres per token. Modellen tar imot tekst, bilder og video, har et kontekstvindu på rundt én million token og leveres med vekter under MIT lisensen.
Sniklanseringen ga Z.ai trafikk fra virkelige kodeagenter før modellen fikk navn, og fungerte dermed både som en storskala infrastrukturt test og som en effektiv markedsføringsstrategi.