Z.ai bevestigde op 26 augustus 2026 dat de anonieme gratis preview Ox Alpha eigenlijk GLM 5.3 Flash was: een Mixture of Experts model met 320 miljard parameters, waarvan er 18 miljard per token actief zijn. Het model verwerkt tekst, afbeeldingen en video, heeft een contextvenster van ongeveer één miljoen tokens en v...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Op 26 augustus 2026 kwam er een einde aan het mysterie rond Ox Alpha. Z.ai bevestigde dat het anonieme model dat via OpenRouter en OpenCode werd aangeboden, GLM-5.3-Flash was. Z.ai presenteert het als het eerste native multimodale model in de GLM-5-familie, met open gewichten, een contextvenster van één miljoen tokens en een focus op programmeren en langdurige agenttaken. 1540
De belangrijkste les gaat echter verder dan de identiteit van het model. Ox Alpha combineerde een gratis, anonieme preview met gebruik op grote schaal door ontwikkelaars. Daarna veranderde het in een officieel benoemd en downloadbaar product. Zo kon Z.ai zijn infrastructuur testen onder echte belasting en tegelijk belangstelling opbouwen voor de uiteindelijke release.
GLM-5.3-Flash is een Mixture-of-Experts-model met in totaal 320 miljard parameters, waarvan 18 miljard parameters per token actief zijn. Het model accepteert native tekst, afbeeldingen en video en produceert tekst als uitvoer. De opgegeven contextcapaciteit bedraagt ongeveer één miljoen tokens. De exacte limiet verschilt per platform: de documentatie van Z.ai spreekt over een ontwerp voor één miljoen tokens, terwijl OpenRouter een contextvenster van 1.310.720 tokens vermeldt. 12340
Z.ai heeft de modelgewichten uitgebracht onder de MIT-licentie. Daardoor is het model aanzienlijk eenvoudiger zelf te gebruiken of te hosten dan een systeem dat uitsluitend via een gesloten API beschikbaar is. Na afloop van de anonieme preview verscheen het model op OpenRouter onder zijn officiële naam. 348
GLM-5.3-Flash moet niet worden verward met het grotere GLM-5.3-product dat eerder in augustus werd aangekondigd. Volgens berichtgeving gaat het om een afzonderlijk, goedkoper 320B-A18B-model en niet om dezelfde productvariant als de grotere GLM-5.3-lijn. 10
Z.ai zegt dat GLM-5.3-Flash beter presteert dan GLM-5.2 en tegelijk goedkoper te bedienen is. In de resultaten die rond de lancering werden genoemd, behaalde het model 63,4 punten op DeepSWE v1.1, tegenover 46,2 voor GLM-5.2. Z.ai rapporteerde daarnaast 29,0 punten op zijn interne programmeerbenchmark, dicht bij de 29,5 die voor Claude Opus 4.8 werd gemeld. 316
Die cijfers zijn nuttig om te begrijpen hoe Z.ai het model positioneert, maar vormen geen onafhankelijke bevestiging dat het model op gelijke hoogte staat met dat van Anthropic. De precieze benchmarkdefinities, testinstellingen, prompts en mogelijkheden om de resultaten te reproduceren zijn van belang. De voorzichtigste conclusie is dan ook dat Z.ai sterke programmeer- en agentprestaties claimt tegen veel lagere kosten — niet dat GLM-5.3-Flash aantoonbaar alle gesloten frontiermodellen heeft ingehaald.
Het opvallendste aspect van Ox Alpha was dat ontwikkelaars het tijdens de anonieme preview gratis konden uitproberen. Die fase eindigde toen het model een officiële naam kreeg. De door Z.ai vermelde lijstprijs bedraagt $0,15 per miljoen invoertokens en $0,50 per miljoen uitvoertokens. 13
OpenRouter toonde rond de lancering een lagere promotieprijs van $0,075 per miljoen invoertokens en $0,25 per miljoen uitvoertokens. 2 Dat onderscheid is belangrijk: de gratis preview, de lijstprijs van Z.ai en een tijdelijke korting op één platform zijn drie verschillende toegangsvoorwaarden.
Zelfs tegen de genoemde lijstprijs zijn de kosten een belangrijk onderdeel van de aantrekkingskracht. Coding agents kunnen grote hoeveelheden context en uitvoer verbruiken. Daardoor kan een lage tokenprijs de keuze voor een model net zo sterk beïnvloeden als een klein voordeel op een benchmark.
Z.ai zegt dat GLM-5.3-Flash volledig draait op AI-versnellers van Chinese makelij. 15 Berichtgeving over het serversysteem beschrijft een aangepaste stack op basis van SGLang, met onder meer kwantisatie, tensorparallelisme, gemengde cache-indelingen, het opsplitsen van lagen en een afzonderlijke architectuur voor encode, prefill en decode. Het doel daarvan was volgens de berichtgeving om de prestaties van de volledige dienstverlening te verbeteren binnen de beperkingen van binnenlandse hardware. 25
Daarmee bouwt Z.ai voort op een eerder verhaal rond de GLM-familie. Het bedrijf heeft gezegd dat de familie is getraind op Huawei Ascend-processors, zonder Nvidia-hardware. Berichtgeving vermeldt bovendien dat Z.ai op de Amerikaanse Entity List staat, waardoor de toegang tot Nvidia’s H100-, H200- en B200-versnellers wordt beperkt. 26
De claim over de gebruikte inferentie-infrastructuur is strategisch belangrijk, maar moet worden gelezen als een mededeling van het bedrijf en de sector — niet als een volledig geaudite vergelijking van hardwareprestaties. De beter onderbouwde conclusie is dat Z.ai zijn modelstack presenteert als geschikt voor de bediening van een groot multimodaal model zonder afhankelijkheid van Nvidia’s krachtigste datacenter-GPU’s.
De anonieme release lijkt een bewuste stealth-lanceringsstrategie te hebben gevolgd: publiceer een capabel model zonder naamsvermelding, bied het gratis aan via populaire programmeerroutes, kijk hoe ontwikkelaars het gebruiken en onthul daarna het product. Z.ai werd eerder in verband gebracht met een vergelijkbare test onder de naam Pony Alpha. Intussen probeerde de community Ox Alpha te identificeren aan de hand van tokenizergedrag, aanwijzingen in videobewerking en patronen in API-fouten. 71113
Sommige berichten uit de lanceringsperiode maakten ook melding van uitzonderlijk hoge gebruiksvolumes en veel enthousiasme onder ontwikkelaars. Niet elk genoemd cijfer of citaat kan op basis van het beschikbare materiaal onafhankelijk worden geverifieerd. Zulke claims kunnen daarom het best worden gezien als berichtgeving rond de lancering, niet als gecontroleerde adoptiecijfers. 14
De aanpak is interessant omdat hij productontwikkeling, infrastructuurtesten en marketing in één beweging samenbrengt. Ontwikkelaars kregen een model dat ze in echte workflows konden gebruiken; Z.ai kreeg feedback en informatie over de belasting van zijn systemen; en de onthulling kreeg extra aandacht doordat gebruikers eerst zelf naar de maker moesten speuren.
GLM-5.3-Flash bewijst niet dat Z.ai OpenAI of Anthropic op alle onderdelen van frontier-AI voorbij is. Wat de release wel laat zien, is een opvallende combinatie van native multimodale invoer, zeer lange context, open gewichten onder de MIT-licentie, specialisatie in coding agents en lage API-prijzen. 1540
Voor ontwikkelaars kan die combinatie de overstap naar een andere aanbieder goedkoper maken en self-hosting of een opzet met meerdere aanbieders praktischer maken. Voor aanbieders van gesloten modellen betekent het extra druk op prijzen en marges — vooral bij programmeerworkloads, waar tokenvolume, latency, controle over de implementatie en beschikbare hardware soms net zo belangrijk zijn als een plek bovenaan een ranglijst.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai bevestigde op 26 augustus 2026 dat de anonieme gratis preview Ox Alpha eigenlijk GLM 5.3 Flash was: een Mixture of Experts model met 320 miljard parameters, waarvan er 18 miljard per token actief zijn.
Z.ai bevestigde op 26 augustus 2026 dat de anonieme gratis preview Ox Alpha eigenlijk GLM 5.3 Flash was: een Mixture of Experts model met 320 miljard parameters, waarvan er 18 miljard per token actief zijn. Het model verwerkt tekst, afbeeldingen en video, heeft een contextvenster van ongeveer één miljoen tokens en verschijnt met open gewichten onder de MIT licentie.
De stille lancering gaf Z.ai realistisch verkeer van ontwikkelaars en coding agents voordat het bedrijf zijn naam aan het model koppelde — tegelijk een stresstest voor de infrastructuur en een krachtige marketingzet.