Ox Alpha was de anonieme testversie van Zhipu AI’s GLM 5.3 Flash. Het model verscheen op 20 augustus 2026 en werd op 26 augustus geïdentificeerd.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash is het model achter het anonieme Ox Alpha-eindpunt dat op 20 augustus 2026 opdook op OpenRouter en andere ontwikkelplatforms. Zhipu AI — internationaal actief als Z.ai — maakte op 26 augustus bekend dat het model van het bedrijf was. De naamloze release diende als praktijktest voor programmeerwerk, multimodale taken en AI-agents. 3
4
Daarmee veranderde een weeklange AI-mysterie in een opvallende release van open gewichten: een mixture-of-expertsmodel met in totaal 320 miljard parameters, waarvan er per token 18 miljard worden geactiveerd. Het model heeft bovendien een contextvenster van ongeveer één miljoen tokens, native multimodale invoer en gewichten onder de MIT-licentie. 3
6
8
Ox Alpha verscheen zonder modelkaart, fabrikant of uitgebreide specificaties. Ontwikkelaars ontdekten een gratis eindpunt met een lange context en ondersteuning voor multimodale invoer. Vervolgens gingen ze het model testen in programmeeromgevingen en agent-workflows. De praktische prestaties waren opvallend genoeg om speculatie over de maker op gang te brengen. 13
16
Volgens Zhipu was de preview bewust geblindeerd. Door de naam, bedrijfsidentiteit en technische details achter te houden, wilde het bedrijf dat ontwikkelaars vooral naar de resultaten keken — niet naar merkbekendheid, parameter-aantallen of marketing rond de lancering. Het gebruik leverde patronen en feedback op uit echte software- en agenttaken, nog voordat het model officieel werd gepresenteerd. 13
15
Tijdens de test werd in berichtgeving gesproken over ongeveer 100 biljoen tokens aan gratis capaciteit per dag. Ook zou Patrick Collison, medeoprichter van Stripe, het model hebben geprezen om zijn kwaliteit. Zulke reacties hielpen om van het anonieme eindpunt een veelbesproken release te maken. Publieke lof is uiteraard nog geen gecontroleerde, onafhankelijke evaluatie. 13
14
Zhipu stelde daarnaast dat de dienst draaide op in China geproduceerde AI-versnellers. De South China Morning Post meldde dat de proef gebruikmaakte van een cluster van 100.000 van zulke chips en dat het model vóór de officiële release 62 biljoen tokens had verwerkt. Omdat verschillende bronnen uiteenlopende cijfers noemen over capaciteit en gebruik, moeten deze aantallen worden gezien als gerapporteerde bedrijfs- of mediacijfers en niet als onafhankelijk gecontroleerde metingen. 7
13
GLM-5.3-Flash is een mixture-of-expertsmodel, meestal afgekort tot MoE. Het totale model bevat 320 miljard parameters, maar bij het verwerken van ieder token wordt slechts een deel — 18 miljard parameters — actief gebruikt. Zo probeert de architectuur de capaciteit van een zeer groot model te combineren met lagere rekenlast per inferentiestap. 3
4
Het model telt 45 lagen en is volgens Zhipu het eerste model binnen de GLM-5-serie dat van meet af aan multimodaal is ontworpen. Het kan overweg met tekst, afbeeldingen, video, visuele documenten, bestanden en combinaties daarvan. Dat is relevant voor agents die bijvoorbeeld een scherm moeten bekijken, een screenshot moeten interpreteren, een document moeten lezen of het resultaat van uitgevoerde code moeten beoordelen. 4
11
Zhipu noemt een contextvenster van 1.048.576 tokens, doorgaans afgerond op één miljoen tokens. Die ruimte is bedoeld voor grote softwareprojecten, lange agentsessies, omvangrijke documentverzamelingen en workflows waarin code, bestanden en visuele informatie samenkomen. 3
4
GLM-5.3-Flash is volgens Zhipu vanaf een nieuwe basis getraind met een vernieuwde architectuur en trainingsmethode. Het bedrijf zegt daarvoor een multimodale dataset van 30 biljoen tokens te hebben gebruikt. Het model wordt daarmee gepresenteerd als een nieuwe architectuur die efficiëntie en multimodaliteit centraal stelt, niet simpelweg als een kleinere versie van GLM-5.3. 4
16
De architectuur combineert lineaire aandacht met schaarse aandacht. Lineaire aandacht moet het verwerken van lange-afstandsrelaties in een reeks minder duur maken. Schaarse aandacht bewaart juist selectief gedetailleerdere interacties op plaatsen waar die belangrijk zijn. Het doel is een balans tussen lange contexten en beheersbare inferentiekosten. 4
16
Zhipu beschrijft ook IndexPool, een mechanisme dat de geheugen- en latentiebelasting van indexering bij zeer lange contexten moet beperken. Daarnaast gebruikt het model manifold-constrained hyper-connections als techniek om efficiënter op te schalen. De werkelijke impact van zulke implementatiedetails hangt af van onder meer de hardware, de serverconfiguratie, de lengte van de context en het type taak. 4
16
Ten opzichte van GLM-5.3 claimt Zhipu dat GLM-5.3-Flash de aandachtberekening met 3,01 keer vermindert en het gebruik van de KV-cache met 4,44 keer terugbrengt, terwijl de kwaliteit bij lange contexten behouden blijft. Dat zijn belangrijke claims voor ontwikkelaars: juist aandachtberekening en KV-cachegeheugen kunnen grote knelpunten worden bij langdurig draaiende agents. De genoemde verhoudingen komen echter vooral uit technische documentatie van Zhipu en zijn geen universeel, onafhankelijk vastgesteld voordeel. 4
GLM-5.3-Flash richt zich vooral op programmeren, visuele softwareontwikkeling, langdurige agenttaken en het gebruik van externe tools. Dankzij de ingebouwde visuele mogelijkheden kan een agent interfaces, renderresultaten en interactiefeedback bekijken. Zo ontstaat een gesloten lus tussen code, browsers en grafische gebruikersinterfaces. 4
Zhipu rapporteert de volgende benchmarkresultaten:
Deze scores passen bij de positionering van het model als systeem voor software-engineering en agents. Vergelijken blijft wel oppassen geblazen. Agentbenchmarks zijn sterk afhankelijk van prompts, gebruikte tools, extra softwarelagen, tijdslimieten en de versie van de evaluatie. De cijfers zijn daarom in de eerste plaats door Zhipu gerapporteerde resultaten, geen definitieve ranglijst van alle concurrerende modellen. 4
15
Zhipu publiceerde de gewichten van GLM-5.3-Flash op Hugging Face onder de soepele MIT-licentie, inclusief een BF16-versie. De modeldocumentatie noemt ondersteuning voor frameworks als SGLang en vLLM. Organisaties krijgen daardoor de mogelijkheid om het model lokaal of op eigen infrastructuur te draaien, in plaats van uitsluitend gebruik te maken van de gehoste API van Z.ai. 3
6
8
Dat maakt de praktische afweging anders. Ontwikkelaars kunnen het model testen met hun eigen codebases, documenten, interfaces en agentomgevingen. Infrastructuurteams kunnen bovendien zelf de benodigde hardware en de kosten van serveren onderzoeken. De totale omvang van 320 miljard parameters betekent wel dat lokaal draaien een aanzienlijk engineeringproject blijft. Het feit dat per token slechts 18 miljard parameters actief zijn, verlaagt de rekenlast, maar maakt het volledige model niet automatisch licht of eenvoudig te implementeren.
De Ox Alpha-proef was meer dan een marketingtruc. Zhipu testte of ontwikkelaars het model zouden blijven gebruiken wanneer de naam, het aantal parameters en de bedrijfsachtergrond verborgen waren. Dat leverde een vorm van productfeedback op die dicht bij de praktijk staat: gebruikers brachten hun eigen taken mee en reageerden op de resultaten voordat de officiële introductie plaatsvond. 13
15
Aan de test zitten ook duidelijke beperkingen. Gratis toegang kan uitzonderlijk veel verkeer aantrekken, publieke lof kan deels door de nieuwigheid worden ingegeven en een anonieme proef controleert niet of iedereen dezelfde prompts of dezelfde werkomstandigheden gebruikt. De voorzichtigste conclusie is daarom: GLM-5.3-Flash trok al veel belangstelling van ontwikkelaars voordat bekend was wie het had gemaakt, en Zhipu gebruikte die belangstelling om de release te testen en te onderbouwen.
GLM-5.3-Flash is de onthulde identiteit van Ox Alpha: een model met open gewichten, native multimodaliteit en een duidelijke focus op efficiënt programmeren en agenttaken. De belangrijkste specificaties zijn een MoE-architectuur met 320 miljard parameters in totaal en 18 miljard actieve parameters per token, 45 lagen, een contextvenster van één miljoen tokens, een combinatie van lineaire en schaarse aandacht en gewichten onder de MIT-licentie. 3
4
11
De grootste belofte zit dus niet alleen in de schaal. Het gaat om de combinatie van lange context, visuele invoer, toolgebruik en lagere, door Zhipu geclaimde serverlast — in een model dat ontwikkelaars zelf kunnen downloaden en inzetten. De blinde lancering leverde ongewoon directe feedback uit de praktijk op, maar onafhankelijke en reproduceerbare evaluaties zijn nog nodig om vast te stellen hoe deze architectuur- en benchmarkclaims zich vertalen naar prestaties in productie.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha was de anonieme testversie van Zhipu AI’s GLM 5.3 Flash. Het model verscheen op 20 augustus 2026 en werd op 26 augustus geïdentificeerd.
Ox Alpha was de anonieme testversie van Zhipu AI’s GLM 5.3 Flash. Het model verscheen op 20 augustus 2026 en werd op 26 augustus geïdentificeerd. GLM 5.3 Flash is gericht op programmeren, visuele softwareontwikkeling, lange contexten en agents die tools gebruiken.
Zhipu claimt dat de combinatie van lineaire en schaarse aandacht de aandachtberekening met 3,01 keer en het KV cachegebruik met 4,44 keer verlaagt ten opzichte van GLM 5.3.