Ox Alpha var GLM 5.3 Flash, bekræftede Z.ai den 26. august 2026 efter seks dages anonym test på OpenRouter og OpenCode. Modellen har 320 milliarder parametre i en mixture of experts arkitektur, hvor 18 milliarder aktiveres pr.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
I seks dage brugte udviklere en kraftfuld AI-model ved navn Ox Alpha uden at vide, hvem der stod bag. Modellen dukkede op gratis og uden angivet udvikler på OpenRouter og OpenCode den 20. august 2026. Den tilbød et kontekstvindue på én million tokens samt input i form af tekst, billeder og video. Den 26. august bekræftede Z.ai – Zhipu AIs internationale brand – at Ox Alpha var GLM-5.3-Flash, den første indbygget multimodale model i GLM-5-serien. 2
5
9
Afsløringen forvandlede en anonym offentlig test til en produktlancering. GLM-5.3-Flash blev udgivet med åbne vægte under MIT-licensen, lave annoncerede API-priser og en arkitektur, der skal gøre arbejde med lange kontekster, programmering og AI-agenter billigere. 6
7
9
Ox Alpha dukkede først op på OpenRouter og OpenCode uden kendt afsender, til en pris på nul dollar og med en kontekstgrænse på 1.048.576 tokens. Modellen kunne håndtere tekst, billeder og video, og udviklere satte den hurtigt til at arbejde med kodeagenter, terminalopgaver og lange arbejdsforløb. 4
5
8
Fællesskabet begyndte derefter at lede efter spor. Blandt de tegn, der blev fremhævet, var tokeniseringsadfærd, der mindede om GLM-modeller, samt bestemte mønstre i API-fejl. Det førte til spekulationer om, at Zhipu AI stod bag. Z.ai bekræftede til sidst selv forbindelsen den 26. august og forklarede, at den anonyme lancering skulle indsamle feedback fra virkelige brugere før den officielle udgivelse. 5
9
Forhåndstesten fik et usædvanligt højt aktivitetsniveau. En samtidig rapport angav, at modellen havde behandlet 42 billioner tokens på seks dage, mens en anden nævnte omkring 44 billioner tokens og 503.000 OpenCode-brugere. Tallene stammer fra forskellige rapporter og måletidspunkter og bør derfor ikke lægges sammen eller opfattes som ét uafhængigt verificeret resultat. 8
11
16
GLM-5.3-Flash er en model med åbne vægte, udviklet til programmering, langvarige agentopgaver og multimodale arbejdsgange. Z.ai beskriver den som den første native multimodale model i GLM-5-familien. Den kan modtage visuelle input og har et kontekstvindue på én million tokens, så en enkelt opgave kan rumme store kodebaser, dokumenter, skærmbilleder og andre inputtyper. 7
20
Den mest iøjnefaldende tekniske egenskab er en mixture-of-experts-model med 320 milliarder parametre, hvor 18 milliarder parametre aktiveres pr. token. I praksis har modellen en stor samlet kapacitet, men sender hvert token gennem kun en del af systemet. Z.ai oplyser desuden, at den kombinerer sparse og lineær attention for at reducere beregningsbehovet og kravene til key-value-cachen under inferens. 6
20
Det er forklaringen på navnet ”Flash”. Modellen er ikke lille, men den er designet til at kunne levere lavere driftsomkostninger end en tæt model med samme samlede antal parametre. Den reducerede beregning kan gøre hvert token billigere at behandle, men den faktiske hastighed og pris afhænger stadig af hardware, software til modelservering, batching og den konkrete arbejdsbelastning.
Z.ai rapporterer en score på 63,4 for GLM-5.3-Flash på DeepSWE v1.1 mod 46,2 for GLM-5.2. Virksomheden har også offentliggjort en intern sammenligning med Claude Opus 4.8 på 29,0 mod 29,5. 7
8
Tallene er interessante pejlemærker, men de udgør ikke en universel rangliste over modelkvalitet. DeepSWE-resultatet er en benchmarkpåstand fra leverandøren, og sammenligningen med Claude er beskrevet som en intern evaluering. Forskelle i prompts, værktøjer, agentopsætning, mulig testforurening og bedømmelse kan påvirke resultaterne betydeligt.
Der er derfor stadig brug for uafhængige og reproducerbare tests, før modellen kan siges at være bredt på niveau med lukkede frontmodeller. For udviklere er den mere konkrete pointe, om modellen passer til arbejdsgangen: Kan den gennemgå store repositories, forstå visuel kontekst og arbejde gennem lange agentopgaver uden konstant at komprimere historikken?
I praksis afhænger produktionsværdien ikke kun af benchmarkscoren, men også af stabilitet, værktøjsbrug, svartid og evnen til at håndtere fejl.
Z.ai annoncerede API-priser på 0,15 dollar pr. million inputtokens og 0,50 dollar pr. million outputtokens. Dokumentationen viste senere en midlertidig rabat på 50 procent, som sænkede priserne til henholdsvis 0,075 og 0,25 dollar i den angivne kampagneperiode. 2
Modelvægtene blev udgivet på Hugging Face under MIT-licensen, hvilket er mere fleksibelt end en model, der kun kan tilgås som en hostet tjeneste. MIT-licensen tillader generelt kommerciel brug og ændringer, men udviklere bør stadig gennemgå den konkrete licens, modelvilkår, afhængigheder, hardwarekrav og eventuelle forpligtelser ved den valgte implementering. 2
9
Z.ai’s dokumentation angiver også GLM-5.3-Flash som en del af virksomhedens udvikler- og coding-plan-økosystem. API-dokumentationen beskriver multimodale chat-completion-inputs og understøttelse af værktøjsbrug. 17
20
21
Lanceringen handlede om mere end selve modellen. Z.ai oplyste, at den anonyme Ox Alpha-forhåndstest udelukkende blev afviklet på kinesisk fremstillede AI-acceleratorer, og at virksomheden brugte en tilpasset serveringsstack baseret på SGLang. I virksomhedens tekniske materiale fremstilles opsætningen som et forsøg på at forbedre inferenseffektiviteten på indenlandsk hardware.
Nogle sekundære rapporter gentager en påstand om, at den tilpassede stack tredoblede den samlede ydeevne. Hverken acceleratorflåden, den præcise sammenligning eller graden af uafhængighed af udenlandske komponenter er dog blevet uafhængigt revideret i de kilder, der ligger til grund for denne artikel. 10
Hvis oplysningerne bliver bekræftet, vil de være strategisk relevante for Kinas forsøg på at opbygge konkurrencedygtige AI-tjenester under USA’s eksportrestriktioner på avancerede chips. Indtil videre bør de dog forstås som en væsentlig virksomhedsoplysning – ikke som et endeligt bevis på, at kinesisk hardware har lukket det bredere infrastrukturgab.
Ox Alpha-strategien gav Z.ai noget, en traditionel lancering ofte ikke kan: store mængder uforudsigelig brug fra udviklere, der ikke kendte modellens identitet. Brugerne afprøvede den i kodeagenter og lange arbejdsgange, fordi den var gratis og virkede usædvanligt kapabel – ikke fordi de havde læst et marketingark. Z.ai sagde, at formålet var at indsamle feedback før den officielle lancering. 5
9
Metoden passer også til en strategi baseret på åbne vægte. Ved at kombinere en mere tilladende licens med lave API-priser og bred adgang kan Z.ai fremme eksperimenter, samle feedback og opbygge brug omkring modellen uden udelukkende at satse på et traditionelt abonnementssystem for lukkede modeller.
Tidligere anonyme modeltests, blandt andet det rapporterede Pony Alpha-forsøg, tyder på, at Ox Alpha ikke nødvendigvis var en enkeltstående idé. Kilderne indeholder dog kun begrænsede oplysninger om det tidligere projekt.
GLM-5.3-Flash beviser ikke i sig selv, at Z.ai har etableret en ny samlet frontposition. Det stærkeste grundlag er kombinationen af offentliggjorte specifikationer, en usædvanligt succesfuld offentlig forhåndstest samt benchmark- og infrastrukturpåstande fra virksomheden. Uafhængige evalueringer og længere tids brug i produktion må afgøre, hvordan modellen klarer sig inden for programmering, multimodal ræsonnering, værktøjsbrug, svartid og stabilitet.
Det konkurrencemæssige signal er alligevel tydeligt. En model med én million tokens kontekst, native multimodale input, åbne vægte og API-priser målt i cent pr. million tokens lægger pres på økonomien i dyre, lukkede systemer. Lanceringen viser også, hvordan anonyme forhåndstests kan fungere som både stresstest i virkeligheden og distributionskanal.
Mysteriet omkring Ox Alpha er dermed løst: Modellen var Z.ai’s GLM-5.3-Flash. Det større spørgsmål er nu praktisk snarere end detektivagtigt: Hvor godt holder løftet om lav pris og lang kontekst, når udviklere går fra en gratis viral test til gentagelige arbejdsgange i produktion?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha var GLM 5.3 Flash, bekræftede Z.ai den 26. august 2026 efter seks dages anonym test på OpenRouter og OpenCode.
Ox Alpha var GLM 5.3 Flash, bekræftede Z.ai den 26. august 2026 efter seks dages anonym test på OpenRouter og OpenCode. Modellen har 320 milliarder parametre i en mixture of experts arkitektur, hvor 18 milliarder aktiveres pr.
Den åbne MIT licens, multimodale input og annoncerede API priser på 0,15 dollar pr.