Zhipu AI bekræftede den 26. august 2026, at den anonyme model Ox Alpha – kaldet »Niu Lai« i kinesiske onlinefora – var GLM 5.3 Flash, en open weight model med indbygget multimodalitet og mixture of experts arkitektur.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Den 26. august 2026 satte Zhipu AI – også kendt internationalt som Z.ai – navn på den mystiske model, der i dagene forinden havde toppet brugslisterne under navnet Ox Alpha. I kinesiske udviklerfora var modellen blevet kendt som »Niu Lai«.
Zhipu bekræftede, at der var tale om GLM-5.3-Flash, en open-weight-model med indbygget multimodalitet og en mixture-of-experts-arkitektur. Modellen var blevet testet anonymt, før den officielle lancering. 1
4
6
Ox Alpha blev gjort gratis tilgængelig på udviklerplatformene OpenRouter og OpenCode. Efterspørgslen voksede hurtigt:
Zhipu oplyste samtidig, at hele tjenesten blev kørt på en klynge med mere end 100.000 kinesisk fremstillede chips. Virksomheden hævdede, at softwareoptimeringer havde bragt både hardwareudnyttelse og omkostningen pr. token ned på niveau med almindelige Nvidia-GPU'er. 3
6
De konkrete chipproducenter blev ikke offentliggjort. Huawei, Moore Threads og Hygon er blevet nævnt som mulige leverandører i medieomtale, men det er ubekræftet spekulation og ikke en bekræftelse fra Zhipu. 40
Afsløringen er interessant, fordi den viser, at en stor global inferensopgave – altså selve afviklingen af en model efter træningen – kunne håndteres på en kinesisk, ikke-Nvidia-baseret infrastruktur. Det er dog ikke dokumentation for, at Kina generelt har indhentet Nvidia, eller at kinesiske chips altid har samme omkostningsniveau som Nvidia-hardware. 3
6
Resultatet peger snarere på betydningen af systemdesign og specialiseret software. Zhipu brugte angiveligt en inferensmotor baseret på SGLang med blandt andet:
Teknikkerne skal reducere problemer med hukommelse, båndbredde, kommunikation og planlægning, især når modellen håndterer et kontekstvindue på op til én million tokens. Zhipu skulle have oplyst, at optimeringerne gav omkring tre gange bedre samlet serviceydelse end virksomhedens oprindelige udgangspunkt. 2
SGLang-dokumentationen beskriver desuden højere gennemløb og en væsentligt større FP8-cachekapacitet end i en sammenlignelig BF16-konfiguration. Det er dog ikke en uafhængig revision af Zhipus påstand om en tredobling af den samlede ydelse. 2
Det kan udfordre Nvidias stærke position inden for CUDA på udvalgte inferensopgaver: En modelspecifik softwarestak kan i nogle produktionsmiljøer mindske afhængigheden af CUDA. Det ændrer ikke ved CUDA-økosystemets bredere forspring inden for værktøjer, udviklere, træning og generel understøttelse. Kilderne giver derfor ikke grundlag for en stærkere konklusion.
GLM-5.3-Flash har ifølge de tilgængelige specifikationer:
Det er en såkaldt sparsom mixture-of-experts-model. Den indeholder mange parametre samlet set, men aktiverer kun en mindre del for hvert token. Det kan gøre modellen billigere at køre end en tæt model med samme samlede parameterantal.
Modellen skulle have opnået en score på 57 på Artificial Analysis Intelligence Index – samme rapporterede score som Claude Opus 4.8. Det bør læses som lighed på ét sammensat indeks, ikke som bevis på identisk præstation i alle benchmarks eller praktiske agentopgaver. 1
Zhipu positionerede GLM-5.3-Flash som konkurrent til effektive frontier-modeller som DeepSeek V4 Flash og Pro, samtidig med at virksomheden fremhævede en betydeligt lavere pris. Det tilgængelige materiale er dog ikke tilstrækkeligt til at bekræfte sammenligninger fra benchmark til benchmark med begge DeepSeek-varianter.
Zhipus offentliggjorte API-pris blev rapporteret til:
Samtidig beskrev samtidige rapporter prisen som cirka en tiendedel af GLM-5.3's og omkring en fyrretyvendedel af Claude Opus 4.8's. Sådanne forhold afhænger dog af, om man sammenligner input eller output, hvilken kontekstpris der gælder, og hvilken prisplan der bruges. 1
Afsløringen gjorde dermed Ox Alpha til mere end et viralt modelnavn: Den blev også et eksempel på, hvordan aggressiv prissætning, effektiv inferenssoftware og en stor kinesisk chipklynge kan kombineres til at håndtere meget omfattende brug – uden at det i sig selv beviser, at hele AI-hardwaremarkedet har ændret magtforhold.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI bekræftede den 26. august 2026, at den anonyme model Ox Alpha – kaldet »Niu Lai« i kinesiske onlinefora – var GLM 5.3 Flash, en open weight model med indbygget multimodalitet og mixture of experts arkitektur.
Zhipu AI bekræftede den 26. august 2026, at den anonyme model Ox Alpha – kaldet »Niu Lai« i kinesiske onlinefora – var GLM 5.3 Flash, en open weight model med indbygget multimodalitet og mixture of experts arkitektur. Den gratis test på OpenRouter og OpenCode tiltrak ifølge rapporter over 50 billioner tokens på fem dage og senere over 60 billioner på seks dage.
Zhipu oplyste, at driften foregik på en klynge med mere end 100.000 kinesisk fremstillede chips, men uden at navngive leverandørerne.