Den 26. august 2026 bekræftede Zhipu AI, også kendt som Z.ai, at den anonyme Ox Alpha model – kaldet »Niu Lai« i kinesiske udviklerkredse – var GLM 5.3 Flash.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Zhipu AI, der internationalt også går under navnet Z.ai, fjernede den 26. august 2026 sløret for den anonyme »Ox Alpha«-model. I kinesiske udviklerkredse var modellen kendt som »Niu Lai«. Zhipu bekræftede, at den i virkeligheden var GLM-5.3-Flash – en open-weight-model med indbygget multimodalitet fra virksomhedens GLM-serie. 1
15
Afsløringen kom sammen med en opsigtsvækkende påstand om infrastrukturen bag modellen. Zhipu siger, at systemet først blev stillet gratis til rådighed på OpenRouter og OpenCode, hvor det på fem dage behandlede mere end 50 billioner tokens. Hele trafikken skulle være blevet håndteret af en klynge med over 100.000 kinesisk fremstillede chips. 8
15
Ox Alpha blev lanceret uden et virksomhedsnavn eller en traditionel produktkampagne. Udviklere vurderede derfor modellen ud fra det, de selv oplevede: svarenes kvalitet, hastighed, tilgængelighed og pris – ikke Zhipus brand eller valget af hardware.
Modellen steg hurtigt til toppen af brugsranglisterne på både OpenRouter og OpenCode. Senere rapporter opgjorde trafikken til mere end 60 billioner tokens over seks dage, mens OpenRouter-brugen blev rapporteret til mere end det dobbelte af sammenlignelig DeepSeek-trafik. Tallene dækker forskellige tidsperioder og platformsmålinger, så den mest forsigtige konklusion er, at testen oversteg 50 billioner tokens og tiltrak usædvanligt stor efterspørgsel. 1
3
30
Det gør testen interessant: Modellen blev udsat for en stor mængde faktisk udviklertrafik, før brugerne kendte dens identitet. Det var i praksis markedet, der bedømte modellen, før Zhipu selv præsenterede den.
Zhipu oplyser, at den online inferens – altså den del, hvor modellen genererer svar – kørte på mere end 100.000 kinesisk fremstillede acceleratorer. Virksomheden hævder samtidig, at softwareoptimeringer bragte både hardwareudnyttelsen og omkostningen pr. token ned på et niveau, der kan sammenlignes med almindelige Nvidia-GPU’er. 15
24
De præcise chipleverandører blev ikke identificeret i det materiale, der ligger til grund for denne artikel. Huawei, Moore Threads og Hygon er blevet nævnt i branchemedier som mulige bidragydere, men det er ikke verificeret og bør ikke opfattes som en bekræftelse fra Zhipu. 30
40
Påstanden skal derfor læses snævert. Den dokumenterer ikke, at kinesiske chips matcher Nvidia på alle arbejdsbelastninger. Den viser heller ikke, at kinesisk hardware har erstattet Nvidia i modeltræning, eller at de to økosystemer har tilsvarende udviklerværktøjer.
Det, den peger på, er mere specifikt: En stor inferenstjeneste kan bygges på en ikke-Nvidia-baseret, kinesisk hardwareplatform, hvis modellen og systemet, der driver den, optimeres sammen.
Et kontekstvindue på op til én million tokens stiller store krav til hukommelse, båndbredde, kommunikation og planlægning. Zhipu byggede ifølge rapporteringen en dedikeret inferensmotor på SGLang og brugte blandt andet følgende teknikker:
Zhipu siger, at systemet på den samme hardware forbedrede den samlede serviceydelse med omkring tre gange sammenlignet med den oprindelige baseline. 24
26 Senere dokumentation fra SGLang viser yderligere forbedringer i gennemløb og FP8-cachekapacitet sammenlignet med en BF16-konfiguration. Dokumentationen er dog ikke en uafhængig revision af Zhipus oprindelige påstand om en tredobling.
17
For Nvidia handler konsekvensen derfor først og fremmest om CUDAs rolle i inferens – ikke om et øjeblikkeligt sammenbrud i virksomhedens samlede forspring. Specialiserede kerner, kvantisering, parallelisering og bedre planlægning kan mindske afhængigheden af CUDA i bestemte produktionsmiljøer.
Nvidias brede softwareøkosystem, værktøjer, installerede base og position inden for træning er separate konkurrencefordele, som denne lancering ikke afgør.
GLM-5.3-Flash beskrives som en sparsom mixture-of-experts-model med 320 milliarder samlede parametre og cirka 18 milliarder aktive parametre pr. token. Den understøtter et kontekstvindue på 1.048.576 tokens og har indbygget multimodal input. Det gør den relevant til blandt andet lange dokumenter, programmering og længerevarende agentforløb. 2
5
7
Modellen fik ifølge rapporteringen en score på 57 på Artificial Analysis Intelligence Index – samme rapporterede score som Claude Opus 4.8. Det er lighed på ét sammensat indeks, ikke dokumentation for ensartet præstation på alle benchmarks, programmeringsopgaver eller agentopgaver. 9
Zhipu oplyste en API-pris på 0,15 dollar pr. million inputtokens og 0,50 dollar pr. million outputtokens. 4
29 Samtidig beskrev den aktuelle dækning modellen som omtrent en tiendedel så dyr som GLM-5.3 og omkring en fyrretyvendedel af Claude Opus 4.8. Sådanne forhold afhænger dog af, om man sammenligner input eller output, prisniveau og abonnementstype.
1
4
Den praktiske pointe er, at GLM-5.3-Flash udfordrer de etablerede AI-udbydere med en kombination af tre elementer: en effektiv, sparsom modelarkitektur, aggressiv optimering af driften og en lav pris.
Ox Alpha-testen viste, at kombinationen kunne tiltrække massiv brug, før nogen kendte modellens navn eller ophav. Den beviste ikke, at Zhipu har løst alle begrænsninger ved kinesisk hardware eller software. Men den gav et bemærkelsesværdigt eksempel på, hvor stor effekt der kan opnås ved at udvikle model, inferensmotor og hardwareplatform som ét samlet system.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Den 26. august 2026 bekræftede Zhipu AI, også kendt som Z.ai, at den anonyme Ox Alpha model – kaldet »Niu Lai« i kinesiske udviklerkredse – var GLM 5.3 Flash.
Den 26. august 2026 bekræftede Zhipu AI, også kendt som Z.ai, at den anonyme Ox Alpha model – kaldet »Niu Lai« i kinesiske udviklerkredse – var GLM 5.3 Flash. GLM 5.3 Flash er en mixture of experts model med 320 milliarder samlede parametre, cirka 18 milliarder aktive parametre pr.
Afsløringen beviser ikke, at kinesiske chips generelt har overhalet Nvidia. Den viser snarere, hvordan modelspecifik softwareoptimering kan gøre en ikke Nvidia baseret inferensplatform mulig i stor skala.