26. august 2026 bekreftet Zhipu AI at den anonyme modellen Ox Alpha – kjent som «Niu Lai» i kinesiske utviklermiljøer – var GLM 5.3 Flash.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Zhipu AI, som også er kjent internasjonalt som Z.ai, har oppklart mysteriet rundt den anonyme modellen «Ox Alpha». 26. august 2026 bekreftet selskapet at modellen – kalt «Niu Lai» i kinesiske utviklermiljøer – var GLM-5.3-Flash, en modell med åpne vekter og innebygd multimodalitet fra GLM-serien. 1
15
Avsløringen var mer enn en vanlig modellansering. Zhipu sa at modellen først ble gjort tilgjengelig gratis og anonymt på OpenRouter og OpenCode. I løpet av fem dager behandlet den over 50 billioner token, og hele trafikken ble ifølge selskapet håndtert av en klynge med mer enn 100 000 kinesiskproduserte AI-brikker. 8
15
Ox Alpha dukket opp uten firmanavn eller stor lanseringskampanje. Utviklere måtte derfor vurdere modellen ut fra det de faktisk opplevde: kvaliteten på svarene, hastighet, tilgjengelighet og pris – ikke Zhipus merkevare eller valg av maskinvare.
Modellen klatret raskt til toppen av brukslistene på OpenRouter og OpenCode. Senere rapporter viste over 60 billioner token over seks dager, mens bruken på OpenRouter skal ha vært mer enn dobbelt så høy som for sammenlignbar DeepSeek-trafikk. Tallene varierer fordi plattformene brukte ulike måleperioder og metoder. Det tryggeste bildet er derfor at testen passerte 50 billioner token og skapte uvanlig høy etterspørsel. 1
3
30
Det gjør testen interessant: En stor mengde ekte utviklertrafikk traff modellen før noen visste hvem som sto bak. Brukerne stemte i praksis med tastaturet – og fortsatte å bruke tjenesten fordi den fungerte, ikke fordi de kjente navnet på leverandøren.
Zhipu opplyste at inferensarbeidet, altså selve kjøringen av modellen når den svarer på forespørsler, ble utført på mer enn 100 000 kinesiskproduserte akseleratorer. Selskapet hevdet at optimalisering av programvaren ga maskinvareutnyttelse og kostnad per token på nivå med vanlige Nvidia-GPU-er. 15
24
Zhipu har ikke offentlig identifisert de konkrete leverandørene i materialet som ligger til grunn her. Huawei, Moore Threads og Hygon er nevnt i bransjerapporter som mulige bidragsytere, men dette er ikke bekreftet av Zhipu og bør derfor behandles som ubekreftet. 30
40
Påstanden må også tolkes presist. Den viser ikke at kinesiske brikker generelt har nådd igjen Nvidia i alle typer arbeidsbelastninger. Den viser heller ikke at kinesisk maskinvare har erstattet Nvidia i trening av modeller, eller at utviklerverktøyene i de to økosystemene er like gode.
Det Zhipus demonstrasjon faktisk peker mot, er en smalere – men viktig – konklusjon: En stor inferenstjeneste kan bygges rundt en ikke-Nvidia-basert maskinvarestakk når modellen, inferensmotoren og maskinvaren optimaliseres samlet.
Et kontekstvindu på én million token stiller store krav til minne, båndbredde, kommunikasjon mellom brikker og planlegging av arbeidsoppgaver. Zhipu bygget derfor en egen inferensmotor basert på SGLang og brukte blant annet:
Zhipu sa at løsningen løftet ytelsen fra ende til ende med omtrent tre ganger sammenlignet med selskapets opprinnelige utgangspunkt på den samme maskinvaren. 24
26 Senere dokumentasjon fra SGLang viser ytterligere forbedringer i gjennomstrømming og kapasitet for FP8-hurtigbuffer sammenlignet med en BF16-konfigurasjon. Dette er imidlertid ikke en uavhengig revisjon av Zhipus opprinnelige påstand om tredoblet ytelse.
17
For Nvidia handler dette først og fremst om CUDA-plattformens rolle i inferens – ikke om at selskapets samlede forsprang plutselig er borte. Spesialtilpassede kjerner, kvantisering, parallell behandling og smartere planlegging kan redusere avhengigheten av CUDA i bestemte produksjonslaster. Nvidias bredere programvareøkosystem, verktøy, installerte base og posisjon innen modelltrening er separate spørsmål som denne lanseringen ikke avgjør.
GLM-5.3-Flash er rapportert som en sparsommelig mixture-of-experts-modell med 320 milliarder parametre totalt, men bare rundt 18 milliarder aktive parametre per token. Den støtter et kontekstvindu på 1 048 576 token og tar imot multimodale inputdata. Det gjør den aktuell for blant annet lange dokumenter, programmering og langvarige agentoppgaver. 2
5
7
Modellen fikk ifølge rapportene 57 poeng på Artificial Analysis Intelligence Index – samme rapporterte poengsum som Claude Opus 4.8. Det betyr likhet på én sammensatt indeks, ikke at modellene presterer identisk i alle tester, programmer eller agentoppgaver. 9
Zhipu oppga en API-pris på 0,15 dollar per million input-token og 0,50 dollar per million output-token. 4
29
Samtidig omtale beskrev modellen som omtrent ti ganger billigere enn GLM-5.3 og rundt 40 ganger billigere enn Claude Opus 4.8. Slike forholdstall avhenger imidlertid av hvilken type token, prisplan og kontekstnivå man sammenligner. 1
4
Den praktiske betydningen ligger derfor i kombinasjonen av tre elementer: en relativt effektiv, sparsommelig arkitektur, aggressiv optimalisering av inferenstjenesten og svært lav pris. Den anonyme Ox Alpha-testen viste at denne kombinasjonen kunne trekke til seg store mengder bruk før modellens identitet var kjent.
Det er ikke det samme som at Zhipu har løst alle begrensninger ved kinesisk maskinvare eller konkurrert ut Nvidia på alle fronter. Men testen er en bemerkelsesverdig demonstrasjon av hvor mye som kan oppnås når modell, programvare og maskinvare utvikles som én samlet produksjonsplattform.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
26. august 2026 bekreftet Zhipu AI at den anonyme modellen Ox Alpha – kjent som «Niu Lai» i kinesiske utviklermiljøer – var GLM 5.3 Flash.
26. august 2026 bekreftet Zhipu AI at den anonyme modellen Ox Alpha – kjent som «Niu Lai» i kinesiske utviklermiljøer – var GLM 5.3 Flash. GLM 5.3 Flash er en sparsommelig mixture of experts modell med 320 milliarder parametre, rundt 18 milliarder aktive parametre per token og et kontekstvindu på 1 048 576 token.
Det viktigste er ikke at testen beviser at kinesiske brikker har tatt igjen Nvidia på alle områder, men at målrettet programvareoptimalisering kan gjøre en ikke Nvidia basert inferensplattform levedyktig i stor skala.