Zhipu AI bekreftet 26. august 2026 at den anonyme modellen «Ox Alpha», kjent som «Niu Lai» i kinesiske nettmiljøer, var GLM 5.3 Flash – en åpen, multimodal mixture of experts modell.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Den mystiske KI-modellen Ox Alpha – omtalt som «Niu Lai» i kinesiske nettmiljøer – var ikke et nytt selskap eller et ukjent forskningsprosjekt. 26. august bekreftet Zhipu AI, som også bruker merkenavnet Z.ai, at modellen var GLM-5.3-Flash. Modellen ble testet anonymt før den offisielle lanseringen og ble presentert som en åpen modell med innebygd multimodalitet og en såkalt mixture-of-experts-arkitektur. 1
4
6
Den anonyme lanseringen fikk raskt stor oppmerksomhet blant utviklere. Modellen var gratis tilgjengelig på OpenRouter og OpenCode, to plattformer som brukes til å teste og koble sammen KI-modeller. Rapporter viste over 50 billioner tokens etter fem dager, mens senere tall satte forbruket til over 60 billioner tokens på seks dager. Ox Alpha toppet brukslistene på begge plattformene og skal på det meste ha hatt mer enn dobbelt så høy bruk som sammenlignbare DeepSeek-modeller. 3
Det mest oppsiktsvekkende ved avsløringen var ikke bare modellens popularitet, men infrastrukturen bak den.
Zhipu sa at testperioden ble kjørt på et cluster med over 100 000 kinesiskproduserte KI-brikker. Etter omfattende programvareoptimalisering hevdet selskapet at maskinvareutnyttelsen og kostnaden per token var sammenlignbar med løsninger basert på vanlige NVIDIA-GPU-er. 3
6
Zhipu oppga imidlertid ikke hvilke brikkeprodusenter som var involvert. Huawei, Moore Threads og Hygon er nevnt som mulige leverandører i medieomtale, men dette er ubekreftet spekulasjon – ikke en bekreftelse fra Zhipu. 40
Dette er derfor ikke bevis på at Kina generelt har tatt igjen NVIDIA innen KI-maskinvare, eller at kinesiske brikker alltid gir samme kostnad som NVIDIA-maskiner. Det viser snarere at en stor, reell arbeidsbelastning for modellkjøring kan håndteres på en ikke-NVIDIA-basert plattform når maskinvare og programvare utvikles tett sammen. 3
6
NVIDIA har lenge hatt en sterk posisjon gjennom CUDA, selskapets programvareplattform for KI- og GPU-beregninger. Ox Alpha-testen antyder at spesialtilpassede inferensmotorer kan redusere avhengigheten av CUDA i enkelte produksjonsmiljøer.
Det betyr likevel ikke at CUDA-fordelen er borte. NVIDIAs økosystem, utviklerbase, verktøy og posisjon innen modelltrening er langt bredere enn det denne ene utrullingen dokumenterer. Det finnes ikke tilstrekkelig grunnlag for å trekke en mer vidtrekkende konklusjon.
Zhipus SGLang-baserte motor skal ha brukt blant annet:
Teknikkene skal ha vært utviklet for å håndtere begrensninger knyttet til minne, båndbredde, kommunikasjon og planlegging ved et kontekstvindu på én million tokens. 4
7
Zhipu skal ha oppgitt at endringene ga rundt tre ganger bedre total ytelse enn den opprinnelige løsningen. Senere dokumentasjon fra SGLang viser også høyere gjennomstrømming og betydelig større FP8-cachekapasitet enn i en sammenlignbar BF16-konfigurasjon. Dette er likevel ikke en uavhengig revisjon av Zhipus påstand om tredoblet ytelse. 2
GLM-5.3-Flash har totalt 320 milliarder parametere, men aktiverer rundt 18 milliarder parametere per token. Det er kjernen i mixture-of-experts-designet: Modellen er stor på papiret, men bruker bare utvalgte deler av nettverket for hvert enkelt token. Den støtter et kontekstvindu på 1 048 576 tokens. 5
7
Modellen skal ha fått en score på 57 i Artificial Analysis Intelligence Index, på samme oppgitte nivå som Claude Opus 4.8. Det bør tolkes som lik score på én sammensatt indeks – ikke som dokumentasjon på identisk ytelse i alle tester eller praktiske agentoppgaver. 1
GLM-5.3-Flash ble posisjonert som en konkurrent til effektive modeller i toppsjiktet, blant annet DeepSeek V4 Flash og Pro, samtidig som Zhipu lovet langt lavere inferenskostnader. Det tilgjengelige materialet er imidlertid ikke tilstrekkelig til å kontrollere nøyaktige sammenligninger mellom modellene i hver enkelt benchmark.
Zhipus oppgitte API-pris var:
Samtidig omtale beskrev dette som omtrent en tiendedel av prisen på GLM-5.3 og rundt en førtiendedel av Claude Opus 4.8. Slike forholdstall avhenger imidlertid av hvilken tokenretning, kontekstklasse og prisplan man sammenligner. 1
Avsløringen av Ox Alpha handler derfor om mer enn navnet på en populær modell. Den viser hvordan Zhipu forsøker å kombinere en stor, åpen modell med svært lav pris og en inferensplattform bygget på kinesisk maskinvare. Det er et interessant signal om hvor mye optimalisering kan bety – men alene er det ikke nok til å fastslå at den bredere konkurransen med NVIDIA eller de ledende amerikanske modellaktørene er avgjort.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI bekreftet 26. august 2026 at den anonyme modellen «Ox Alpha», kjent som «Niu Lai» i kinesiske nettmiljøer, var GLM 5.3 Flash – en åpen, multimodal mixture of experts modell.
Zhipu AI bekreftet 26. august 2026 at den anonyme modellen «Ox Alpha», kjent som «Niu Lai» i kinesiske nettmiljøer, var GLM 5.3 Flash – en åpen, multimodal mixture of experts modell. Den gratis testen på OpenRouter og OpenCode skal ha passert 50 billioner tokens på fem dager og senere 60 billioner på seks dager, noe som sendte modellen til topps på begge plattformene.
Zhipu oppga at trafikken ble håndtert av et cluster med over 100 000 kinesiskproduserte KI brikker, men selskapet navnga ikke leverandørene.