Den 26 augusti 2026 bekräftade Zhipu AI att den anonyma modellen Ox Alpha – kallad ”Niu Lai” i kinesiska utvecklarkretsar – var GLM 5.3 Flash. GLM 5.3 Flash är en mixture of experts modell med totalt 320 miljarder parametrar, cirka 18 miljarder aktiva parametrar per token och ett kontextfönster på 1 048 576 token.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Zhipu AI, som också använder det internationella namnet Z.ai, satte den 26 augusti 2026 punkt för mysteriet kring den anonyma modellen ”Ox Alpha”. Företaget bekräftade att modellen – ”Niu Lai” i kinesiska utvecklarforum – var GLM-5.3-Flash, en modell med öppna vikter och inbyggt multimodalt stöd från GLM-serien. 1
15
Avslöjandet innehöll samtidigt ett långt större infrastrukturpåstående. Zhipu uppgav att modellen hade testats gratis på OpenRouter och OpenCode och behandlat mer än 50 biljoner token under fem dagar. Enligt företaget hanterades trafiken helt av ett kluster med över 100 000 kinesisktillverkade chip. 8
15
Ox Alpha lanserades utan företagsnamn eller traditionell marknadsföringskampanj. Utvecklare fick därför bedöma modellen utifrån sådant som svarskvalitet, hastighet, tillgänglighet och pris – inte utifrån Zhipus varumärke eller valet av hårdvara.
Modellen klättrade snabbt till toppen av användningsrankningarna på både OpenRouter och OpenCode. Senare rapporter talade om över 60 biljoner token under sex dagar, medan användningen på OpenRouter uppgavs vara mer än dubbelt så stor som för jämförbar DeepSeek-trafik. Skillnaderna speglar olika mätperioder och plattformarnas sätt att räkna. Den säkraste slutsatsen är därför att testet översteg 50 biljoner token och skapade ovanligt hög efterfrågan. 1
3
30
Det gör testet intressant: modellen utsattes för en stor mängd verklig utvecklartrafik innan någon visste vem som stod bakom den. Användarna reagerade på resultatet – inte på en lanseringspresentation.
Zhipu uppgav att inferensen, alltså själva körningen av modellen när den svarar på frågor, genomfördes på över 100 000 inhemskt tillverkade acceleratorer. Företaget hävdade att mjukvaruoptimering hade lett till en hårdvarueffektivitet och kostnad per token som var jämförbar med vanliga Nvidia-GPU:er. 15
24
De exakta leverantörerna har inte offentliggjorts i det material som ligger till grund för uppgifterna. Huawei, Moore Threads och Hygon har nämnts i branschrapportering som möjliga bidragsgivare, men det är inte verifierat och ska inte behandlas som en bekräftelse från Zhipu. 30
40
Påståendet bör dessutom tolkas snävt. Det visar inte att kinesiska chip matchar Nvidia i alla typer av arbetslaster, att inhemsk hårdvara har ersatt Nvidia vid modellträning eller att de båda ekosystemen erbjuder likvärdiga utvecklarverktyg.
Det visar något mer specifikt: en stor inferenstjänst kan byggas kring en inhemsk plattform utan Nvidia, om modellen och serveringssystemet optimeras tillsammans.
Ett kontextfönster på en miljon token – tillräckligt för mycket långa dokument, stora kodbaser eller utdragna agentarbetsflöden – ställer höga krav på minne, minnesbandbredd, kommunikation mellan chip och schemaläggning.
Zhipu byggde därför en särskild inferensmotor baserad på SGLang och använde bland annat följande tekniker:
Zhipu uppgav att systemet därmed förbättrade den totala tjänsteprestandan ungefär tre gånger jämfört med den ursprungliga baslinjen på samma hårdvara. 24
26 Senare dokumentation från SGLang visar ytterligare förbättringar av genomströmning och kapacitet för FP8-cache jämfört med en BF16-konfiguration. Dokumentationen är dock ingen oberoende granskning av Zhipus ursprungliga påstående om tredubblad prestanda.
17
För Nvidia handlar konsekvensen därför främst om CUDAs roll vid inferens – inte om att företagets bredare försprång plötsligt är borta. Specialiserade kärnor, kvantisering, parallellism och smartare schemaläggning kan minska beroendet av CUDA i vissa produktionsarbetslaster.
Nvidias större mjukvaruekosystem, verktyg, installerade bas och ställning inom träning är separata frågor som denna lansering inte avgör.
GLM-5.3-Flash beskrivs som en gles mixture-of-experts-modell med 320 miljarder parametrar totalt och omkring 18 miljarder aktiva parametrar per token. Den stöder ett kontextfönster på 1 048 576 token och kan ta emot multimodala indata, vilket placerar den i kategorin modeller för långa dokument, programmering och långvariga AI-agenter. 2
5
7
Modellen fick enligt rapporteringen 57 poäng på Artificial Analysis Intelligence Index, samma resultat som Claude Opus 4.8. Det innebär likvärdighet på ett sammansatt index – inte att modellerna presterar identiskt i varje enskilt test, program eller agentuppgift. 9
Zhipu uppgav ett API-pris på 0,15 dollar per miljon token för indata och 0,50 dollar per miljon token för utdata. 4
29
Samtida rapportering beskrev modellen som ungefär en tiondel så dyr som GLM-5.3 och omkring en fyrtiondel av priset för Claude Opus 4.8. Sådana jämförelser beror dock på vilken tokenriktning, prisnivå och abonnemangsmodell som används. 1
4
För utvecklare är den viktigaste poängen kombinationen av tre faktorer: en relativt effektiv gles arkitektur, aggressiv optimering av inferensen och mycket lågt pris.
Ox Alpha-testet visade att den kombinationen kunde locka omfattande användning innan modellens identitet ens var känd. Det bevisade inte att Zhipu har löst alla begränsningar i hårdvara eller mjukvara. Däremot gav det en uppmärksammad demonstration i produktionsskala av vilken hävstång som kan skapas när modell, inferensmotor och chipplattform utvecklas som ett sammanhängande system.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Den 26 augusti 2026 bekräftade Zhipu AI att den anonyma modellen Ox Alpha – kallad ”Niu Lai” i kinesiska utvecklarkretsar – var GLM 5.3 Flash.
Den 26 augusti 2026 bekräftade Zhipu AI att den anonyma modellen Ox Alpha – kallad ”Niu Lai” i kinesiska utvecklarkretsar – var GLM 5.3 Flash. GLM 5.3 Flash är en mixture of experts modell med totalt 320 miljarder parametrar, cirka 18 miljarder aktiva parametrar per token och ett kontextfönster på 1 048 576 token.
Avslöjandet bevisar inte att kinesiska chip generellt har gått om Nvidia. Det visar däremot att modell och systemanpassad mjukvara kan göra en icke Nvidia baserad inferensplattform livskraftig i stor skala.