Zhipu AI bekräftade den 26 augusti 2026 att den anonyma modellen ”Ox Alpha”, kallad ”Niu Lai” i kinesiska forum, var GLM 5.3 Flash – en modell med öppna vikter och inbyggd multimodalitet. Den kostnadsfria testperioden på OpenRouter och OpenCode drog in mer än 50 biljoner token på fem dagar och över 60 biljoner på se...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Den mystiska AI-modellen Ox Alpha fick utvecklare världen över att spekulera. Den låg anonymt på plattformar som OpenRouter och OpenCode, där användare kunde testa den gratis, och klättrade snabbt till förstaplatsen i användningsstatistiken. Den 26 augusti 2026 bekräftade Zhipu AI – även känt som Z.ai – att modellen egentligen var GLM-5.3-Flash, en modell med öppna vikter och inbyggd multimodalitet. 1
4
6
Den dolda lanseringen fick snabbt en omfattning som är ovanlig även i AI-världen. Rapporter anger att Ox Alpha passerade 50 biljoner token under de första fem dagarna och senare översteg 60 biljoner på sex dagar. Modellen toppade användningslistorna på både OpenRouter och OpenCode och nådde periodvis mer än dubbelt så hög användning som jämförbara DeepSeek-modeller. 3
Det var alltså inte bara en viral nyhet på sociala medier. Testet gav Zhipu en stor verklig belastning att hantera innan den officiella lanseringen – med utvecklare som använde modellen för allt från kodning till agentbaserade arbetsflöden.
Zhipu uppgav att testperiodens trafik kördes helt på ett kluster med mer än 100 000 kinesisktillverkade AI-chip. Företaget hävdade att programvaruoptimeringar gjorde både hårdvarueffektiviteten och kostnaden per token jämförbar med lösningar baserade på vanliga Nvidia-GPU:er. 3
6
Zhipu offentliggjorde däremot inte exakt vilka chip som användes. Huawei, Moore Threads och Hygon har nämnts som möjliga leverantörer i rapporteringen, men det är obekräftade uppgifter och inte något Zhipu har bekräftat. 40
Påståendet ska därför tolkas försiktigt. Det visar inte att kinesiska chip generellt har kommit ikapp Nvidia, eller att inferenskostnaden alltid är densamma. Däremot visar det att en stor, verklig inferenslast kan köras på en inhemsk kinesisk hårdvaruplattform när den kombineras med omfattande systemoptimering. 3
6
Nvidias styrka handlar inte enbart om själva chipen. CUDA-ekosystemet omfattar utvecklarverktyg, bibliotek, optimeringar och en mycket stor användarbas – särskilt inom modellträning.
Ox Alpha-testet pekar ändå på att modell- och tjänstespecifika mjukvarustackar kan minska beroendet av CUDA i vissa produktionsmiljöer för inferens, alltså när en färdig modell används för att generera svar. Det räcker inte som bevis för att Nvidias bredare försprång är borta, men det är ett tecken på att alternativ hårdvara kan bli konkurrenskraftig i specialiserade arbetslaster.
Zhipus inferensmotor byggde enligt rapporteringen på SGLang och använde bland annat W8A8-kvantisering, en blandning av INT8-, FP8- och BF16-kvantisering för cacheminnet samt tensorparallellism inom enskilda noder. Företaget delade också upp arbetet i separata Encode-, Prefill- och Decode-pooler, så att olika delar av inferensen kunde skalas oberoende av varandra. 4
7
Teknikerna är särskilt relevanta eftersom GLM-5.3-Flash stöder ett kontextfönster på 1 048 576 token. Så långa kontexter ställer höga krav på minne, minnesbandbredd, kommunikation mellan chip och schemaläggning.
Zhipu uppges ha sagt att optimeringarna gav ungefär tre gånger bättre prestanda i hela tjänstekedjan jämfört med den ursprungliga baslinjen. SGLangs senare dokumentation visar dessutom högre genomströmning och betydligt större FP8-cachekapacitet än en jämförbar BF16-konfiguration. Det är dock inte en oberoende granskning av Zhipus ursprungliga tre gånger-påstående. 2
GLM-5.3-Flash är en så kallad mixture-of-experts-modell. Den har totalt 320 miljarder parametrar, men bara omkring 18 miljarder aktiveras för varje token. Det gör att modellen kan ha en stor total kapacitet utan att varje beräkning behöver använda hela parameteruppsättningen. 5
7
Modellen har dessutom:
Enligt Artificial Analysis fick modellen 57 poäng i deras Intelligence Index, samma rapporterade nivå som Claude Opus 4.8. Det ska läsas som resultatmässig likhet på ett sammansatt index – inte som bevis för identisk kvalitet i varje benchmark, koduppgift eller agentarbetsflöde. 1
Zhipu positionerade modellen som ett alternativ till effektiva avancerade modeller som DeepSeek V4 Flash och Pro, samtidigt som företaget lyfte fram betydligt lägre inferenspriser. Det tillgängliga underlaget räcker däremot inte för att verifiera exakta jämförelser mellan modellerna i varje enskilt test.
Det publicerade API-priset uppgavs vara 0,15 dollar per miljon indatatoken och 0,50 dollar per miljon utdatatoken. 1
Samtida rapportering beskrev priset som ungefär en tiondel av GLM-5.3:s och omkring en fyrtiondel av Claude Opus 4.8:s. Sådana kvoter beror dock på vilken tokenriktning, kontextnivå och prisplan som jämförs. 1
Det centrala i avslöjandet är därför inte bara modellens benchmarkresultat. Zhipu visade också att en mycket stor, billig och offentlig testtrafik kunde hanteras på en kinesisk chipplattform – med en mjukvaruarkitektur som var byggd för just modellens långa kontext och höga genomströmning.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI bekräftade den 26 augusti 2026 att den anonyma modellen ”Ox Alpha”, kallad ”Niu Lai” i kinesiska forum, var GLM 5.3 Flash – en modell med öppna vikter och inbyggd multimodalitet.
Zhipu AI bekräftade den 26 augusti 2026 att den anonyma modellen ”Ox Alpha”, kallad ”Niu Lai” i kinesiska forum, var GLM 5.3 Flash – en modell med öppna vikter och inbyggd multimodalitet. Den kostnadsfria testperioden på OpenRouter och OpenCode drog in mer än 50 biljoner token på fem dagar och över 60 biljoner på sex dagar, enligt rapporteringen.
Zhipu uppgav att trafiken hanterades av ett kluster med över 100 000 kinesisktillverkade chip, men namngav inte leverantörerna.