Z.ai bekräftade den 26 augusti 2026 att den anonyma förhandsversionen Ox Alpha var GLM 5.3 Flash – en multimodal modell med 320 miljarder parametrar totalt och 18 miljarder aktiva parametrar per token. Modellen hanterar text, bilder och video, erbjuder ungefär en miljon tokens i kontext och släpps med öppna vikter u...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mysteriet fick sitt svar den 26 augusti 2026. Z.ai bekräftade att Ox Alpha, den anonyma modellen som hade erbjudits via OpenRouter och OpenCode, var GLM-5.3-Flash. Företaget beskriver den som den första inbyggt multimodala modellen i GLM-5-familjen – med öppna vikter, ett kontextfönster på omkring en miljon tokens och särskilt fokus på kodning och långvariga agentuppgifter. 1540
Det mest intressanta är dock inte bara modellens identitet. Ox Alpha kombinerade en kostnadsfri och anonym förhandsversion med användning i stor skala av utvecklare. Därefter förvandlades testet till en namngiven och nedladdningsbar produkt. För Z.ai blev upplägget både ett sätt att pröva sin infrastruktur under verklig belastning och ett sätt att bygga intresse inför lanseringen.
GLM-5.3-Flash är en så kallad mixture-of-experts-modell, eller MoE-modell, med 320 miljarder parametrar totalt och 18 miljarder aktiva parametrar per token. Den tar in text, bilder och video direkt, men genererar text som utdata. Den angivna kapaciteten är ungefär en miljon tokens, även om den exakta gränsen skiljer sig mellan olika plattformar: Z.ai beskriver en konstruktion för en miljon tokens, medan OpenRouter listar ett kontextfönster på 1 310 720 tokens. 12340
Vikterna släpptes under MIT-licensen, vilket gör modellen betydligt enklare att använda och distribuera än en traditionell, helt stängd API-tjänst. Efter den anonyma förhandsversionen listades modellen också under sitt offentliga namn på OpenRouter. 348
GLM-5.3-Flash ska inte blandas ihop med den större GLM-5.3-modellen som presenterades tidigare i augusti. Enligt rapporteringen är Flash en separat och billigare modell på 320B-A18B, inte samma produktvariant som den större GLM-5.3-serien. 10
Z.ai säger att GLM-5.3-Flash förbättrar resultaten från GLM-5.2 samtidigt som kostnaden för att köra modellen minskar. I resultaten som presenterades kring lanseringen fick modellen 63,4 poäng på DeepSWE v1.1, jämfört med 46,2 för GLM-5.2. Z.ai rapporterade dessutom 29,0 poäng i sitt interna kodningsbenchmark, nära de 29,5 poäng som rapporterats för Claude Opus 4.8. 316
Siffrorna visar hur Z.ai vill positionera modellen, men de är inte ett oberoende bevis på att den håller samma nivå som Anthropics modell. Benchmarkens definitioner, testmiljö, promptar och möjligheten att upprepa resultaten spelar stor roll.
Den försiktiga slutsatsen är därför att Z.ai hävdar stark prestanda inom kodning och agentuppgifter till betydligt lägre kostnad – inte att GLM-5.3-Flash definitivt har gått om de stängda toppmodellerna.
Ox Alphas mest uppmärksammade egenskap var att utvecklare kunde testa modellen utan att betala under den anonyma perioden. Den fasen tog slut när modellen fick sitt offentliga namn. Z.ai:s angivna listpris är 0,15 dollar per en miljon inmatningstokens och 0,50 dollar per en miljon utmatningstokens. 13
OpenRouter visade samtidigt ett lägre introduktionspris på 0,075 dollar per en miljon inmatningstokens och 0,25 dollar per en miljon utmatningstokens. 2 Det är en viktig skillnad: den kostnadsfria förhandsversionen, Z.ai:s ordinarie pris och OpenRouters tillfälliga rabatt är tre olika villkor.
Även med listpriset i åtanke är ekonomin central för modellens attraktionskraft. Kodningsagenter kan förbruka stora mängder kontext och generera mycket text. Därför kan lägre tokenkostnader påverka valet av modell minst lika mycket som en mindre skillnad i benchmarkresultat.
Z.ai uppgav att GLM-5.3-Flash kördes helt på AI-acceleratorer tillverkade i Kina. 15 Rapportering om serversystemet beskriver en anpassad stack baserad på SGLang, med tekniker som kvantisering, tensorparallellism, blandade cacheformat, lageruppdelning och en separat arkitektur för kodning, förberedelse och avkodning. Målet ska ha varit att förbättra prestandan i hela serverkedjan och samtidigt hantera begränsningarna hos inhemsk hårdvara. 25
Det bygger vidare på Z.ai:s tidigare berättelse om GLM-familjen. Företaget har sagt att modellerna tränats på Huawei Ascend-processorer utan Nvidia-hårdvara. Rapportering noterar också att Z.ai finns på USA:s Entity List, vilket begränsar företagets tillgång till Nvidias acceleratorer H100, H200 och B200. 26
Påståendet om infrastrukturen är strategiskt betydelsefullt, men bör läsas som ett företags- och branschpåstående snarare än som en fullt oberoende granskning av hårdvarans prestanda. Den tydligare slutsatsen är att Z.ai vill visa att dess modellstack kan köra en stor multimodal modell utan att vara beroende av Nvidias ledande datacenter-GPU:er.
Den anonyma lanseringen ser ut att ha följt en medveten smyglanseringsmodell: släpp en kapabel modell utan avsändare, erbjud den gratis genom populära verktyg för kodning, se hur utvecklare använder den och avslöja sedan produkten när den redan har fått praktisk återkoppling.
Z.ai har kopplats samman med ett tidigare test kallat ”Pony Alpha”, som ska ha byggt på en liknande idé. Under Ox Alpha-lanseringen försökte personer i AI-communityn identifiera modellen genom bland annat tokeniseringsbeteende, ledtrådar i videohanteringen och mönster i API-fel. 71113
Vissa rapporter från lanseringsperioden hänvisade också till mycket stora användarsiffror och stark entusiasm bland utvecklare. Det tillgängliga materialet verifierar dock inte alla uppgifter eller citat oberoende. Sådana påståenden bör därför betraktas som lanseringsrapportering, inte som granskad statistik över användningen. 14
GLM-5.3-Flash visar inte att Z.ai har gått om OpenAI eller Anthropic inom hela spektrumet av avancerade modellförmågor. Däremot samlar modellen flera egenskaper som sällan kombineras i samma produkt: multimodala indata, mycket lång kontext, öppna vikter under MIT-licens, specialisering på kodningsagenter och låga API-priser. 1540
För utvecklare kan kombinationen göra det enklare att byta modell, köra den själv eller använda flera leverantörer parallellt. För leverantörer av stängda modeller innebär den ökad press på priser och marginaler – särskilt inom kodningsarbetsflöden, där kostnad, svarstid, kontroll över driftsättningen och tillgång till modellvikter kan vara lika viktigt som placeringen på en topplista.
Ox Alpha var alltså inte bara en anonym modell som fick stor uppmärksamhet. Det var också ett praktiskt stresstest, en marknadsföringsstrategi och ett försök att visa att kinesisk AI kan konkurrera med en kombination av låg kostnad, öppen distribution och tillräcklig kapacitet för krävande agentuppgifter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai bekräftade den 26 augusti 2026 att den anonyma förhandsversionen Ox Alpha var GLM 5.3 Flash – en multimodal modell med 320 miljarder parametrar totalt och 18 miljarder aktiva parametrar per token.
Z.ai bekräftade den 26 augusti 2026 att den anonyma förhandsversionen Ox Alpha var GLM 5.3 Flash – en multimodal modell med 320 miljarder parametrar totalt och 18 miljarder aktiva parametrar per token. Modellen hanterar text, bilder och video, erbjuder ungefär en miljon tokens i kontext och släpps med öppna vikter under MIT licensen.
Den kostnadsfria smyglanseringen gav Z.ai möjlighet att testa modellen och infrastrukturen i verkliga kodningsarbetsflöden innan företaget presenterade produkten offentligt.