Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mysteriet blev opklaret den 26. august 2026: Z.ai bekræftede, at Ox Alpha – den anonyme model, som blev tilbudt via OpenRouter og OpenCode – var GLM-5.3-Flash. Z.ai beskriver den som den første native multimodale model i GLM-5-familien. Den har åbne vægte, et kontekstvindue på omkring én million tokens og er målrettet programmering samt langvarige agentopgaver. 15
40
Det mest interessante handler dog ikke kun om modellens identitet. Ox Alpha kombinerede en gratis, anonym forhåndsvisning med brug i stor skala blandt udviklere. Derefter blev den forvandlet til et navngivet produkt, som kunne downloades. Strategien gav Z.ai mulighed for at teste sin infrastruktur under virkelige arbejdsbelastninger og samtidig opbygge interesse omkring den endelige lancering.
GLM-5.3-Flash er en mixture-of-experts-model med 320 milliarder parametre i alt og 18 milliarder aktive parametre pr. token. Den kan native behandle tekst, billeder og video, men genererer tekst som output. Den angivne kontekstkapacitet er cirka én million tokens, selv om den præcise grænse varierer mellem platforme: Z.ai’s dokumentation beskriver designet med én million tokens, mens OpenRouter angiver et kontekstvindue på 1.310.720 tokens. 1
2
3
40
Z.ai udgav vægtene under MIT-licensen, hvilket gør modellen langt lettere at implementere og selvhoste end et traditionelt system, der kun kan bruges via en lukket API. Efter den anonyme forhåndsvisning sluttede, blev modellen også opført under sit offentlige navn på OpenRouter. 3
4
8
GLM-5.3-Flash må ikke forveksles med det større GLM-5.3-produkt, som blev annonceret tidligere i august. Ifølge rapporteringen er Flash en separat og billigere 320B-A18B-model – ikke blot et andet navn for den større GLM-5.3-linje. 10
Z.ai siger, at GLM-5.3-Flash forbedrer sig i forhold til GLM-5.2, samtidig med at den er billigere at drive. I de resultater, der blev fremhævet omkring lanceringen, opnåede modellen 63,4 point på DeepSWE v1.1, sammenlignet med 46,2 for GLM-5.2. Z.ai rapporterede også 29,0 point på sin interne kodebenchmark, tæt på de 29,5 point, der blev rapporteret for Claude Opus 4.8. 3
16
Tallene siger noget om den position, Z.ai forsøger at indtage, men de er ikke en uafhængig bekræftelse af, at modellen er på niveau med Anthropics system. Benchmarkens definitioner, testopsætningen, prompts og muligheden for at reproducere resultaterne har stor betydning.
Den mest forsigtige konklusion er derfor, at Z.ai hævder at have opnået stærke resultater inden for programmering og agentopgaver til en langt lavere pris – ikke at GLM-5.3-Flash definitivt har overgået de lukkede frontmodeller.
Ox Alphas mest opsigtsvækkende egenskab var, at udviklere kunne prøve modellen gratis under den anonyme forhåndsvisning. Den fase sluttede, da modellen fik sin officielle identitet. Z.ai’s oplyste listepris er 0,15 dollar pr. million inputtokens og 0,50 dollar pr. million outputtokens. 1
3
OpenRouter viste omkring lanceringen en lavere kampagnepris på 0,075 dollar pr. million inputtokens og 0,25 dollar pr. million outputtokens. 2 Forskellen er vigtig: Den gratis forhåndsvisning, Z.ai’s listepris og en platformspecifik lanceringsrabat er tre forskellige adgangsvilkår.
Selv til listeprisen er modellens økonomi central for dens appel. Programmeringsagenter kan bruge store mængder kontekst og generere mange tokens. Derfor kan lave tokenpriser påvirke valget af model mindst lige så meget som en mindre forskel på en benchmarkliste.
Z.ai oplyste, at GLM-5.3-Flash kørte udelukkende på kinesiskproducerede AI-acceleratorer. 15 Rapportering om systemet beskriver en specialtilpasset stack baseret på SGLang med blandt andet kvantisering, tensorparallelisme, blandede cache-formater, opsplitning af lag og en separat encode-prefill-decode-arkitektur. Målet skulle være at forbedre den samlede betjening af modellen, samtidig med at man arbejdede inden for begrænsningerne i den indenlandske hardware.
25
Det viderefører en tidligere fortælling fra Z.ai om GLM-familien. Virksomheden har sagt, at modellerne blev trænet på Huawei Ascend-processorer uden Nvidia-hardware. Rapportering peger samtidig på, at Z.ai’s placering på den amerikanske Entity List begrænser virksomhedens adgang til Nvidias H100-, H200- og B200-acceleratorer. 26
Påstanden om driften er strategisk vigtig, men bør læses som en oplysning fra virksomheden og branchen – ikke som en fuldt revideret sammenligning af hardwareydelse. Den stærkeste dokumenterbare pointe er, at Z.ai fremstiller sin modelstack som i stand til at levere en stor multimodal model uden at være afhængig af Nvidias førende datacenter-GPU’er.
Den anonyme udgivelse ligner en bevidst stealth-lancering: Først offentliggør man en kapabel model uden afsender, tilbyder den gratis gennem populære værktøjer til kodning, observerer hvordan udviklere bruger den, og afslører derefter produktet, når systemet har fået feedback fra den virkelige verden.
Z.ai er også blevet sat i forbindelse med en tidligere test kaldet “Pony Alpha”, der byggede på en lignende idé. I forbindelse med Ox Alpha forsøgte udviklere og AI-entusiaster at identificere modellen gennem blandt andet tokenizer-adfærd, spor i videobehandlingen og mønstre i API-fejl. 7
11
13
Nogle rapporter fra lanceringen nævnte desuden usædvanligt høje brugertal og stor begejstring blandt udviklere. Det tilgængelige materiale verificerer dog ikke uafhængigt alle tal eller citater. De bør derfor behandles som lanceringstal – ikke som reviderede data for faktisk udbredelse. 14
GLM-5.3-Flash viser ikke, at Z.ai har overhalet OpenAI eller Anthropic på tværs af alle frontmodel-kapaciteter. Det demonstrerer derimod en mere forstyrrende kombination: multimodal input, meget lang kontekst, åbne vægte under MIT-licensen, fokus på programmeringsagenter og lave API-priser i ét og samme produkt. 15
40
For udviklere kan kombinationen gøre det billigere og enklere at skifte model, selvhoste systemet eller fordele arbejdet på flere leverandører. For udbydere af lukkede modeller øger det presset på priser og avancer – især i programmeringsopgaver, hvor tokenforbrug, svartid, kontrol over installationen og adgang til infrastrukturen kan være lige så vigtigt som placeringen på en leaderboardliste.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr.
Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr. Modellen kan behandle tekst, billeder og video, har omkring én million tokens kontekst og koster ifølge Z.ai’s listepris 0,15 dollar pr.
Den skjulte lancering gav Z.ai mulighed for at afprøve infrastrukturen under virkelige belastninger og indsamle feedback fra udviklere, før produktet fik et officielt navn.
Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mysteriet blev opklaret den 26. august 2026: Z.ai bekræftede, at Ox Alpha – den anonyme model, som blev tilbudt via OpenRouter og OpenCode – var GLM-5.3-Flash. Z.ai beskriver den som den første native multimodale model i GLM-5-familien. Den har åbne vægte, et kontekstvindue på omkring én million tokens og er målrettet programmering samt langvarige agentopgaver. 15
40
Det mest interessante handler dog ikke kun om modellens identitet. Ox Alpha kombinerede en gratis, anonym forhåndsvisning med brug i stor skala blandt udviklere. Derefter blev den forvandlet til et navngivet produkt, som kunne downloades. Strategien gav Z.ai mulighed for at teste sin infrastruktur under virkelige arbejdsbelastninger og samtidig opbygge interesse omkring den endelige lancering.
GLM-5.3-Flash er en mixture-of-experts-model med 320 milliarder parametre i alt og 18 milliarder aktive parametre pr. token. Den kan native behandle tekst, billeder og video, men genererer tekst som output. Den angivne kontekstkapacitet er cirka én million tokens, selv om den præcise grænse varierer mellem platforme: Z.ai’s dokumentation beskriver designet med én million tokens, mens OpenRouter angiver et kontekstvindue på 1.310.720 tokens. 1
2
3
40
Z.ai udgav vægtene under MIT-licensen, hvilket gør modellen langt lettere at implementere og selvhoste end et traditionelt system, der kun kan bruges via en lukket API. Efter den anonyme forhåndsvisning sluttede, blev modellen også opført under sit offentlige navn på OpenRouter. 3
4
8
GLM-5.3-Flash må ikke forveksles med det større GLM-5.3-produkt, som blev annonceret tidligere i august. Ifølge rapporteringen er Flash en separat og billigere 320B-A18B-model – ikke blot et andet navn for den større GLM-5.3-linje. 10
Z.ai siger, at GLM-5.3-Flash forbedrer sig i forhold til GLM-5.2, samtidig med at den er billigere at drive. I de resultater, der blev fremhævet omkring lanceringen, opnåede modellen 63,4 point på DeepSWE v1.1, sammenlignet med 46,2 for GLM-5.2. Z.ai rapporterede også 29,0 point på sin interne kodebenchmark, tæt på de 29,5 point, der blev rapporteret for Claude Opus 4.8. 3
16
Tallene siger noget om den position, Z.ai forsøger at indtage, men de er ikke en uafhængig bekræftelse af, at modellen er på niveau med Anthropics system. Benchmarkens definitioner, testopsætningen, prompts og muligheden for at reproducere resultaterne har stor betydning.
Den mest forsigtige konklusion er derfor, at Z.ai hævder at have opnået stærke resultater inden for programmering og agentopgaver til en langt lavere pris – ikke at GLM-5.3-Flash definitivt har overgået de lukkede frontmodeller.
Ox Alphas mest opsigtsvækkende egenskab var, at udviklere kunne prøve modellen gratis under den anonyme forhåndsvisning. Den fase sluttede, da modellen fik sin officielle identitet. Z.ai’s oplyste listepris er 0,15 dollar pr. million inputtokens og 0,50 dollar pr. million outputtokens. 1
3
OpenRouter viste omkring lanceringen en lavere kampagnepris på 0,075 dollar pr. million inputtokens og 0,25 dollar pr. million outputtokens. 2 Forskellen er vigtig: Den gratis forhåndsvisning, Z.ai’s listepris og en platformspecifik lanceringsrabat er tre forskellige adgangsvilkår.
Selv til listeprisen er modellens økonomi central for dens appel. Programmeringsagenter kan bruge store mængder kontekst og generere mange tokens. Derfor kan lave tokenpriser påvirke valget af model mindst lige så meget som en mindre forskel på en benchmarkliste.
Z.ai oplyste, at GLM-5.3-Flash kørte udelukkende på kinesiskproducerede AI-acceleratorer. 15 Rapportering om systemet beskriver en specialtilpasset stack baseret på SGLang med blandt andet kvantisering, tensorparallelisme, blandede cache-formater, opsplitning af lag og en separat encode-prefill-decode-arkitektur. Målet skulle være at forbedre den samlede betjening af modellen, samtidig med at man arbejdede inden for begrænsningerne i den indenlandske hardware.
25
Det viderefører en tidligere fortælling fra Z.ai om GLM-familien. Virksomheden har sagt, at modellerne blev trænet på Huawei Ascend-processorer uden Nvidia-hardware. Rapportering peger samtidig på, at Z.ai’s placering på den amerikanske Entity List begrænser virksomhedens adgang til Nvidias H100-, H200- og B200-acceleratorer. 26
Påstanden om driften er strategisk vigtig, men bør læses som en oplysning fra virksomheden og branchen – ikke som en fuldt revideret sammenligning af hardwareydelse. Den stærkeste dokumenterbare pointe er, at Z.ai fremstiller sin modelstack som i stand til at levere en stor multimodal model uden at være afhængig af Nvidias førende datacenter-GPU’er.
Den anonyme udgivelse ligner en bevidst stealth-lancering: Først offentliggør man en kapabel model uden afsender, tilbyder den gratis gennem populære værktøjer til kodning, observerer hvordan udviklere bruger den, og afslører derefter produktet, når systemet har fået feedback fra den virkelige verden.
Z.ai er også blevet sat i forbindelse med en tidligere test kaldet “Pony Alpha”, der byggede på en lignende idé. I forbindelse med Ox Alpha forsøgte udviklere og AI-entusiaster at identificere modellen gennem blandt andet tokenizer-adfærd, spor i videobehandlingen og mønstre i API-fejl. 7
11
13
Nogle rapporter fra lanceringen nævnte desuden usædvanligt høje brugertal og stor begejstring blandt udviklere. Det tilgængelige materiale verificerer dog ikke uafhængigt alle tal eller citater. De bør derfor behandles som lanceringstal – ikke som reviderede data for faktisk udbredelse. 14
GLM-5.3-Flash viser ikke, at Z.ai har overhalet OpenAI eller Anthropic på tværs af alle frontmodel-kapaciteter. Det demonstrerer derimod en mere forstyrrende kombination: multimodal input, meget lang kontekst, åbne vægte under MIT-licensen, fokus på programmeringsagenter og lave API-priser i ét og samme produkt. 15
40
For udviklere kan kombinationen gøre det billigere og enklere at skifte model, selvhoste systemet eller fordele arbejdet på flere leverandører. For udbydere af lukkede modeller øger det presset på priser og avancer – især i programmeringsopgaver, hvor tokenforbrug, svartid, kontrol over installationen og adgang til infrastrukturen kan være lige så vigtigt som placeringen på en leaderboardliste.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr.
Z.ai bekræftede den 26. august 2026, at den anonyme gratis forhåndsvisning Ox Alpha var GLM 5.3 Flash – en multimodal model med 320 milliarder parametre, hvor 18 milliarder er aktive pr. Modellen kan behandle tekst, billeder og video, har omkring én million tokens kontekst og koster ifølge Z.ai’s listepris 0,15 dollar pr.
Den skjulte lancering gav Z.ai mulighed for at afprøve infrastrukturen under virkelige belastninger og indsamle feedback fra udviklere, før produktet fik et officielt navn.