Ox Alpha var Zhipu AI's GLM 5.3 Flash. Modellen blev bekræftet den 26. GLM 5.3 Flash er målrettet kodning, visuel programmering, lange kontekster og værktøjsbrugende AI agenter.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Den model, som udviklere i en uge kendte som Ox Alpha, var i virkeligheden GLM-5.3-Flash fra den kinesiske AI-virksomhed Zhipu AI, der internationalt opererer som Z.ai. Modellen dukkede anonymt op på OpenRouter og andre udviklerværktøjer den 20. august 2026 og blev identificeret af Zhipu den 26. august. 3
4
Afsløringen gjorde en viral modelmystik til en markant lancering af en åben model: GLM-5.3-Flash er et mixture-of-experts-system med 320 milliarder samlede parametre, hvor kun 18 milliarder aktiveres for hver token. Den har et kontekstvindue på cirka 1 million tokens, indbygget multimodal input og vægte udgivet under MIT-licensen. 3
6
8
Ox Alpha blev lanceret uden modelkort, producentnavn eller detaljerede tekniske specifikationer. Udviklere mødte i stedet et gratis endepunkt med lang kontekst og understøttelse af multimodale input, som hurtigt blev prøvet af i kodeprojekter og agentbaserede arbejdsgange. Den praktiske ydelse gav næring til spekulationer om, hvilket AI-laboratorium der stod bag. 13
16
Ifølge Zhipu var anonymiteten bevidst. Virksomheden ville have udviklere til at bedømme modellen ud fra dens svar – ikke ud fra brand, parametertal eller markedsføring. Trafikken gav samtidig virksomheden data om brugsmønstre og feedback fra virkelige softwareudviklings- og agentopgaver, før den officielle lancering. 13
15
Under testen blev der ifølge rapporter stillet omkring 100 billioner tokens gratis kapacitet til rådighed dagligt. Stripe-medstifter Patrick Collison var blandt de prominente udviklere, som ifølge omtalen roste modellens kvalitet. Reaktionerne gjorde den anonyme tjeneste til en af de mest fulgte AI-lanceringer, men begejstring blandt brugere er ikke det samme som en kontrolleret evaluering. 13
14
Zhipu oplyste også, at tjenesten kørte på kinesiskproducerede AI-acceleratorer. South China Morning Post skrev, at testen benyttede en klynge på 100.000 sådanne chips, og at modellen havde behandlet 62 billioner tokens før den formelle lancering. Tallene afviger fra andre beskrivelser af testens kapacitet og forbrug og bør derfor forstås som oplyste virksomheds- eller medietal snarere end uafhængigt reviderede målinger. 7
13
GLM-5.3-Flash er en mixture-of-experts-model, ofte forkortet MoE. Den samlede parameterpulje er på 320 milliarder, men kun 18 milliarder parametre aktiveres for hver token. Ideen er at kombinere kapaciteten fra en meget stor model med lavere beregningsarbejde ved hvert inferenstrin. 3
4
Modellen har 45 lag og er den første model i GLM-5-serien, som Zhipu beskriver som indbygget multimodal fra grunden. Den kan arbejde med tekst, billeder, video, visuelle dokumenter, filer og kombinerede multimodale input. Det er relevant i arbejdsgange, hvor en agent skal inspicere et brugerinterface, forstå et skærmbillede, læse et dokument eller vurdere resultatet af kode – ikke kun behandle tekst. 4
11
Zhipu angiver et kontekstvindue på 1.048.576 tokens, normalt omtalt som 1 million tokens. Det er især tænkt til store kodebaser, lange agentsessioner, omfattende dokumentsamlinger og opgaver, hvor kode kombineres med visuelt eller filbaseret materiale. 3
4
Modellen er trænet fra en ny base med en redesignet arkitektur og træningsmetode. Zhipu oplyser, at den er trænet på et multimodalt korpus på 30 billioner tokens. GLM-5.3-Flash fremstilles dermed som en ny model med fokus på effektivitet og multimodal anvendelse – ikke blot som en mindre udgave af GLM-5.3. 4
16
GLM-5.3-Flash kombinerer lineær attention med sparsom attention. Lineær attention skal gøre behandling af lange sekvenser mindre beregningstung, mens sparsom attention udvælger de interaktioner, hvor mere detaljeret behandling er vigtig. Målet er at balancere lange kontekster med mere håndterbare inferensomkostninger. 4
16
Zhipu beskriver også mekanismen IndexPool, som skal mindske hukommelsesforbruget og latenstiden ved indeksering i meget lange kontekster. Arkitekturen indeholder desuden manifold-constrained hyper-connections som endnu et middel til at gøre skalering mere effektiv. Det er implementeringsteknikker, hvis reelle effekt afhænger af blandt andet serveropsætning, sekvenslængde, hardware og arbejdsbelastning. 4
16
Sammenlignet med GLM-5.3 hævder Zhipu, at GLM-5.3-Flash reducerer beregningen til attention med 3,01 gange og KV-cache-forbruget med 4,44 gange, samtidig med at kvaliteten i lange kontekster bevares. Det er væsentligt for udviklere, fordi både attention-beregninger og KV-cache-hukommelse kan blive flaskehalse i langvarige agentforløb. Forholdstallene stammer dog primært fra Zhipus egne tekniske materialer og bør ikke opfattes som universelle, uafhængigt verificerede hastighedsforbedringer. 4
Modellen er først og fremmest rettet mod kodning, visuel programmering, langvarige agentopgaver og værktøjsbrug. Den indbyggede visuelle forståelse skal gøre det muligt for en agent at observere brugerflader, renderinger og feedback fra interaktioner – og dermed skabe et kredsløb mellem kode, browsere og grafiske brugerflader. 4
Zhipus offentliggjorte benchmarkresultater omfatter:
Resultaterne understøtter modellens profil inden for softwareudvikling og AI-agenter, men sammenligninger kræver forsigtighed. Agentbenchmarks kan ændre sig betydeligt afhængigt af prompts, værktøjer, ekstra styring, hardware, tidsgrænser og evalueringsversioner. Tallene bør derfor først og fremmest læses som Zhipus egne rapporterede resultater – ikke som en endelig rangliste over alle konkurrerende modeller. 4
15
Zhipu udgav GLM-5.3-Flash-vægtene på Hugging Face under den tilladelige MIT-licens, herunder en BF16-version. Modeldokumentationen angiver understøttelse af serveringsrammer som SGLang og vLLM. Organisationer får dermed mulighed for lokal eller selvhostet drift i stedet for udelukkende at bruge Z.ais API. 3
6
8
Det ændrer modellens praktiske profil. Udviklere kan afprøve den på egne kodebaser, dokumenter, visuelle brugerflader og agentmiljøer, mens infrastrukturteams kan undersøge serveringsomkostninger og hardwarekrav direkte.
Det betyder dog ikke, at modellen er let at køre. De 320 milliarder samlede parametre gør lokal drift til en omfattende teknisk opgave. De 18 milliarder aktive parametre pr. token reducerer beregningsarbejdet, men gør ikke automatisk hele modelcheckpointet lille.
Ox Alpha-testen var mere end et markedsføringsstunt. Den undersøgte, om udviklere ville blive ved med at bruge modellen, når navn, parameterantal og producent var skjult. Dermed leverede virkelige brugere både arbejdsbelastninger og reaktioner, før den formelle afsløring. 13
15
Eksperimentet har samtidig klare begrænsninger. Gratis adgang kan tiltrække usædvanligt meget trafik, offentlig ros kan være præget af nyhedsværdi, og anonym brug kontrollerer ikke prompts eller sikrer, at alle modeller sammenlignes under identiske forhold.
Den mest forsigtige konklusion er derfor, at GLM-5.3-Flash skabte betydelig interesse blandt udviklere, før nogen kendte modellens identitet. Zhipu brugte derefter interessen som feedback på modellen og som fundament for lanceringen.
GLM-5.3-Flash er det navn, der blev afsløret bag Ox Alpha: en åben, indbygget multimodal GLM-model udviklet til effektiv kodning og agentbaseret arbejde. De vigtigste specifikationer er en MoE-arkitektur med 320 milliarder samlede og 18 milliarder aktive parametre, 45 lag, et kontekstvindue på 1 million tokens, en kombination af lineær og sparsom attention samt vægte under MIT-licensen. 3
4
11
Modellens mest interessante løfte handler ikke kun om størrelse. Det er kombinationen af lang kontekst, visuelle input, værktøjsbrug og lavere påståede serveringsomkostninger i en model, som udviklere kan hente og køre selv. Den blinde lancering gav Zhipu usædvanligt direkte brugerfeedback, men der er fortsat brug for uafhængige og reproducerbare evalueringer af, hvordan arkitekturen og benchmarkresultaterne klarer sig i produktion.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha var Zhipu AI's GLM 5.3 Flash. Modellen blev bekræftet den 26.
Ox Alpha var Zhipu AI's GLM 5.3 Flash. Modellen blev bekræftet den 26. GLM 5.3 Flash er målrettet kodning, visuel programmering, lange kontekster og værktøjsbrugende AI agenter.
Zhipu hævder, at modellens kombination af lineær og sparsom attention reducerer beregningen til attention med 3,01 gange og brugen af KV cache med 4,44 gange sammenlignet med GLM 5.3.