Ox Alpha var Zhipu AIs GLM 5.3 Flash. Identiteten ble bekreftet 26. Modellen er laget for programmering, visuell utvikling, lange agentoppgaver og verktøybruk.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Da en ukjent modell kalt Ox Alpha dukket opp på OpenRouter og andre utviklerverktøy 20. august 2026, fulgte det ingen modellkort, produsent eller detaljert spesifikasjonsliste med. Likevel hadde tjenesten lang kontekst, multimodale inndata og en ytelse i kode- og agentarbeidsflyter som raskt fanget utviklernes oppmerksomhet. 13
16
Seks dager senere kom svaret: Ox Alpha var GLM-5.3-Flash fra Zhipu AI, selskapet som internasjonalt også bruker navnet Z.ai. Zhipu bekreftet identiteten 26. august, etter å ha brukt den anonyme lanseringen som en blindtest i virkelige arbeidsoppgaver. 3
4
Resultatet ble mer enn en vellykket lanseringsgimmick. GLM-5.3-Flash ble samtidig presentert som en åpen modell med 320 milliarder totale parametere, 18 milliarder aktive parametere per token, rundt én million tokens kontekst, innebygd multimodal støtte og vekter utgitt under MIT-lisensen. 3
6
8
Ifølge Zhipu skulle utviklerne vurdere modellen ut fra det den faktisk leverte – ikke ut fra merkenavn, parameterantall eller forhåndsannonsering. Den anonyme testen gjorde det mulig å samle bruksdata og tilbakemeldinger fra ekte kodeprosjekter og agentoppgaver før den formelle lanseringen. 13
15
Rapporter beskrev en gratis kapasitet på omtrent 100 billioner tokens per dag under testen. Stripe-medgründer Patrick Collison var blant de profilerte utviklerne som skal ha omtalt kvaliteten positivt. Slike reaksjoner bidro til å gjøre Ox Alpha til en mye fulgt lansering, men entusiasme i offentligheten er ikke det samme som en kontrollert, uavhengig evaluering. 13
14
Zhipu opplyste også at tjenesten ble kjørt på kinesiskproduserte AI-akseleratorer. South China Morning Post rapporterte at forsøket brukte en klynge på 100 000 slike brikker, og at modellen hadde behandlet 62 billioner tokens før den formelle lanseringen. Tallene varierer mellom rapportene og bør derfor forstås som oppgitte selskaps- eller medietall, ikke som uavhengig reviderte målinger. 7
13
GLM-5.3-Flash er en mixture-of-experts-modell, ofte forkortet MoE. Den samlede parameterpuljen er på 320 milliarder, men bare 18 milliarder aktiveres for hvert token. Tanken er å kombinere kapasiteten til en svært stor modell med lavere beregningskostnad i hvert enkelt inferenssteg.
Modellen har 45 lag og er den første modellen i GLM-5-serien som beskrives som nativt multimodal. Den kan håndtere tekst, bilder, video, visuelle dokumenter, filer og kombinasjoner av disse. Det er særlig relevant for agenter som skal tolke skjermbilder, lese dokumenter, undersøke et brukergrensesnitt eller vurdere resultatet av kode som nettopp er kjørt. 4
11
Zhipu oppgir et kontekstvindu på 1 048 576 tokens, vanligvis avrundet til én million tokens. Det er ment for store programvarearkiver, lange agentsamtaler, omfattende dokumentsamlinger og arbeidsflyter der kode kombineres med visuelle eller filbaserte data. 3
4
GLM-5.3-Flash skal være trent fra en ny grunnmodell, med redesignet arkitektur og treningsoppskrift. Zhipu oppgir et multimodalt treningskorpus på 30 billioner tokens. Modellen presenteres dermed som en ny konstruksjon med vekt på effektivitet og multimodalitet – ikke bare som en mindre utgave av GLM-5.3. 4
16
Modellen kombinerer lineær attention med sparse attention, eller sparsom oppmerksomhet. Lineær attention skal gjøre behandling av lange sekvenser rimeligere, mens sparse attention prioriterer de tokenforbindelsene som trenger mer detaljert behandling. Målet er å balansere lang kontekst med mer håndterlige kostnader ved kjøring. 4
16
Zhipu trekker også frem mekanismen IndexPool, som skal redusere minne- og forsinkelsesbelastningen ved indeksering av svært lange kontekster. Arkitekturen bruker dessuten såkalte manifold-constrained hyper-connections som et tiltak for mer effektiv skalering. Hvor mye dette betyr i praksis, avhenger blant annet av maskinvare, sekvenslengde, serveroppsett og type arbeidsbelastning. 4
16
Sammenlignet med GLM-5.3 hevder Zhipu at GLM-5.3-Flash reduserer beregningene knyttet til attention med 3,01 ganger og bruken av KV-cache med 4,44 ganger, samtidig som kvaliteten ved lang kontekst skal bevares. For utviklere er dette viktig fordi nettopp attention-beregninger og KV-cache-minne kan bli flaskehalser i langvarige agentoppgaver. Tallene kommer imidlertid hovedsakelig fra Zhipus egne tekniske materialer og bør ikke tolkes som universelle, uavhengig verifiserte hastighetsgevinster. 4
GLM-5.3-Flash er først og fremst rettet mot programmering, visuell programmering, langsiktige agentoppgaver og verktøybruk. Den visuelle forståelsen skal gjøre det mulig for en agent å observere grensesnitt, gjengivelsesresultater og tilbakemeldinger fra interaksjoner – en lukket arbeidsflyt mellom kode, nettlesere og grafiske brukergrensesnitt. 4
Zhipu oppgir blant annet disse resultatene:
Resultatene støtter modellens posisjonering mot programvareutvikling og AI-agenter. Sammenligninger må likevel gjøres med varsomhet. Agentbaserte tester påvirkes av instruksjoner, verktøy, ekstra programvarelag, maskinvare, tidsgrenser og hvilken versjon av evalueringen som brukes. Tallene bør derfor først og fremst leses som Zhipus rapporterte resultater – ikke som en endelig rangering av alle konkurrerende modeller. 4
15
Zhipu publiserte modellvektene på Hugging Face under den tillatende MIT-lisensen, inkludert en BF16-versjon. Dokumentasjonen oppgir støtte for serveringsrammeverk som SGLang og vLLM. Det gir organisasjoner mulighet til å undersøke lokal eller selvstyrt drift i stedet for å være avhengige av Z.ai sitt API. 3
6
8
Det endrer hva modellen tilbyr i praksis. Utviklere kan teste den mot egne kodebaser, dokumenter, visuelle grensesnitt og agentmiljøer, mens infrastrukturteam kan måle kostnader og maskinvarekrav selv.
320 milliarder totale parametere gjør likevel lokal drift til et betydelig ingeniørprosjekt. At bare 18 milliarder parametere aktiveres per token, reduserer beregningsarbeidet, men gjør ikke hele modellvekten liten eller enkel å kjøre som standard.
Eksperimentet var mer enn et markedsføringsstunt. Zhipu testet om utviklere ville bruke modellen når navn, parameterantall og selskapsidentitet var skjult. Brukerne leverte samtidig reelle arbeidsoppgaver og reaksjoner før avsløringen. 13
15
Testen har likevel klare begrensninger. Gratis tilgang kan føre til uvanlig høy trafikk, offentlig ros kan være farget av nyhetseffekten, og anonym bruk kontrollerer ikke for forskjeller i instruksjoner eller identiske testbetingelser. Den mest nøkterne konklusjonen er derfor at GLM-5.3-Flash skapte betydelig utviklerinteresse før noen visste hvem som sto bak – og at Zhipu brukte denne interessen til å teste og forme lanseringen.
GLM-5.3-Flash er identiteten bak Ox Alpha: en åpen, nativt multimodal GLM-modell laget for effektiv programmering og agentarbeid. Hovedspesifikasjonene er en MoE-arkitektur med 320 milliarder totale og 18 milliarder aktive parametere, 45 lag, et kontekstvindu på én million tokens, en kombinasjon av lineær og sparsom attention samt MIT-lisensierte vekter. 3
4
11
Det mest interessante er ikke bare størrelsen. Det er kombinasjonen av lang kontekst, visuell input, verktøybruk og lavere påstått serveringskostnad i en modell utviklere kan laste ned og kjøre selv. Den blinde lanseringen ga uvanlig direkte tilbakemeldinger fra brukere, men uavhengige og reproduserbare tester trengs fortsatt for å vise hvordan arkitektur- og benchmarkpåstandene holder seg i produksjon.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha var Zhipu AIs GLM 5.3 Flash. Identiteten ble bekreftet 26.
Ox Alpha var Zhipu AIs GLM 5.3 Flash. Identiteten ble bekreftet 26. Modellen er laget for programmering, visuell utvikling, lange agentoppgaver og verktøybruk.
Zhipu hevder at en kombinasjon av lineær og sparsom oppmerksomhet reduserer beregningsbehovet for attention med 3,01 ganger og KV cache bruken med 4,44 ganger sammenlignet med GLM 5.3.