Ox Alpha var Zhipu AI:s GLM 5.3 Flash. Det bekräftades den 26 augusti 2026, efter en kostnadsfri och anonym förhandsversion som lanserades den 20 augusti.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Under nästan en vecka var Ox Alpha ett mysterium för utvecklare. Den anonyma modellen dök upp gratis på OpenRouter och andra utvecklarverktyg den 20 augusti 2026 – utan företagsnamn, modellkort eller detaljerad specifikation. Den 26 augusti kom svaret: Ox Alpha var GLM-5.3-Flash från kinesiska Zhipu AI, som internationellt verkar under namnet Z.ai. 3
4
Avslöjandet gjorde den blinda testlanseringen till något mer än en modellgåta. GLM-5.3-Flash är en öppen modell med totalt 320 miljarder parametrar, varav 18 miljarder aktiveras för varje token. Den har 45 lager, inbyggt multimodalt stöd och ett kontextfönster på 1 048 576 tokens – vanligtvis avrundat till en miljon tokens. Vikterna släpptes under MIT-licensen. 3
6
8
När Ox Alpha lanserades fanns ingen offentlig information om vem som stod bakom modellen. Utvecklare upptäckte i stället en kostnadsfri tjänst med lång kontext, stöd för flera medietyper och goda resultat i praktiska kodnings- och agentarbetsflöden. Det ledde snabbt till spekulationer om vilket AI-laboratorium som låg bakom. 13
16
Zhipu beskriver lanseringen som ett medvetet blindtest. Genom att dölja modellens namn och specifikationer ville företaget att utvecklare skulle bedöma svaren utifrån faktisk användbarhet – inte utifrån varumärke, parameterantal eller lanseringskampanjer. Trafiken gav samtidigt företaget användningsmönster och återkoppling från verkliga utvecklings- och agentuppgifter före den officiella lanseringen. 13
15
Under testperioden rapporterades en kostnadsfri kapacitet på omkring 100 biljoner tokens per dag. Stripe-medgrundaren Patrick Collison var en av de framstående utvecklare som enligt rapporter berömde modellens kvalitet. Sådana reaktioner bidrog till att göra den anonyma modellen till en uppmärksammad lansering, även om entusiasm i sociala medier inte är samma sak som en kontrollerad utvärdering. 13
14
Zhipu uppgav också att tjänsten kördes på kinesisktillverkade AI-acceleratorer. South China Morning Post rapporterade att testet använde ett kluster med 100 000 sådana chip och att modellen hade bearbetat 62 biljoner tokens före den formella lanseringen. Siffrorna skiljer sig från andra rapporter om testets kapacitet och användning och bör därför ses som uppgifter från företaget eller medier – inte som oberoende, granskade mätningar. 7
13
GLM-5.3-Flash är en så kallad mixture-of-experts-modell, eller MoE. Den totala parameterpoolen består av 320 miljarder parametrar, men bara 18 miljarder aktiveras för varje token. Tanken är att kombinera kapaciteten hos en mycket stor modell med lägre beräkningskostnad per inferenssteg än om alla parametrar skulle användas varje gång. 3
4
Modellen har 45 lager och är den första modellen i GLM-5-serien som Zhipu beskriver som genuint multimodal från grunden. Den kan hantera text, bilder, video, visuella dokument, filer och kombinationer av flera medietyper. Det är särskilt relevant för agenter som behöver läsa en skärmbild, tolka ett dokument, granska ett gränssnitt eller bedöma resultatet av kodkörning – inte bara analysera text. 4
11
Zhipu anger en kontext på 1 048 576 tokens, alltså ungefär en miljon tokens. Det är tänkt att räcka för stora kodbaser, långa agentsessioner, omfattande dokumentsamlingar och arbetsflöden där kod kombineras med visuellt eller filbaserat innehåll. 3
4
GLM-5.3-Flash tränades från en ny basmodell med en omarbetad arkitektur och träningsmetod. Zhipu uppger att träningen använde en multimodal datamängd på 30 biljoner tokens. Modellen presenteras därmed som en ny konstruktion med fokus på effektivitet och multimodal användning – inte bara som en mindre variant av GLM-5.3. 4
16
Modellen kombinerar linjär uppmärksamhet med gles uppmärksamhet. Linjär uppmärksamhet är tänkt att göra bearbetning av långa sekvenser mindre kostsam, medan gles uppmärksamhet kan lägga mer detaljerad beräkning på de samband där den gör störst nytta. Målet är att balansera lång kontext med rimligare krav på inferens. 4
16
Zhipu beskriver även mekanismen IndexPool, som ska minska minnes- och latensbelastningen när information indexeras i mycket långa kontexter. Arkitekturen använder dessutom så kallade manifold-constrained hyper-connections som ytterligare en metod för effektivare skalning. Värdet av dessa tekniker beror i praktiken på bland annat hårdvara, sekvenslängd, serveringskonfiguration och arbetslast. 4
16
Jämfört med GLM-5.3 uppger Zhipu att GLM-5.3-Flash minskar beräkningarna för attention med 3,01 gånger och användningen av KV-cache med 4,44 gånger, samtidigt som kvaliteten i lång kontext ska bevaras. För utvecklare är det betydelsefullt eftersom både attention-beräkningar och KV-cache kan bli stora flaskhalsar i långvariga AI-agenter. Förhållandena kommer dock främst från Zhipus eget tekniska material och ska inte tolkas som universella, oberoende verifierade hastighetsvinster. 4
GLM-5.3-Flash är främst inriktad på kodning, visuell programmering, långvariga agentuppgifter och verktygsanvändning. Den visuella förmågan ska låta en agent observera gränssnitt, renderade resultat och återkoppling från interaktioner – en sluten arbetsloop mellan kod, webbläsare och grafiska användargränssnitt. 4
Zhipus rapporterade benchmarkresultat omfattar:
Resultaten stödjer modellens profil som kodnings- och agentmodell, men jämförelser kräver försiktighet. Agenttester påverkas ofta av promptar, verktyg, kringliggande programvara, hårdvara, tidsgränser och versionen av själva utvärderingen. Siffrorna bör därför ses som Zhipus rapporterade resultat – inte som en slutgiltig ranking mellan alla konkurrerande modeller. 4
15
Zhipu släppte vikterna till GLM-5.3-Flash på Hugging Face under den tillåtande MIT-licensen, inklusive en BF16-version. Dokumentationen anger stöd för serveringsramverk som SGLang och vLLM. Organisationer får därmed möjlighet att köra modellen lokalt eller på egen infrastruktur i stället för att vara hänvisade till Z.ai:s API. 3
6
8
Det förändrar modellens praktiska erbjudande. Utvecklare kan testa den mot sina egna kodbaser, dokument, visuella gränssnitt och agentmiljöer. Infrastrukturteam kan samtidigt undersöka de faktiska kostnaderna och hårdvarukraven.
Det betyder dock inte att modellen är lätt att köra på vanlig konsumenthårdvara. Kontrollpunkten omfattar totalt 320 miljarder parametrar och kräver omfattande teknisk planering. Att bara 18 miljarder parametrar aktiveras per token minskar beräkningsarbetet, men gör inte hela modellen liten eller enkel att distribuera som standard.
Ox Alpha-testet var mer än ett marknadsföringsknep. Det undersökte om utvecklare skulle fortsätta använda modellen när namn, parameterantal och företagskoppling hölls hemliga. På så sätt fick Zhipu in arbetslaster och reaktioner från riktiga användare innan modellen presenterades formellt. 13
15
Experimentet har samtidigt tydliga begränsningar. Gratis tillgång kan locka ovanligt mycket trafik, offentligt beröm kan delvis bero på nyhetens behag och anonyma tester kontrollerar inte promptar eller ser till att alla modeller jämförs under identiska förhållanden.
Den säkraste slutsatsen är därför mer avgränsad: GLM-5.3-Flash skapade ett betydande intresse bland utvecklare innan dess identitet var känd. Zhipu använde sedan intresset som återkoppling för att stärka lanseringen. Oberoende och reproducerbara tester behövs fortfarande för att avgöra hur arkitekturens löften fungerar i produktion.
GLM-5.3-Flash är den avslöjade identiteten bakom Ox Alpha – en öppen, inbyggt multimodal GLM-modell för effektiv kodning och agentbaserat arbete. De viktigaste specifikationerna är en MoE-arkitektur med 320 miljarder parametrar totalt och 18 miljarder aktiva per token, 45 lager, ett kontextfönster på omkring en miljon tokens, en kombination av linjär och gles uppmärksamhet samt MIT-licensierade vikter. 3
4
11
Det mest intressanta är inte bara storleken. Det är kombinationen av lång kontext, visuella indata, verktygsanvändning och lägre beräkningskostnad enligt Zhipus egna uppgifter – i en modell som utvecklare kan ladda ner och försöka köra själva. Den anonyma lanseringen gav ovanligt mycket verklig användarfeedback, men den ersätter inte oberoende utvärderingar av prestanda och kostnad.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha var Zhipu AI:s GLM 5.3 Flash. Det bekräftades den 26 augusti 2026, efter en kostnadsfri och anonym förhandsversion som lanserades den 20 augusti.
Ox Alpha var Zhipu AI:s GLM 5.3 Flash. Det bekräftades den 26 augusti 2026, efter en kostnadsfri och anonym förhandsversion som lanserades den 20 augusti. GLM 5.3 Flash är byggd för kodning, visuell programmering, lång kontext och verktygsanvändande AI agenter.
Zhipu uppger att den hybrida arkitekturen med linjär och gles uppmärksamhet minskar beräkningsarbetet för attention med 3,01 gånger och användningen av KV cache med 4,44 gånger jämfört med GLM 5.3.