Ox Alpha oli Zhipu AI:n GLM 5.3 Flash, joka julkaistiin nimettömänä esiversiona 20. Malli on 320 miljardin parametrin mixture of experts järjestelmä, jossa aktivoituu vain 18 miljardia parametria tokenia kohti.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash oli nimettömän Ox Alpha -rajapinnan taustalla. Malli ilmestyi OpenRouteriin ja muihin kehittäjätyökaluihin 20. elokuuta 2026, ja Zhipu AI – kansainvälisesti myös Z.ai-nimellä toimiva yhtiö – paljasti sen henkilöllisyyden 26. elokuuta. 3
4
Viikon mittainen mallimysteeri päättyi samalla merkittävään avoimen mallin julkaisuun. GLM-5.3-Flash on 320 miljardin parametrin mixture-of-experts-malli, jossa käytetään vain 18 miljardia parametria kutakin tokenia kohti. Lisäksi se tarjoaa noin miljoonan tokenin konteksti-ikkunan, natiivin multimodaalisen syötteen ja MIT-lisenssillä julkaistut painot. 3
6
8
Ox Alpha julkaistiin ilman mallikorttia, valmistajan nimeä tai yksityiskohtaista teknistä dokumentaatiota. Kehittäjät löysivät ilmaisen rajapinnan, joka tarjosi pitkän kontekstin ja multimodaaliset syötteet, ja alkoivat kokeilla sitä erityisesti koodauksessa sekä tekoälyagenttien työnkuluissa. Käytännön suorituskyky herätti nopeasti spekulaatioita mallin alkuperästä. 13
16
Zhipun mukaan nimettömyys oli tarkoituksellista. Yhtiö halusi kehittäjien arvioivan mallia sen tuottamien tulosten perusteella, ei brändin, parametrimäärän tai julkaisumarkkinoinnin perusteella. Samalla yhtiö sai tietoa todellisista ohjelmistokehitys- ja agenttikäytöistä ennen virallista julkaisua. 13
15
Testijakson aikana tarjolla kerrottiin olleen noin 100 biljoonan tokenin päivittäinen ilmainen kapasiteetti. Stripe-yhtiön perustaja Patrick Collison kuului näkyviin kehittäjiin, joiden kerrottiin kehuneen mallin laatua. Tällaiset reaktiot lisäsivät kiinnostusta, mutta käyttäjien innostus ei vastaa kontrolloitua vertailutestiä. 13
14
Zhipu ilmoitti myös, että palvelu pyöri Kiinassa valmistetuilla tekoälykiihdyttimillä. South China Morning Postin mukaan testissä käytettiin 100 000 sirun klusteria ja malli käsitteli ennen virallista julkaisua 62 biljoonaa tokenia. Eri lähteissä esitetyt kapasiteetti- ja käyttöluvut poikkeavat toisistaan, joten niitä on syytä pitää yhtiön tai median raportoimina, ei riippumattomasti tarkastettuina mittauksina. 7
13
GLM-5.3-Flash on mixture-of-experts- eli MoE-malli. Sen kokonaisparametrimäärä on 320 miljardia, mutta yhden tokenin käsittelyssä aktivoituu vain 18 miljardia parametria. Tavoitteena on yhdistää erittäin suuren mallin kapasiteetti pienempään laskentamäärään jokaisessa päättelyvaiheessa. 3
4
Mallissa on 45 kerrosta, ja Zhipu kuvailee sitä GLM-5-sarjan ensimmäiseksi natiivisti multimodaaliseksi malliksi. Se käsittelee tekstiä, kuvia, videota, visuaalisia dokumentteja, tiedostoja ja toisiinsa lomittuvia multimodaalisia syötteitä. Tämä on hyödyllistä esimerkiksi silloin, kun agentin pitää tarkastella käyttöliittymää, tulkita kuvakaappausta, lukea dokumenttia tai arvioida koodin suorituksen tulosta tekstin lisäksi. 4
11
Zhipu ilmoittaa konteksti-ikkunan kooksi 1 048 576 tokenia, mikä pyöristyy usein miljoonaksi tokeniksi. Kapasiteetti on tarkoitettu esimerkiksi suurten ohjelmistovarastojen, pitkien agentti-istuntojen ja laajojen dokumenttikokonaisuuksien käsittelyyn. 3
4
Malli on koulutettu uudesta perustasta uudistetulla arkkitehtuurilla ja koulutusmenetelmällä. Zhipun mukaan koulutuksessa käytettiin 30 biljoonan tokenin multimodaalista aineistoa, joten GLM-5.3-Flashia ei esitellä pelkästään GLM-5.3:n pienempänä versiona. 4
16
GLM-5.3-Flash yhdistää lineaarisen tarkkaavaisuuden ja harvan tarkkaavaisuuden. Lineaarinen tarkkaavaisuus pyrkii tekemään pitkien sekvenssien käsittelystä edullisempaa, kun taas harva tarkkaavaisuus säilyttää tarkemmat yhteydet niissä kohdissa, joissa niitä tarvitaan eniten. Tavoitteena on tasapainottaa pitkän kontekstin kyky ja käytännölliset päättelykustannukset. 4
16
Zhipu kertoo myös IndexPool-mekanismista, jonka tarkoitus on pienentää pitkien kontekstien indeksoinnin muistikuormaa ja viivettä. Lisäksi arkkitehtuurissa käytetään manifold-constrained hyper-connections -tekniikkaa, jonka yhtiö liittää mallin skaalautuvuuden tehostamiseen. Näiden tekniikoiden todellinen vaikutus riippuu kuitenkin palvelinkokoonpanosta, sekvenssin pituudesta, laitteistosta ja käyttötavasta. 4
16
Zhipun mukaan GLM-5.3-Flash vähentää GLM-5.3-malliin verrattuna tarkkaavaisuuslaskentaa 3,01-kertaisesti ja KV-välimuistin käyttöä 4,44-kertaisesti samalla, kun pitkän kontekstin laatu pyritään säilyttämään. Kehittäjille tämä on merkittävää, sillä tarkkaavaisuuslaskenta ja KV-välimuistin vaatima muisti voivat muodostua pitkäkestoisten agenttien pullonkauloiksi. Suhdeluvut ovat kuitenkin pääosin Zhipun omista teknisistä materiaaleista, eivätkä ne tarkoita yleispäteviä, riippumattomasti varmennettuja nopeutuksia. 4
GLM-5.3-Flash on suunnattu ennen kaikkea koodaukseen, visuaaliseen ohjelmointiin, pitkäkestoisiin agenttitehtäviin ja työkalujen käyttöön. Natiivin visuaalisen kykynsä ansiosta agentti voi tarkastella käyttöliittymiä, renderöityjä näkymiä ja toiminnan palautetta. Näin koodin, selaimen ja graafisen käyttöliittymän välille voidaan rakentaa jatkuva palautesilmukka. 4
Zhipun raportoimat vertailutulokset ovat:
Tulokset tukevat mallin painotusta ohjelmistokehitykseen ja agentteihin, mutta niiden vertailussa on syytä olla tarkkana. Agenttien vertailutesteihin vaikuttavat muun muassa kehotteet, käytettävät työkalut, lisäohjelmointi, laitteisto, aikarajat ja testiversio. Luvut ovat parhaiten tulkittavissa Zhipun ilmoittamina tuloksina, eivät lopullisena paremmuusjärjestyksenä kaikkien kilpailijoiden välillä. 4
15
Zhipu julkaisi GLM-5.3-Flashin painot Hugging Facessa sallivan MIT-lisenssin alla. Saatavilla on myös BF16-versio. Dokumentaatiossa mainitaan käyttöönotto muun muassa SGLang- ja vLLM-palvelukehyksillä, joten organisaatiot voivat ajaa mallia omassa ympäristössään eivätkä ole sidottuja pelkästään Z.ai:n isännöityyn rajapintaan. 3
6
8
Avoimuus muuttaa mallin käytännön arvoa. Kehittäjät voivat testata sitä omilla koodivarastoillaan, dokumenteillaan, kuvallisilla käyttöliittymillään ja agenttiympäristöillään. Infrastruktuuritiimit voivat puolestaan arvioida palvelukustannuksia ja laitteistovaatimuksia itse.
320 miljardin parametrin kokonaismäärä tekee käyttöönotosta silti huomattavan teknisen hankkeen. 18 miljardin aktiivisen parametrin rakenne vähentää laskentaa tokenia kohti, mutta koko tarkistuspiste ei muutu sen vuoksi automaattisesti kevyeksi ladattavaksi malliksi.
Ox Alpha -kokeilu oli muutakin kuin markkinointitempaus. Se testasi, käyttäisivätkö kehittäjät mallia edelleen, vaikka sen nimi, parametrimäärä ja yritystausta olisi piilotettu. Tällä tavoin Zhipu sai käyttötapauksia ja palautetta ennen virallista julkistusta. 13
15
Kokeilulla oli kuitenkin rajansa. Ilmainen käyttö voi houkutella poikkeuksellisen paljon liikennettä, julkinen kehu voi heijastaa uutuutta, eikä nimetön testi kontrolloi kehotteita tai takaa järjestelmille samanlaisia vertailuolosuhteita. Vahvin johtopäätös on siksi rajattu: GLM-5.3-Flash herätti huomattavaa todellista kiinnostusta jo ennen kuin sen valmistaja paljastui, ja Zhipu pystyi hyödyntämään tätä kiinnostusta julkaisunsa kehittämisessä.
GLM-5.3-Flash on Ox Alphan paljastunut henkilöllisyys: avoimilla painoilla julkaistu, natiivisti multimodaalinen GLM-malli, joka on rakennettu tehokkaaseen koodaukseen ja agenttityöhön. Sen keskeisiä ominaisuuksia ovat 320 miljardin kokonaisparametrin ja 18 miljardin aktiivisen parametrin MoE-rakenne, 45 kerrosta, miljoonan tokenin konteksti-ikkuna, lineaarisen ja harvan tarkkaavaisuuden yhdistelmä sekä MIT-lisenssi. 3
4
11
Mallin merkittävin lupaus ei ole pelkkä koko. Olennaisempaa on pitkän kontekstin, visuaalisen syötteen, työkalujen käytön ja väitetysti pienemmän palvelukuorman yhdistelmä mallissa, jonka kehittäjät voivat ladata ja ajaa itse. Sokea julkaisu tarjosi poikkeuksellisen suoraa käyttäjäpalautetta, mutta riippumattomia ja toistettavia arvioita tarvitaan vielä, jotta arkkitehtuuri- ja vertailutestiväitteiden vaikutus tuotantokäytössä voidaan osoittaa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha oli Zhipu AI:n GLM 5.3 Flash, joka julkaistiin nimettömänä esiversiona 20.
Ox Alpha oli Zhipu AI:n GLM 5.3 Flash, joka julkaistiin nimettömänä esiversiona 20. Malli on 320 miljardin parametrin mixture of experts järjestelmä, jossa aktivoituu vain 18 miljardia parametria tokenia kohti.
Zhipu väittää hybridiarkkitehtuurin vähentävän tarkkaavaisuuslaskentaa 3,01 kertaisesti ja KV välimuistin käyttöä 4,44 kertaisesti GLM 5.3 malliin verrattuna.