Ox Alpha oli Z.ai:n eli Zhipu AI:n GLM 5.3 Flash. Yhtiö vahvisti asian 26. GLM 5.3 Flashissa on 320 miljardin parametrin mixture of experts arkkitehtuuri, josta vain 18 miljardia aktivoituu kunkin tokenin käsittelyssä.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Kuuden päivän ajan kehittäjät käyttivät tehokasta Ox Alpha -mallia tietämättä, kuka sen oli rakentanut. Malli ilmestyi 20. elokuuta 2026 ilmaisena ja ilman kehittäjätietoja OpenRouteriin ja OpenCodeen. Se tarjosi miljoonan tokenin konteksti-ikkunan sekä multimodaaliset syötteet. 26. elokuuta Z.ai – Zhipu AI:n kansainvälinen brändi – vahvisti, että Ox Alpha oli sen GLM-5.3-Flash, GLM-5-sarjan ensimmäinen natiivisti multimodaalinen malli. 2
5
9
Paljastus muutti anonyymin julkisen kokeilun tuotelanseeraukseksi. GLM-5.3-Flash julkaistiin avoimilla painoilla MIT-lisenssillä, sen API-hinnoittelu oli poikkeuksellisen matala, ja sen arkkitehtuuri on suunniteltu pitkien koodaus- ja agenttitehtävien käsittelyyn aiempaa kustannustehokkaammin. 6
7
9
Ox Alpha ilmestyi OpenRouteriin ja OpenCodeen ilman julkistettua kehittäjää. Hinta oli nolla dollaria, kontekstiraja 1 048 576 tokenia ja syötteiksi hyväksyttiin tekstiä, kuvia ja videota. Kehittäjät kokeilivat mallia nopeasti koodausagenteissa, päätetehtävissä ja pitkän kontekstin työnkuluissa. 4
5
8
Yhteisö alkoi etsiä vihjeitä mallin alkuperästä. Raportoidut merkit, kuten GLM-malleille tyypillinen tokenisaattorikäyttäytyminen ja paljastavat API-virheilmoitukset, johtivat arvailuihin Zhipu AI:n osallisuudesta. Lopulta Z.ai vahvisti yhteyden itse 26. elokuuta ja kertoi, että anonyymin julkaisun tarkoituksena oli kerätä palautetta todellisesta käytöstä ennen virallista julkaisua. 5
9
Esiversio saavutti huomattavan käyttömäärän. Yhden aikalaisraportin mukaan mallilla käsiteltiin kuudessa päivässä 42 biljoonaa tokenia, kun toinen raportti puhui noin 44 biljoonasta tokenista ja 503 000 OpenCode-käyttäjästä. Luvut perustuvat eri raportteihin ja mittausajankohtiin, joten niitä ei pidä käsitellä yhtenä itsenäisesti varmennettuna kokonaislukuna. 8
11
16
GLM-5.3-Flash on avoimilla painoilla julkaistu tekoälymalli, joka on suunnattu erityisesti ohjelmointiin, pitkäkestoisiin agenttitehtäviin ja multimodaalisiin työnkulkuihin. Z.ai kuvaa sitä GLM-5-perheen ensimmäiseksi natiivisti multimodaaliseksi malliksi. Dokumentaation mukaan se käsittelee visuaalisia syötteitä ja tarjoaa 1 048 576 tokenin konteksti-ikkunan. Yhteen tehtävään voi siis sisällyttää laajan koodivaraston, dokumentteja, kuvakaappauksia ja muuta aineistoa. 7
20
Mallin keskeinen tekninen ratkaisu on 320 miljardin parametrin mixture-of-experts-arkkitehtuuri, jossa 18 miljardia parametria aktivoituu tokenia kohden. Käytännössä mallissa on suuri joukko opittua kapasiteettia, mutta jokainen token ohjataan vain osan siitä läpi. Z.ai kertoo yhdistävänsä harvan attentionin ja lineaarisen attentionin vähentääkseen päättelyn laskentatarvetta ja avain–arvo-välimuistin eli KV-cachen kuormaa. 6
20
Tämä selittää Flash-nimen painotuksen. Malli ei ole pieni, mutta sen pitäisi olla palvelinkäytössä edullisempi kuin yhtä suuren parametrimäärän tiheä malli. Todellinen nopeus ja hinta riippuvat silti laitteistosta, palvelinohjelmistosta, eräajosta ja käyttötavasta.
Z.ai ilmoittaa GLM-5.3-Flashin saaneen DeepSWE v1.1 -testissä tuloksen 63,4, kun GLM-5.2:n tulos oli 46,2. Yhtiön sisäisessä vertailussa Claude Opus 4.8:n kanssa tulokset olivat 29,0 ja 29,5. 7
8
Luvut ovat kiinnostavia signaaleja, mutta ne eivät muodosta yleispätevää paremmuusjärjestystä. DeepSWE-tulos on yhtiön ilmoittama vertailutulos, ja Claude-vertailu perustuu sisäiseen arviointiin. Kehotteet, työkalut, agentin rakenne, mahdollinen testidatan vuotaminen ja pisteytys voivat vaikuttaa tuloksiin merkittävästi. Ennen kuin mallia voidaan pitää laajasti suljettujen huippumallien veroisena, tarvitaan riippumattomia ja toistettavia testejä.
Kehittäjille käytännöllisempi kysymys on työnkulun sopivuus. Malli voi tarkastella suuria repositorioita, hyödyntää visuaalista kontekstia ja jatkaa pitkiä agenttitehtäviä ilman, että tehtävän historiaa tarvitsee jatkuvasti tiivistää. Tuotantokäytössä ratkaisevat kuitenkin myös luotettavuus, työkalujen käyttö, viive ja virheistä palautuminen – eivät vain benchmark-pisteet.
Z.ai ilmoitti API:n listahinnoiksi 0,15 dollaria miljoonalta syötetokenilta ja 0,50 dollaria miljoonalta tulostokenilta. Dokumentaatiossa hinnat esitettiin myöhemmin väliaikaisesti 50 prosentin alennuksella: 0,075 dollaria syötteestä ja 0,25 dollaria tulosteesta ilmoitetun kampanja-ajan kuluessa. 2
Mallin painot julkaistiin Hugging Facessa MIT-lisenssillä, joka on isännöityyn malliin verrattuna salliva. MIT-lisenssi mahdollistaa yleensä kaupallisen uudelleenkäytön ja muokkaamisen, mutta organisaatioiden on silti tarkistettava kyseisen julkaisun lisenssi, malliehdot, riippuvuudet, laitteistovaatimukset ja käyttöönottoon liittyvät velvoitteet. 2
9
Z.ai:n dokumentaatio listaa GLM-5.3-Flashin myös yhtiön kehittäjä- ja koodauspalveluihin. API-rajapinta tukee multimodaalisia keskustelusyötteitä sekä työkalujen käyttöä. 17
20
21
Julkaisuun liittyi mallin ominaisuuksien lisäksi toinen merkittävä tarina. Z.ai kertoi, että anonyymi Ox Alpha -esiversio ajettiin kokonaan kiinalaisvalmisteisilla tekoälykiihdyttimillä ja että yhtiö käytti räätälöityä SGLang-pohjaista palvelinpinoa. Yhtiön teknisen materiaalin mukaan tavoitteena oli parantaa päättelyn tehokkuutta kotimaisella laitteistolla.
Osa toissijaisista raporteista toistaa väitteen, jonka mukaan räätälöity pino kolminkertaisti päästä päähän mitatun suorituskyvyn. Käytettävissä olevissa lähteissä kiihdytinkalustoa, tarkkaa vertailuasetelmaa ja sitä, kuinka riippumaton kokonaisuus oli ulkomaisista komponenteista, ei kuitenkaan ole tarkastettu riippumattomasti. 10
Ero on olennainen. Jos väite vahvistetaan, käyttöönotto olisi strategisesti merkittävä Kiinalle, joka pyrkii rakentamaan kyvykkäitä tekoälypalveluja Yhdysvaltojen siruvientirajoitusten oloissa. Toistaiseksi kyse on ennen kaikkea merkittävästä yhtiön omasta ilmoituksesta – ei ratkaisevasta todisteesta siitä, että kiinalainen laitteisto olisi kuronut umpeen koko infrastruktuurikuilun.
Ox Alpha -strategia tarjosi Z.ai:lle jotakin, mitä perinteinen julkaisu ei helposti anna: suuren määrän vaihtelevaa, ennakoimatonta käyttödatan kaltaista palautetta kehittäjiltä, jotka eivät tienneet mallin henkilöllisyyttä. Käyttäjät kokeilivat sitä koodausagenteissa ja pitkissä työnkuluissa siksi, että se oli ilmainen ja vaikutti kyvykkäältä – eivät markkinointiesitteen perusteella. Z.ai:n mukaan tarkoitus oli kerätä palautetta ennen virallista julkaisua. 5
9
Tapa sopii myös avoimien painojen jakelustrategiaan. Yhdistämällä sallivan lisenssin, matalan API-hinnan ja laajan kehittäjäsaatavuuden Z.ai voi kannustaa kokeiluihin, kerätä palautetta ja kasvattaa mallinsa käyttöä ilman perinteistä suljetun mallin tilausmallia. Aiemmat anonyymit mallikokeilut, kuten raportoitu Pony Alpha, viittaavat siihen, ettei kyse välttämättä ollut yksittäisestä ideasta, vaikka aiemmasta hankkeesta on saatavilla vain vähän tietoa.
GLM-5.3-Flash ei yksin todista, että Z.ai olisi saavuttanut uuden yleisen kärkipaikan. Vahvin näyttö koostuu julkaistuista teknisistä tiedoista, poikkeuksellisen menestyksekkäästä julkisesta esiversiosta sekä yhtiön ilmoittamista benchmark- ja infrastruktuurituloksista. Mallin aseman eri osa-alueilla – koodauksessa, multimodaalisessa päättelyssä, työkalujen käytössä, viiveessä ja luotettavuudessa – ratkaisevat riippumattomat arviot ja pitkäaikainen tuotantokäyttö.
Kilpailusignaali on silti selvä. Miljoonan tokenin konteksti, natiivi multimodaalisuus, avoimet painot ja senttien luokkaa oleva hinta miljoonaa tokenia kohden kohdistavat painetta kalliiden suljettujen mallien talouteen. Samalla julkaisu osoittaa, kuinka anonyymi esiversio voi toimia sekä todellisen käytön rasitustestinä että tehokkaana jakelukanavana.
Ox Alpha -mysteeri on siis ratkaistu: kyseessä oli Z.ai:n GLM-5.3-Flash. Seuraava kysymys ei enää ole rikostekninen vaan käytännöllinen: kuinka hyvin mallin lupaus halvasta, pitkäkontekstisesta tekoälystä kestää, kun kehittäjät siirtyvät ilmaisesta viraaliesiversiosta toistettaviin ja tuotantovalmiisiin työnkulkuihin.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha oli Z.ai:n eli Zhipu AI:n GLM 5.3 Flash. Yhtiö vahvisti asian 26.
Ox Alpha oli Z.ai:n eli Zhipu AI:n GLM 5.3 Flash. Yhtiö vahvisti asian 26. GLM 5.3 Flashissa on 320 miljardin parametrin mixture of experts arkkitehtuuri, josta vain 18 miljardia aktivoituu kunkin tokenin käsittelyssä.
Ilmaisena ja nimeämättömänä julkaistu esiversio sai kehittäjät kokeilemaan sitä koodausagenteissa ja pitkissä tehtävissä.