Z.ai vahvisti 26. elokuuta 2026, että ilmainen ja nimetön Ox Alpha oli GLM 5.3 Flash: 320 miljardin parametrin malli, jolla on 18 miljardia aktiivista parametria tokenia kohden ja MIT lisensoidut painot.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mallin henkilöllisyyttä tärkeämpi asia on julkaisustrategia. Z.ai tarjosi tehokasta mallia ensin ilmaiseksi ja ilman omaa brändiään, keräsi samalla kehittäjien todellista käyttödataa ja muutti kokeilun myöhemmin nimetyksi, ladattavaksi tuotteeksi. Näin salainen esijulkaisu toimi sekä infrastruktuurin rasitustestinä että kiinnostusta kasvattaneena markkinointikampanjana.
GLM-5.3-Flash on mixture-of-experts-malli eli harva-asiantuntijamalli, jossa on yhteensä 320 miljardia parametria, mutta jokaisella tokenilla käsitellään vain 18 miljardia aktiivista parametria. Malli ottaa vastaan tekstiä, kuvia ja videota ja tuottaa tekstimuotoisia vastauksia.
Konteksti-ikkunan nimellinen koko on noin miljoona tokenia. Tarkka ilmoitettu raja vaihtelee palvelun mukaan: Z.ai:n dokumentaatio puhuu miljoonan tokenin suunnittelusta, kun taas OpenRouter ilmoittaa kooksi 1 310 720 tokenia. 12340
Painot julkaistiin MIT-lisenssillä, mikä tekee mallista huomattavasti helpommin itse ylläpidettävän kuin pelkästä suljetusta API-palvelusta. Virallisen julkaisun jälkeen malli listattiin myös omalla nimellään OpenRouterissa. 348
GLM-5.3-Flashia ei pidä sekoittaa suurempaan GLM-5.3-tuotteeseen, jonka Z.ai julkisti aiemmin elokuussa. Kyseessä on erillinen, edullisemmaksi tarkoitettu 320B-A18B-malli, ei saman tuotteen toinen nimi. 10
Z.ai:n mukaan GLM-5.3-Flash parantaa GLM-5.2:n suorituskykyä ja alentaa samalla palvelukustannuksia. Yhtiön julkaisun yhteydessä esitetyissä tuloksissa malli sai DeepSWE v1.1 -testissä 63,4 pistettä, kun GLM-5.2:n tulos oli 46,2. Z.ai ilmoitti lisäksi sisäisessä koodaustestissään tulokseksi 29,0, lähelle Claude Opus 4.8 -mallille ilmoitettua 29,5:tä. 316
Luvut kertovat siitä, miten Z.ai asemoi tuotettaan, mutta ne eivät yksin vahvista tasavertaisuutta Anthropicin mallin kanssa. Testien määritelmät, arviointiasetukset, kehotteet ja tulosten toistettavuus vaikuttavat vertailuun. Varovaisin johtopäätös on, että Z.ai väittää saavuttaneensa vahvan koodaus- ja agenttisuorituskyvyn huomattavasti pienemmillä kustannuksilla – ei se, että malli olisi kiistatta ohittanut suljetut huippumallit.
Ox Alphan näkyvin piirre oli mahdollisuus käyttää sitä ilmaiseksi ja nimettömänä esijulkaisun aikana. Tämä vaihe päättyi, kun malli sai virallisen nimen.
Z.ai:n ilmoittama listahinta on 0,15 dollaria miljoonalta syöttötokenilta ja 0,50 dollaria miljoonalta tulostokenilta. 13 OpenRouterissa näkyi julkaisun yhteydessä tätä alempi tarjoushinta, 0,075 dollaria syöttötokenilta ja 0,25 dollaria tulostokenilta. 2
Ero on olennainen: ilmainen esikatselu, Z.ai:n listahinta ja yksittäisen jakelualustan väliaikainen alennus ovat kolme eri käyttöehtoa.
Hinta on mallin vetovoiman kannalta keskeinen. Koodausagentit voivat kuluttaa suuria määriä kontekstia ja tuottaa paljon tekstiä, joten tokenien hinta voi vaikuttaa mallivalintaan yhtä paljon kuin pieni ero vertailutestissä.
Z.ai:n mukaan GLM-5.3-Flash toimii kokonaan kiinalaisilla tekoälykiihdyttimillä. Julkaisua käsitelleissä raporteissa palvelujärjestelmän kuvataan perustuvan räätälöityyn SGLang-pinoon, jossa käytetään muun muassa kvantisointia, tensoririnnakkaisuutta, erilaisia välimuistimuotoja, kerrosten jakamista sekä erillistä encode–prefill–decode-arkkitehtuuria. Tavoitteena on parantaa koko palveluketjun suorituskykyä kotimaisen laitteiston rajoituksissa. 25
Tämä jatkaa GLM-malliperheen ympärille rakennettua aiempaa tarinaa. Z.ai on kertonut kouluttaneensa GLM-perheen Huawei Ascend -prosessorien avulla ilman Nvidian laitteistoa. Raporttien mukaan yhtiön lisääminen Yhdysvaltain Entity List -vientirajoituslistalle rajoittaa sen pääsyä Nvidian H100-, H200- ja B200-kiihdyttimiin. 26
Väite on strategisesti merkittävä, mutta sitä on syytä pitää yhtiön ja alan raportointina, ei täysin riippumattomasti auditoituna laitteistover tailuna. Vahvempi johtopäätös on, että Z.ai esittelee pinoaan kykenevänä palvelemaan suurta multimodaalista mallia ilman Nvidian tehokkaimpia datakeskus-GPU:ita.
Ox Alpha näyttää noudattaneen harkittua salaisen julkaisun kaavaa: julkaistaan kyvykäs malli ilman tekijän nimeä, tarjotaan se ilmaiseksi suosituissa koodauspalveluissa, seurataan todellista käyttöä ja paljastetaan tuote vasta, kun palautetta on kertynyt.
Z.ai:hin on liitetty aiempi Pony Alpha -testi, jossa hyödynnettiin samankaltaista ideaa. Yhteisön tutkijat yrittivät tunnistaa Ox Alphan esimerkiksi tokenisaattorin käyttäytymisestä, videonkäsittelystä ja API-virheistä. 71113
Julkaisun yhteydessä esitettiin myös poikkeuksellisen suuria käyttölukuja ja kehittäjien innostuneita kommentteja. Kaikkia näitä lukuja tai sitaatteja ei kuitenkaan voida vahvistaa riippumattomasti saatavilla olevasta aineistosta. Niitä on turvallisinta pitää julkaisukauden raportointina, ei auditoituna käyttäjä- tai käyttödatana. 14
GLM-5.3-Flash ei todista, että Z.ai olisi ohittanut OpenAI:n tai Anthropicin kaikissa huippumallien käyttötapauksissa. Julkaisu osoittaa kuitenkin poikkeuksellisen kilpailukykyisen yhdistelmän: multimodaalisen syötteen, erittäin pitkän kontekstin, avoimet MIT-lisensoidut painot, koodausagentteihin painottuvan suorituskyvyn ja matalan API-hinnan. 1540
Kehittäjille tämä voi madaltaa palveluntarjoajan vaihtamisen kynnystä ja helpottaa itse ylläpidettävien tai usean palveluntarjoajan ratkaisujen rakentamista. Suljetuille mallipalveluille se puolestaan lisää paineita hintoihin ja katteisiin – erityisesti koodauskuormissa, joissa tokenien määrä, viive, käyttöönoton hallinta ja laitteiston saatavuus voivat olla yhtä tärkeitä kuin pistemäärä tulostaulukossa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai vahvisti 26. elokuuta 2026, että ilmainen ja nimetön Ox Alpha oli GLM 5.3 Flash: 320 miljardin parametrin malli, jolla on 18 miljardia aktiivista parametria tokenia kohden ja MIT lisensoidut painot.
Z.ai vahvisti 26. elokuuta 2026, että ilmainen ja nimetön Ox Alpha oli GLM 5.3 Flash: 320 miljardin parametrin malli, jolla on 18 miljardia aktiivista parametria tokenia kohden ja MIT lisensoidut painot. Malli käsittelee luonnostaan tekstiä, kuvia ja videota, tukee noin miljoonan tokenin kontekstia ja maksaa Z.ai:n ilmoittamalla listahinnalla 0,15 dollaria miljoonalta syöttötokenilta ja 0,50 dollaria miljoonalta tulos...
Salainen julkaisu antoi Z.ai:lle mahdollisuuden testata koodausagenttia todellisella käyttäjäkuormalla ennen nimen ja ladattavien painojen paljastamista.