Zhipu AI vahvisti 26. elokuuta 2026, että anonyymi Ox Alpha malli, joka tunnettiin kiinankielisessä yhteisössä nimellä ”Niu Lai”, oli GLM 5.3 Flash.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Zhipu AI, joka käyttää kansainvälisesti myös Z.ai-brändiä, vahvisti 26. elokuuta 2026, että anonyymisti julkaistu ”Ox Alpha” -malli oli sen uusi GLM-5.3-Flash. Kiinankielisessä teknologiayhteisössä mallia kutsuttiin nimellä ”Niu Lai”. Kyseessä on avoimilla painoilla julkaistu, natiivisti multimodaalinen mixture-of-experts-malli, jota testattiin ennen virallista julkaisua ilman valmistajan nimeä. 1
4
6
Anonyymi ja maksuton kokeilu OpenRouterissa sekä kehittäjille suunnatussa OpenCodessa synnytti poikkeuksellisen kysyntäpiikin. Raporttien mukaan mallia käytettiin yli 50 biljoonan tokenin edestä viidessä päivässä, ja kuuden päivän kohdalla määrä oli noussut yli 60 biljoonaan. Ox Alpha nousi molempien palveluiden käyttötilastojen kärkeen, ja sen huippukäyttö oli tiettävästi yli kaksinkertainen DeepSeekin vertailukelpoisiin malleihin nähden. 3
Zhipun mukaan koko palvelu pyöri yli 100 000 Kiinassa valmistetun sirun muodostamassa klusterissa. Yhtiö ilmoitti, että ohjelmisto-optimointien jälkeen laitteiston tehokkuus ja tokenikohtainen kustannus olivat verrattavissa valtavirran Nvidian GPU-ratkaisuihin. 3
6
Sirujen tarkkoja valmistajia ei kuitenkaan paljastettu. Huawei, Moore Threads ja Hygon on mainittu mahdollisina toimittajina, mutta kyse on vahvistamattomasta spekulaatiosta, ei Zhipun virallisesta vahvistuksesta. 40
Paljastus ei todista, että Kiina olisi yleisesti saavuttanut Nvidian laitteiston tason tai että kotimaisten sirujen päättelykustannukset olisivat aina samat kuin Nvidian ratkaisuilla. Se osoittaa kuitenkin, että laaja, todellinen kansainvälinen päättelykuorma voidaan ajaa ilman Nvidian laitteistoa, kun mallin ympärille rakennetaan tehokas ohjelmisto- ja järjestelmäkokonaisuus. 3
6
Tällä on merkitystä Nvidian CUDA-ekosysteemille. Mallikohtaiset ohjelmistopinot ja päättelymoottorit voivat pienentää CUDA-riippuvuutta joissakin tuotantokäytöissä. CUDA:n laaja ekosysteemi, työkalut, kehittäjäkunta ja koulutukseen liittyvät edut eivät kuitenkaan tämän perusteella katoa. Vahvempi johtopäätös ylittäisi käytettävissä olevan näytön.
Zhipun SGLang-pohjaisessa päättelymoottorissa kerrotaan käytetyn muun muassa W8A8-kvantisaatiota, INT8-, FP8- ja BF16-muotojen yhdistelmää välimuistin kvantisoinnissa, solmun sisäistä tensoriparalleelia sekä Encode–Prefill–Decode- eli EPD-jakoa. Sen avulla eri työvaiheille voitiin rakentaa erikseen skaalautuvia laskentapoolleja. Tekniikoiden tavoitteena oli hallita muistin, kaistanleveyden, tiedonsiirron ja ajoituksen rajoitteita jopa miljoonan tokenin konteksti-ikkunassa. 4
7
Zhipun kerrotaan ilmoittaneen, että muutokset paransivat kokonaispalvelun suorituskykyä noin kolminkertaiseksi alkuperäiseen lähtötasoon verrattuna. Myöhempi SGLang-dokumentaatio raportoi suuremmasta läpimenosta ja FP8-välimuistin selvästi suuremmasta kapasiteetista BF16-vertailuasetukseen nähden. Dokumentaatio ei kuitenkaan ole riippumaton tarkastus Zhipun alkuperäiselle kolminkertaista parannusta koskevalle väitteelle. 2
GLM-5.3-Flashissa on yhteensä 320 miljardia parametria, mutta tokenia käsiteltäessä aktiivisena on noin 18 miljardia. Malli tukee 1 048 576 tokenin eli noin miljoonan tokenin konteksti-ikkunaa. Se on GLM-5-sarjan ensimmäinen natiivisti multimodaalinen malli, joten se käsittelee tekstin lisäksi kuvia, videoita ja tiedostoja. 5
7
Artificial Analysis Intelligence Index -indeksissä mallille ilmoitettiin pistemääräksi 57, mikä vastasi raportoidusti Claude Opus 4.8:n tulosta. Tämä tarkoittaa samantasoa kyseisessä yhdistelmäindeksissä – ei sitä, että mallien suorituskyky olisi sama kaikissa testeissä tai käytännön agenttitehtävissä. 1
GLM-5.3-Flash asemoitiin tehokkaiden, huippuluokan mallien kuten DeepSeek V4 Flashin ja Pron kilpailijaksi, mutta huomattavasti edullisemmalla päättelyhinnalla. Käytettävissä olevat lähteet eivät kuitenkaan riitä vahvistamaan täsmällisiä, testi testiltä tehtyjä vertailuja molempiin DeepSeek-versioihin.
Zhipun ilmoitettu API-hinta oli:
Aikalaisraportoinnissa hinnan kuvattiin olevan noin kymmenesosa GLM-5.3:n hinnasta ja noin 1/40 Claude Opus 4.8:n hinnasta. Suhteet riippuvat kuitenkin siitä, verrataanko syöte- vai tulostetokeneita, mitä kontekstitasoa käytetään ja millä hinnoittelusuunnitelmalla laskelma tehdään. 1
Zhipun paljastus teki Ox Alphasta muutakin kuin hetkellisen nimettömän hittimallin: se tarjosi esimerkin siitä, miten suuri kielimalli voidaan tuoda laajasti käyttäjien saataville yhdistämällä harva mixture-of-experts-arkkitehtuuri, aggressiivinen järjestelmäoptimointi ja Nvidiasta riippumaton laskentainfrastruktuuri. Näytön perusteella kyse on ennen kaikkea onnistuneesta mallin ja infrastruktuurin yhteissuunnittelusta – ei lopullisesta todisteesta laitteistokilpailun ratkeamisesta.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI vahvisti 26. elokuuta 2026, että anonyymi Ox Alpha malli, joka tunnettiin kiinankielisessä yhteisössä nimellä ”Niu Lai”, oli GLM 5.3 Flash.
Zhipu AI vahvisti 26. elokuuta 2026, että anonyymi Ox Alpha malli, joka tunnettiin kiinankielisessä yhteisössä nimellä ”Niu Lai”, oli GLM 5.3 Flash. Maksuton testi OpenRouterissa ja OpenCodessa keräsi yli 50 biljoonaa tokenia viidessä päivässä ja myöhemmin yli 60 biljoonaa kuudessa päivässä.
Zhipun mukaan liikenne ajettiin kokonaan yli 100 000 Kiinassa valmistetun AI kiihdyttimen klusterissa.