Zhipu AI, joka tunnetaan kansainvälisesti myös nimellä Z.ai, ratkaisi 26. elokuuta 2026 anonyymin ”Ox Alpha” -mallin ympärillä pyörineen mysteerin. Kiinalaisissa kehittäjäpiireissä ”Niu Lai” -nimellä tunnettu malli oli yhtiön mukaan GLM-5.3-Flash: GLM-sarjan avoimilla painoilla julkaistu, natiivisti multimodaalinen malli.
1
15
Paljastuksessa oli kyse mallijulkaisua suuremmasta kokonaisuudesta. Zhipu kertoi testanneensa järjestelmää ilmaiseksi OpenRouterissa ja OpenCodessa, joissa se käsitteli viidessä päivässä yli 50 biljoonaa tokenia. Yhtiön mukaan liikenne ajettiin kokonaan yli 100 000 kiinalaisvalmisteisen tekoälykiihdyttimen muodostamalla klusterilla.
8
15
Anonyymi testi muuttui tosielämän rasituskokeeksi
Ox Alpha ilmestyi palveluihin ilman yrityksen nimeä tai tavallista julkaisukampanjaa. Kehittäjät arvioivat sitä siis ennen kaikkea vastausten laadun, nopeuden, saatavuuden ja hinnan perusteella – eivät Zhipun brändin tai käytetyn laitteiston perusteella.
Malli nousi nopeasti OpenRouterin ja OpenCoden käyttötilastojen kärkeen. Myöhemmissä raporteissa liikenteen kokonaismääräksi arvioitiin yli 60 biljoonaa tokenia kuuden päivän aikana, ja OpenRouterissa käytön kerrottiin ylittäneen vertailukelpoisen DeepSeek-liikenteen yli kaksinkertaisesti. Eri luvut perustuvat eri ajanjaksoihin ja alustojen omiin mittareihin, joten varovaisin johtopäätös on, että kokeilu ylitti 50 biljoonan tokenin rajan ja keräsi poikkeuksellisen paljon kysyntää.
1
3
30
Tämä tekee kokeilusta kiinnostavan: kyse ei ollut vain laboratoriovertailusta, vaan suuresta määrästä oikeaa kehittäjäliikennettä ennen mallin henkilöllisyyden paljastamista.
Mitä Zhipu kertoi kiinalaisesta siruklusterista?
Zhipun mukaan verkkopalvelun päättelykuorma ajettiin yli 100 000 kiinalaisvalmisteisella kiihdyttimellä. Yhtiö väitti ohjelmisto-optimoinnin tuoneen laitteiston tehokkuuden ja tokenikohtaisen kustannuksen valtavirran Nvidia-grafiikkasuorittimien tasolle.
15
24
Zhipu ei kuitenkaan nimennyt käytettyjen sirujen valmistajia lähteissä, joihin tämä artikkeli perustuu. Huawei, Moore Threads ja Hygon on mainittu alan raporteissa mahdollisina toimittajina, mutta väite on vahvistamaton eikä sitä pidä tulkita Zhipun viralliseksi vahvistukseksi.
30
40
Väite on myös syytä rajata oikein. Se ei osoita, että kiinalaiset sirut vastaisivat Nvidiaa kaikissa työkuormissa, että kotimainen laitteisto olisi syrjäyttänyt Nvidian mallien koulutuksessa tai että ohjelmistotyökalut olisivat ekosysteemeiltään vastaavia.
Se tukee kapeampaa johtopäätöstä: suuri päättelypalvelu voidaan rakentaa Nvidiasta riippumattoman, kotimaisiin kiihdyttimiin perustuvan pinon varaan, kun malli ja palvelujärjestelmä suunnitellaan ja optimoidaan yhdessä.
Päättelyohjelmisto oli ratkaisevassa roolissa
Miljoonan tokenin konteksti-ikkuna asettaa palvelulle kovat vaatimukset muistin, muistikaistan, laitteiden välisen tiedonsiirron ja kuormituksen ajoituksen suhteen. Zhipu rakensi SGLangin päälle oman päättelymoottorin ja käytti useita optimointitekniikoita:
- W8A8-kvantisointia laskennan ja muistipaineen vähentämiseksi;
- INT8-, FP8- ja BF16-kvantisointien yhdistelmää välimuistissa;
- tensorien rinnakkaiskäsittelyä palvelinsolmujen sisällä; sekä
- Encode–Prefill–Decode- eli EPD-arkkitehtuuria, jossa multimodaalinen koodaus, kehotteen esikäsittely ja token tokenilta tapahtuva generointi erotetaan itsenäisesti skaalautuviin työpooliin.
11
24
Zhipun mukaan ratkaisu paransi päästä päähän mitattua palvelusuorituskykyä noin kolminkertaiseksi samaan laitteistoon verrattuna alkuperäiseen vertailutasoon.
24
26 SGLangin myöhemmässä dokumentaatiossa raportoidaan lisäksi BF16-vertailukokoonpanoa parempi läpimeno ja FP8-välimuistin suurempi kapasiteetti. Dokumentaatio ei kuitenkaan ole riippumaton tarkastus Zhipun alkuperäiselle kolminkertaisuutta koskevalle väitteelle.
17
Nvidian kannalta merkitys liittyy ennen kaikkea CUDAn asemaan päättelyssä, ei yhtiön koko kilpailuedun välittömään romahtamiseen. Erikoistuneet ytimet, kvantisointi, rinnakkaislaskenta ja kuormituksen ajoitus voivat vähentää CUDA-riippuvuutta tietyissä tuotantotyökuormissa. Nvidian laaja ohjelmistoekosysteemi, työkalut, asennettu laitekanta ja asema mallien koulutuksessa ovat erillisiä kysymyksiä, joihin tämä julkaisu ei anna lopullista vastausta.
GLM-5.3-Flashin tekniset tiedot
GLM-5.3-Flash on raporttien mukaan harva Mixture-of-Experts-malli, jossa on yhteensä 320 miljardia parametria mutta vain noin 18 miljardia aktiivista parametria jokaista tokenia kohden. Malli tukee 1 048 576 tokenin konteksti-ikkunaa ja natiivista multimodaalista syötettä, joten sitä on asemoitu erityisesti pitkiin dokumentteihin, ohjelmointiin ja pitkäkestoisiin agenttitehtäviin.
2
5
7
Artificial Analysis Intelligence Index -indeksissä mallin raportoitu pistemäärä oli 57, sama kuin Claude Opus 4.8 -mallilla. Kyse on yhden yhdistelmäindeksin tasatuloksesta, ei todisteesta siitä, että mallit suoriutuisivat yhtä hyvin kaikissa testeissä, sovelluksissa tai agenttitehtävissä.
9
Hinta painaa vaakakupissa
Zhipun ilmoittama API-hinta oli 0,15 dollaria miljoonalta syötetokenilta ja 0,50 dollaria miljoonalta tulostetokenilta.
4
29 Aikalaisraporteissa mallin hinnan kuvattiin olevan noin kymmenesosa GLM-5.3:n hinnasta ja noin neljäskymmenesosa Claude Opus 4.8:n hinnasta. Suhteet riippuvat kuitenkin siitä, verrataanko syöte- vai tulostetokeneita, mitä hinnoittelutasoa käytetään ja sisältyykö vertailuun eri palvelupaketteja.
1
4
GLM-5.3-Flashin todellinen kilpailuetu syntyy kolmen tekijän yhdistelmästä: suhteellisen tehokkaasta harvasta arkkitehtuurista, aggressiivisesti optimoidusta palvelukerroksesta ja matalasta hinnasta.
Ox Alpha -kokeilu osoitti, että tämä yhdistelmä voi houkutella kehittäjiä laajasti jo ennen kuin mallin taustalla oleva yritys tunnetaan. Se ei todista Zhipun ratkaisseen kaikkia laitteisto- tai ohjelmistorajoitteita. Se on kuitenkin merkittävä tuotantomittakaavan esimerkki siitä, kuinka paljon hyötyä voidaan saada mallin, päättelymoottorin ja laitteistopinon yhteissuunnittelulla.