Token-määrät ovat hyödyllinen tapa mitata kysyntää, mutta ne eivät kuvaa keskenään samanlaisia työkuormia. Yksinkertaista ja edullista tekstiä voidaan tuottaa halvemmalla laitteistolla. Sen sijaan vahvemman mallin tuottama vastaus, pitkä päättelyketju tai toistuvat työkalukutsut vaativat enemmän laskentaa – ja voivat olla asiakkaalle arvokkaampia.
Siksi tokenien kokonaismäärän kasvu voi peittää alleen vielä jyrkemmän pulan laadukkaasta inferenssistä. Tokeneita voidaan tuottaa enemmän kuin koskaan, mutta samalla voi olla pulaa juuri siitä laitteistosta, jolla monimutkaisiin tehtäviin saadaan luotettavia vastauksia.
Investoinnit laadukkaiden tokenien tuotantokapasiteettiin ja järjestelmiin, jotka yhdistävät erilaisia laskentaresursseja, heijastavat tätä eroa.
Kiinan tekoälymallien päivittäisten token-kutsujen keskimääräinen määrä ylitti 140 biljoonaa maaliskuussa 2026. Vuoden 2024 alussa määrä oli noin 100 miljardia, mikä tarkoittaa yli tuhatkertaista kasvua Kiinan kansallisen datahallinnon luvuista raportoineiden lähteiden mukaan.
Luku kertoo tekoälyn käyttötavan muuttumisesta. Mallit eivät ole enää vain kokeilujen ja yksittäisten kehotteiden välineitä, vaan niitä käytetään avustajissa, yritysohjelmistoissa ja agenteissa, jotka suorittavat todellisia työprosesseja.
Inferenssistä on näin tulossa merkittävä laskennankulutuksen ajuri – ei enää pelkkä koulutuksen jälkeinen sivuvaihe.
Huippuluokan prosessoreiden hankkiminen on vaikeaa, kun kehittyneiden Nvidia-tuotteiden saatavuutta rajoittavat vientivalvonta ja niukka tarjonta. Lisäksi laitteistoekosysteemin vaihtaminen on kallista: olemassa olevat mallit, työkalut ja työnkulut ovat syvästi sidoksissa vakiintuneisiin ohjelmistoalustoihin.
Ohjelmisto-optimointi ei luo uusia siruja, mutta se voi kasvattaa jokaisesta käytettävissä olevasta prosessorista saatavaa hyödyllistä työmäärää. Käytännössä yritykset voivat:
Nämä keinot toimivat siltana kasvavan kysynnän ja rajallisen tarjonnan välillä. Ne eivät kuitenkaan korvaa täysin edistyneintä laitteistoa, etenkin kun laatukriittiset tehtävät ovat edelleen riippuvaisia kapeasta prosessorijoukosta.
Pulaa on vaikeampi ratkaista, koska inferenssin hinnat ovat samaan aikaan paineessa. Jefferiesin analyytikot arvioivat, että kiinalaiset mallit maksavat keskimäärin noin kuudesosan yhdysvaltalaisten suurten yhtiöiden tarjonnan token-hinnasta.
Halvat hinnat voivat vauhdittaa käyttöönottoa, mutta ne myös rajoittavat tuloja, joilla niukkaa huippulaskentaa voidaan rahoittaa. Koodausavustajat ja tekoälyagentit voivat lisäksi kuluttaa huomattavasti enemmän resursseja kuin yksinkertainen keskustelubotti.
Kiinan tekoälyyhtiöt joutuvat siten hankalaan yhtälöön: kysyntä kasvaa nopeasti, asiakkaat odottavat edullista käyttöä ja tehokkainta inferenssikapasiteettia on vaikea kasvattaa tai korvata.
Jännite on näkynyt jo palveluiden saatavuudessa. Markkinaa käsitelleen raportin mukaan suuret kiinalaiset mallikehittäjät ja pilvipalveluntarjoajat ovat rajoittaneet palveluita, säännöstelleet käyttöoikeuksia tai nostaneet hintoja, kun kysyntä on ylittänyt käytettävissä olevan laskentakapasiteetin. Erityisen kova paine kohdistuu paljon resursseja vaativiin koodausavustajiin.
Kiinan tekoälyinfrastruktuurin haaste ei ole yksinkertaisesti sirujen puute. Kyse on oikean yhdistelmän puutteesta: tarvitaan edistyneitä prosessoreita, niiden kanssa yhteensopivaa ohjelmistoa ja taloudellisesti kestävää kapasiteettia arvokkaaseen inferenssiin.
Kotimainen laitteisto voi ottaa suuremman osan työkuormasta, kun ohjelmistot kehittyvät ja palvelut suunnitellaan sirujen vahvuuksien ympärille. Tämänhetkinen kehitys viittaa kuitenkin siirtymävaiheen strategiaan: jokainen inferenssikerros optimoidaan, kotimaisia siruja käytetään siellä missä ne ovat tehokkaita ja niukka Nvidia-kapasiteetti säästetään vaikeimpiin tehtäviin.
Tällä voidaan venyttää nykyisiä resursseja, mutta agenttipohjaisen tekoälyn jatkuva kasvu riippuu lopulta siitä, pystyykö Kiina laajentamaan sekä laitteistotarjontaansa että ohjelmistoekosysteemiään. Vasta silloin erilaiset prosessorit voidaan valjastaa käytännössä toimivaksi kokonaisuudeksi.