Het gemiddelde dagelijkse aantal AI tokenaanroepen in China liep in maart 2026 op tot meer dan 140 biljoen, tegenover 100 miljard begin 2024. Software optimalisatie is de snelste manier om meer nuttige output uit schaarse hardware te halen: eenvoudige verzoeken kunnen naar goedkopere binnenlandse chips, terwijl Nvid...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Chinese AI companies optimizing inference software and stretching scarce Nvidia GPU capacity as AI shifts from model training to lar. Article summary: Chinese AI companies are shifting effort from training ever-larger models to serving huge volumes of real-time requests. They are optimizing inference software—such as scheduling workloads across mixed hardware, improvin. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Een AI-model trainen is slechts het begin. Daarna moet het model voortdurend antwoorden genereren voor gebruikers: van simpele vragen tot code, bedrijfsprocessen en taken die door autonome AI-agenten worden uitgevoerd. Juist die fase — inference, oftewel het laten draaien van een getraind model — groeit uit tot een centrale beperking voor Chinese AI-bedrijven.
Dat verschil is belangrijk. Training vereist doorgaans zeer krachtige chips om een model op te bouwen. Inference kan deels op binnenlandse hardware worden uitgevoerd, maar niet elke taak leent zich daar even goed voor. Voor veeleisende toepassingen zijn niet alleen rekenkracht, maar ook geheugen, betrouwbaarheid en volwassen software nodig.
Chinese bedrijven zitten daardoor met een gemengde hardware-infrastructuur. Binnenlandse accelerators kunnen een deel van de inference verwerken, terwijl de beperkte voorraad krachtige Nvidia-processoren moet worden ingezet waar alternatieven tekortschieten. Vooral complexe programmeertaken vormen volgens berichtgeving uit de sector een knelpunt.
Een eenvoudige vraag-en-antwoordsessie vraagt relatief weinig rekenwerk. Een programmeerassistent of autonome agent is een ander verhaal. Die moet mogelijk een lange context bijhouden, code schrijven, externe hulpmiddelen aanroepen, het resultaat controleren en vervolgens meerdere keren bijsturen.
Daardoor telt niet alleen hoeveel chips een bedrijf bezit, maar vooral hoeveel betrouwbaar werk die chips kunnen leveren. Als binnenlandse processors minder goed presteren bij complexe codeer- en redeneertaken, kan een volledige overstap weg van Nvidia leiden tot lagere kwaliteit of een slechtere efficiëntie. De schaarse Nvidia-capaciteit moet dan worden gereserveerd voor taken waarbij het verschil het meest merkbaar is.
Het aantal tokens — de basiseenheden waarin taalmodellen tekst verwerken — is een nuttige maatstaf voor de vraag naar AI. Maar tokens staan niet voor identieke soorten werk.
Goedkope output voor eenvoudige gesprekken of classificatie kan op minder krachtige hardware worden geproduceerd. Hoogwaardige output uit een sterker model, met langere redeneerstappen, grotere contexten of herhaalde toolaanroepen, vereist meer rekenkracht en kan voor klanten veel waardevoller zijn.
Een stijging van het totale tokenvolume kan de echte schaarste daarom verhullen. Er kunnen in totaal meer tokens worden geproduceerd, terwijl er tegelijk een groter tekort ontstaat aan de hardware die nodig is voor betrouwbare resultaten bij complexe opdrachten. De aandacht van investeerders en bedrijven verschuift dan ook naar hoogwaardige tokenproductie en systemen die verschillende soorten rekenkracht combineren.
Het gemiddelde dagelijkse aantal tokenaanroepen in China bedroeg in maart 2026 meer dan 140 biljoen. Begin 2024 lag dat rond de 100 miljard — een groei van meer dan duizend keer, volgens cijfers die aan de Chinese National Data Administration worden toegeschreven.
Die explosie laat zien dat AI verder gaat dan experimenten en losse prompts. Modellen worden ingebouwd in assistenten, bedrijfssoftware en agenten die echte werkprocessen uitvoeren. Inference is daarmee niet langer een secundaire stap na de training, maar een belangrijke motor achter het totale computergebruik.
Meer krachtige processors aanschaffen is lastig wanneer exportcontroles de toegang tot geavanceerde Nvidia-producten beperken, de voorraad schaars is en hardware-ecosystemen duur zijn om te vervangen. Chinese ontwikkelaars lopen bovendien tegen hoge overstapkosten aan: bestaande modellen, hulpmiddelen en werkprocessen zijn sterk verbonden met gevestigde softwareplatforms.
Software kan geen nieuwe chips maken, maar wel zorgen dat elke beschikbare processor meer nuttig werk verricht. Bedrijven richten zich onder meer op:
Deze maatregelen vormen een brug tussen de snel stijgende vraag en het beperkte aanbod. Ze zijn geen volwaardige vervanging voor geavanceerde hardware, zeker niet zolang kwaliteitsgevoelige toepassingen afhankelijk blijven van een kleine groep krachtige processoren.
De schaarste is moeilijker op te lossen doordat de prijzen voor inference onder druk staan. Analisten van Jefferies schatten dat Chinese modellen gemiddeld ongeveer een zesde kosten per token van diensten van grote Amerikaanse bedrijven.
Lage prijzen kunnen het gebruik versnellen, maar beperken tegelijk de inkomsten waarmee schaarse premium-rekenkracht moet worden gefinancierd. Programmeerassistenten en AI-agenten verbruiken bovendien vaak veel meer middelen dan eenvoudige chattoepassingen.
Chinese AI-bedrijven krijgen zo te maken met een lastige combinatie: de vraag groeit snel, klanten verwachten goedkope toegang en de meest capabele inference-capaciteit kan niet eenvoudig worden uitgebreid of vervangen. Die spanning is al zichtbaar in de beschikbaarheid van diensten. Volgens berichtgeving hebben grote Chinese modelontwikkelaars en cloudproviders diensten afgeremd, toegang gerantsoeneerd of prijzen verhoogd omdat de vraag groter was dan de beschikbare rekenkracht — vooral bij intensieve programmeerassistenten.
De uitdaging voor China is dus niet simpelweg een tekort aan chips. Het gaat om een tekort aan de juiste combinatie van krachtige processoren, compatibele software en betaalbare capaciteit voor hoogwaardige inference.
Binnenlandse hardware kan een groter deel van het werk overnemen naarmate de software verbetert en toepassingen worden ontworpen rond de sterke punten van die chips. Voorlopig wijst het beschikbare bewijs echter op een overgangsstrategie: elke laag van inference optimaliseren, binnenlandse processoren gebruiken waar dat kan en schaarse Nvidia-capaciteit bewaren voor de moeilijkste opdrachten.
Dat kan de bestaande middelen langer laten meegaan. Maar als AI-agenten blijven groeien, zal China uiteindelijk zowel de hardwarevoorraad als het software-ecosysteem moeten uitbreiden dat verschillende processoren praktisch inzetbaar maakt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Het gemiddelde dagelijkse aantal AI tokenaanroepen in China liep in maart 2026 op tot meer dan 140 biljoen, tegenover 100 miljard begin 2024.
Het gemiddelde dagelijkse aantal AI tokenaanroepen in China liep in maart 2026 op tot meer dan 140 biljoen, tegenover 100 miljard begin 2024. Software optimalisatie is de snelste manier om meer nuttige output uit schaarse hardware te halen: eenvoudige verzoeken kunnen naar goedkopere binnenlandse chips, terwijl Nvidia capaciteit wordt gereserveerd voor comp...
De commerciële druk is groot: hoogwaardige inference vraagt veel rekenkracht, terwijl Chinese modellen volgens Jefferies gemiddeld ongeveer een zesde kosten van vergelijkbare Amerikaanse diensten.