Kinas gjennomsnittlige daglige bruk av AI tokens passerte 140 billioner i mars 2026, opp fra rundt 100 milliarder tidlig i 2024. Programvareoptimalisering er den raskeste måten å få mer nyttig arbeid ut av knapp maskinvare: enklere forespørsler kan sendes til rimeligere eller kinesiske brikker, mens Nvidia kapasitet...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Chinese AI companies optimizing inference software and stretching scarce Nvidia GPU capacity as AI shifts from model training to lar. Article summary: Chinese AI companies are shifting effort from training ever-larger models to serving huge volumes of real-time requests. They are optimizing inference software—such as scheduling workloads across mixed hardware, improvin. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Kinas AI-flaskehals oppstår i økende grad etter at modellene er ferdig trent. Når forbruker- og bedriftsløsninger tas i bruk i stor skala, må selskapene håndtere enorme mengder forespørsler – mange fra AI-agenter som resonerer, bruker verktøy og løser oppgaver i flere trinn. Dermed blir kapasiteten til å kjøre modeller og levere svar, ikke bare kapasiteten til å trene dem, en sentral begrensning.
Trening bygger selve modellen. Inferens er den senere fasen, der modellen bruker det den har lært til å lage svar for brukerne. Enkelte inferensoppgaver kan tilpasses kinesisk maskinvare, men skillet er ikke absolutt: De mest krevende løsningene trenger en kombinasjon av ytelse, minne, stabilitet og moden programvare som er vanskelig å erstatte.
Kinesiske AI-selskaper står derfor overfor en infrastruktur med flere typer brikker. Innenlandske akseleratorer kan håndtere deler av inferensen, mens en begrenset beholdning av avanserte Nvidia-prosessorer må reserveres til oppgaver som vanskelig lar seg flytte. Bransjerapporter peker særlig på krevende kodeoppgaver som et presspunkt.
Et enkelt spørsmål og svar kan kreve forholdsvis lite datakraft. En kodeassistent eller autonom agent kan være langt mer krevende. Den må kanskje holde styr på en lang kontekst, skrive kode, bruke eksterne verktøy, kontrollere resultatet og revidere svaret flere ganger.
Det endrer regnestykket for utrulling. Det avgjørende er ikke bare hvor mange brikker et selskap eier, men hvor mye pålitelig arbeid de faktisk kan utføre. Hvis kinesiske prosessorer fungerer dårligere på kompliserte kode- og resonneringsoppgaver, kan en full overgang bort fra Nvidia redusere kvaliteten eller effektiviteten. Den knappe Nvidia-kapasiteten må da brukes på jobbene der forskjellen betyr mest.
Antallet tokens – de grunnleggende tekstenhetene som språkmodeller behandler – er en nyttig indikator på etterspørsel. Men tokens beskriver ikke nødvendigvis like arbeidsmengder.
Enkle og rimelige svar kan sendes til billigere maskinvare. Svar fra en sterkere modell, med lengre resonnering eller gjentatte verktøykall, krever mer datakraft og kan være mer verdifulle for kunden.
Derfor kan en vekst i det totale tokenforbruket skjule en enda skarpere mangel på avansert inferens. Markedet kan produsere flere tokens totalt, samtidig som det blir stadig vanskeligere å levere pålitelige resultater i komplekse oppgaver. Investeringer i kapasitet for såkalte høykvalitetstokens og i systemer som kombinerer ulike typer datakraft, gjenspeiler dette skillet.
Kinas gjennomsnittlige daglige bruk av AI-tokens oversteg 140 billioner i mars 2026, sammenlignet med rundt 100 milliarder tidlig i 2024. Det tilsvarer en vekst på mer enn 1 000 ganger, ifølge tall gjengitt fra Kinas nasjonale dataadministrasjon.
Utviklingen viser at AI er på vei fra utprøving og enkeltstående spørsmål til assistenter, bedriftsprogramvare og agenter som utfører praktiske arbeidsflyter. Inferens blir dermed en viktig drivkraft for datakraftforbruket, og ikke bare et sekundært trinn etter modelltreningen.
Det er vanskelig å skaffe flere avanserte prosessorer når eksportkontroller begrenser tilgangen til de mest avanserte Nvidia-produktene, forsyningen er knapp og det er kostbart å bytte maskinvareøkosystem. Kinesiske utviklere møter også betydelige overgangskostnader fordi eksisterende modeller, verktøy og arbeidsprosesser er tett knyttet til etablerte programvareplattformer.
Programvareoptimalisering kan ikke lage nye brikker, men den kan øke mengden nyttig arbeid som hentes ut fra hver tilgjengelige prosessor. De viktigste grepene er:
Tiltakene fungerer som en bro mellom økende etterspørsel og begrenset tilgang. De er likevel ingen fullgod erstatning for den mest avanserte maskinvaren, særlig når kvalitetsfølsomme oppgaver fortsatt er avhengige av et smalere utvalg prosessorer.
Situasjonen blir vanskeligere fordi prisene på inferens er under press. Analytikere i Jefferies anslo at kinesiske modeller i gjennomsnitt kostet rundt en sjettedel så mye per token som tilbudene fra store amerikanske selskaper.
Lave priser kan få flere til å ta i bruk AI, men de begrenser også inntektene som kan finansiere den knappe premiumkapasiteten. Samtidig bruker kodeassistenter og agentbaserte produkter mer ressurser enn enkel chat.
Kinesiske AI-selskaper må dermed håndtere en vanskelig kombinasjon: Etterspørselen vokser raskt, kundene forventer lave priser, og den mest kapable inferenskapasiteten er vanskelig å utvide eller erstatte.
Presset har allerede vist seg i tilgjengeligheten. En markedsrapport beskrev hvordan store kinesiske modellutviklere og skyleverandører har redusert hastigheten på tjenestene, begrenset tilgangen eller økt prisene når etterspørselen har overgått den tilgjengelige datakraften – særlig for ressurskrevende kodeassistenter.
Kinas utfordring er ikke bare at landet mangler brikker. Det mangler den riktige kombinasjonen av avanserte prosessorer, kompatibel programvare og økonomisk bærekraftig kapasitet for verdifull inferens.
Innenlandsk maskinvare kan ta over en større del av arbeidsmengden etter hvert som programvaren forbedres og systemene utformes rundt brikkenes styrker. Dagens utvikling peker likevel mot en overgangsstrategi: Optimaliser hvert lag av inferensen, bruk kinesiske brikker der de fungerer godt, og spar den knappe Nvidia-kapasiteten til de vanskeligste oppgavene.
Det kan forlenge levetiden til ressursene som allerede finnes. Men hvis agentbasert AI skal fortsette å vokse, må Kina til slutt utvide både tilgangen på maskinvare og programvareøkosystemet som gjør ulike prosessorer praktiske å bruke.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kinas gjennomsnittlige daglige bruk av AI tokens passerte 140 billioner i mars 2026, opp fra rundt 100 milliarder tidlig i 2024.
Kinas gjennomsnittlige daglige bruk av AI tokens passerte 140 billioner i mars 2026, opp fra rundt 100 milliarder tidlig i 2024. Programvareoptimalisering er den raskeste måten å få mer nyttig arbeid ut av knapp maskinvare: enklere forespørsler kan sendes til rimeligere eller kinesiske brikker, mens Nvidia kapasitet reserveres til krevende oppg...
Problemet forsterkes av lave priser på kinesiske AI tjenester, samtidig som avansert inferens for kodeassistenter og AI agenter krever betydelig mer datakraft.