Silicon Datas blandede prisindeks for LLM tokener falt til rekordlave 0,97 dollar per million tokener 1. Billige kinesiske API er, som DeepSeek V4 Flash til 0,14 dollar per million input tokener, har gjort rimeligere modeller attraktive for mange rutineoppgaver.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has the Chinese AI-lab price war—marked by June 2026 international API cuts of 50–99% by DeepSeek, Alibaba Cloud, ByteDance, Moonshot AI. Article summary: China’s price war appears to have reset the marginal market price of LLM inference rather than reduced demand. Aggressive low-cost Chinese APIs pulled customers toward cheaper models and altered the usage mix, helping dr. Topic tags: general, general web, user generated, education, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
Kinesiske KI-selskapers aggressive API-prising har bidratt til å endre forventningene til hva vanlig inferens med store språkmodeller (LLM-er) bør koste. Silicon Datas LLM Token Expenditure Index nådde 0,97 dollar per million tokener 1. september 2026 – rekordlavt og under halvparten av toppen tidligere på sommeren. Det betyr likevel ikke at etterspørselen etter KI har kollapset. Indeksen er et bruksvektet mål på den effektive prisen markedet betaler per million tokener, ikke et mål på alle tokener som brukes eller alle dollar som brukes på KI. 2
4
Silicon Data beskriver SDLLMTK som en referanseindeks for sammensatte priser på LLM-inferens. Den kombinerer leverandørenes priser med observert forbruk innenfor et definert utvalg modeller, og beregner dermed en effektiv markedspris per million tokener. 2
4
Det skillet er viktig. Dersom kundene legger en større del av arbeidslasten til rimeligere modeller, kan indeksen falle selv om både samlet tokenvolum og organisasjonenes samlede KI-utgifter øker. Indeksen fanger altså opp endringer i pris og arbeidslastmiks, ikke samlede markedsinntekter.
Priskrigen har gitt markedet svært rimelige alternativer til oppgaver som ikke krever den dyreste toppmodellen. DeepSeek V4-Flash var for eksempel oppført med en pris på 0,14 dollar per million input-tokener og 0,28 dollar per million output-tokener. 49
DeepSeek reduserte også prisen på V4-Pro med 75 prosent i mai 2026, et trekk som i omtalen ble beskrevet som en opptrapping av konkurransen mellom kinesiske modelltilbydere. 58 Andre priskutt og lavprisalternativer i det kinesiske økosystemet har økt presset på leverandører som konkurrerer om inferens i stort volum.
4
52
Kildene peker på en tydelig sammenheng mellom denne konkurransen og fallende sammensatte tokenpriser. De fastslår derimot ikke nøyaktig hvor stor del av fallet som skyldes ett bestemt selskap, én modell eller ett enkelt priskutt. Bedre modeleffektivitet, større kapasitet og kundenes egne valg av modellruting påvirker også indeksen.
Det tilsynelatende paradokset blir enklere med en enkel sammenheng:
samlet tokenkostnad = effektiv pris per token × tokenvolum
En lavere enhetspris gjør flere bruksområder lønnsomme. Virksomheter kan kjøre flere automatiserte arbeidsflyter, bruke lengre instrukser og kontekstvinduer, generere mer kode eller drifte flere agentbaserte systemer. Vokser tokenvolumet raskere enn den effektive prisen faller, øker den samlede pengebruken.
Dette stemmer med rapporter om at prisen per token har falt med over 90 prosent siden 2023, mens forbruket på LLM-bruk omtrent er doblet siden slutten av 2025. 41
43 Mekanismen er økt anvendelse, ikke at prisreduksjonene har mislyktes: Billigere inferens utvider listen over oppgaver det er verdt å automatisere.
Daglig KI-tokenbruk i Kina oversteg 140 billioner tokener i mars 2026, opp fra 100 billioner ved utgangen av 2025, ifølge offentlige prognoser omtalt av Reuters. 18
Tall fra bedrifter og finanssektoren peker i samme retning. China Merchants Bank opplyste at gjennomsnittlig daglig tokengjennomstrømning steg med over 78 prosent fra året før, mens separat omtale anslo bankens daglige forbruk til rundt 33 milliarder tokener ved utgangen av mai. 19
29 Det ble også rapportert om banker med langt kraftigere økning i gjennomsnittlig daglig tokenbruk.
20
Tallene må ikke leses som et direkte mål på API-inntekter, eller som bevis på at hver enkelt arbeidslast gir økonomisk gevinst. De viser imidlertid at rimeligere inferens omsettes i vesentlig høyere bruk i stor skala.
For KI-kjøpere er lavere inferenspriser positivt. For modellleverandørene blir forretningsmodellen vanskeligere: Inntekt per token kan falle, samtidig som utgiftene til brikker, datasentre, trening og modellutvikling fortsatt er store.
Det sentrale spørsmålet er dermed ikke lenger om kundene vil bruke billige tokener. Kildene tyder på at de vil det. Spørsmålet er om høyere volum, premiumtilbud og bedriftsprodukter kan gi varige inntekter og målbare produktivitetsgevinster raskt nok til å forsvare videre investeringer i infrastrukturen. Omtalen av indeksfallet har fremhevet risikoen for leverandørenes prissettingsmakt. 4
36
Én enkelt modells listepris forteller ikke hele historien. Se heller på forholdet mellom:
Hovedpoenget er enkelt: Kinesisk lavpriskonkurranse på API-er har bidratt til å gjøre LLM-inferens betydelig billigere og presset den sammensatte markedsprisen under én dollar per million tokener. Men lavere priser stimulerer mer bruk, slik at både tokenforbruket og de samlede KI-utgiftene kan fortsette å stige samtidig. 2
4
41
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Silicon Datas blandede prisindeks for LLM tokener falt til rekordlave 0,97 dollar per million tokener 1.
Silicon Datas blandede prisindeks for LLM tokener falt til rekordlave 0,97 dollar per million tokener 1. Billige kinesiske API er, som DeepSeek V4 Flash til 0,14 dollar per million input tokener, har gjort rimeligere modeller attraktive for mange rutineoppgaver.
Lavere enhetspris betyr ikke lavere totalregning: Når virksomheter setter i drift flere KI agenter, automatiserer flere prosesser og genererer mer kode, kan tokenvolumet vokse raskere enn prisen faller.