De LLM Token Expenditure Index van Silicon Data kwam op 1 september 2026 uit op een recordlage $0,97 per miljoen tokens, minder dan de helft van de piek eerder deze zomer. Lage tarieven van Chinese aanbieders, zoals $0,14 per miljoen inputtokens voor DeepSeek V4 Flash, maken veel AI taken aanzienlijk goedkoper.
Research answer

Create a landscape editorial hero image for this Studio Global article: How has the Chinese AI-lab price war—marked by June 2026 international API cuts of 50–99% by DeepSeek, Alibaba Cloud, ByteDance, Moonshot AI. Article summary: China’s price war appears to have reset the marginal market price of LLM inference rather than reduced demand. Aggressive low-cost Chinese APIs pulled customers toward cheaper models and altered the usage mix, helping dr. Topic tags: general, general web, user generated, education, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
De felle prijsconcurrentie tussen Chinese AI-labs heeft de verwachtingen over de kosten van taalmodellen flink bijgesteld. De LLM Token Expenditure Index van Silicon Data kwam op 1 september 2026 uit op $0,97 per miljoen tokens: een recordlaag niveau en minder dan de helft van de piek eerder in de zomer. Dat betekent niet dat de vraag naar AI instort. De index meet de feitelijk betaalde, naar gebruik gewogen prijs per miljoen tokens — niet het totale aantal verwerkte tokens of alle AI-uitgaven samen. 2
4
Silicon Data presenteert SDLLMTK als een maatstaf voor de gemengde prijs van LLM-inferentie: het uitvoeren van een taalmodel nadat het is getraind. De index combineert tarieven van aanbieders met waargenomen gebruik binnen een afgebakende groep modellen. Zo ontstaat een effectieve marktprijs per miljoen tokens. 2
4
Dat onderscheid is essentieel. Als bedrijven een groter deel van hun taken laten afhandelen door goedkopere modellen, kan de index dalen terwijl zowel het tokenvolume als de totale AI-rekening stijgt. De indicator laat dus vooral zien hoe prijsniveau en gebruiksmix verschuiven, niet hoeveel omzet de hele AI-markt draait.
De prijsstrijd heeft zeer goedkope alternatieven opgeleverd voor taken waarvoor het duurste grensverleggende model niet nodig is. DeepSeek V4-Flash stond bijvoorbeeld genoteerd op $0,14 per miljoen inputtokens en $0,28 per miljoen outputtokens. 49
DeepSeek verlaagde in mei 2026 bovendien de prijs van V4-Pro met 75%, een stap die in berichtgeving werd gezien als een verdere escalatie van de concurrentie tussen Chinese modelaanbieders. 58 Ook andere prijsverlagingen en goedkope aanbiedingen in het Chinese AI-ecosysteem zetten aanbieders onder druk die concurreren om inferentie op grote schaal.
4
52
De beschikbare gegevens wijzen op een sterke samenhang tussen die concurrentiedruk en de dalende gemengde tokenprijs. Ze maken het echter niet mogelijk om precies vast te stellen welk aandeel van de daling aan één lab, model of aangekondigde prijsverlaging is toe te schrijven. Efficiëntere modellen, meer rekencapaciteit en de routeringskeuzes van klanten spelen eveneens mee.
De ogenschijnlijke tegenstelling verdwijnt met een simpele formule:
totale tokenuitgaven = effectieve prijs per token × tokenvolume
Een lagere stuksprijs maakt nieuwe toepassingen rendabel. Bedrijven kunnen meer processen automatiseren, langere prompts en contextvensters gebruiken, meer code laten genereren of meer AI-agents inzetten. Als het tokenvolume sneller groeit dan de effectieve prijs daalt, nemen de totale uitgaven toe.
Dat patroon past bij berichten dat de prijs per token sinds 2023 met meer dan 90% is gedaald, terwijl de uitgaven aan gebruik van grote taalmodellen sinds eind 2025 ongeveer zijn verdubbeld. 41
43 De verklaring is niet dat de prijsverlagingen falen, maar juist dat zij AI voor veel meer taken economisch aantrekkelijk maken.
Volgens door Reuters aangehaalde overheidsprognoses lag het dagelijkse AI-tokenverbruik in China in maart 2026 boven 140 biljoen tokens, tegenover 100 biljoen eind 2025. 18
Ook bedrijfsrapportages uit de financiële sector wijzen op snel groeiend gebruik. China Merchants Bank meldde dat de gemiddelde dagelijkse tokenverwerking op jaarbasis met meer dan 78% was gestegen. Afzonderlijke berichtgeving schatte het dagelijkse verbruik van de bank eind mei op circa 33 miljard tokens. 19
29 Sommige Chinese banken zouden nog veel grotere stijgingen in gemiddeld dagelijks tokengebruik hebben gemeld.
20
Deze cijfers zijn geen directe maat voor API-omzet en bewijzen evenmin dat elke AI-taak economisch waardevol is. Ze tonen wel dat goedkoper gebruik van modellen op grote schaal wordt omgezet in veel hogere volumes.
Voor afnemers zijn dalende inferentiekosten gunstig. Voor aanbieders van modellen wordt het verdienmodel lastiger: de omzet per token kan dalen, terwijl de kosten voor chips, datacenters, training en modelontwikkeling hoog blijven.
De belangrijkste vraag is daarom niet meer of klanten goedkope tokens zullen verbruiken — de cijfers suggereren van wel. De vraag is of hogere volumes, premium-modellen en zakelijke producten snel genoeg duurzame omzet en aantoonbare productiviteitswinst kunnen opleveren om de aanhoudende infrastructuurinvesteringen te rechtvaardigen. Berichtgeving over de dalende index wijst op precies dat risico voor de prijszettingsmacht van aanbieders. 4
36
Niet de catalogusprijs van één model, maar de combinatie van vier maatstaven is het meest informatief:
De kern is helder: goedkope Chinese API’s hebben LLM-inferentie veel goedkoper gemaakt en de gemengde marktprijs onder $1 per miljoen tokens gedrukt. Maar omdat die lagere prijs meer gebruik uitlokt, kunnen tokenverbruik en totale AI-uitgaven tegelijkertijd blijven stijgen. 2
4
41
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
De LLM Token Expenditure Index van Silicon Data kwam op 1 september 2026 uit op een recordlage $0,97 per miljoen tokens, minder dan de helft van de piek eerder deze zomer.
De LLM Token Expenditure Index van Silicon Data kwam op 1 september 2026 uit op een recordlage $0,97 per miljoen tokens, minder dan de helft van de piek eerder deze zomer. Lage tarieven van Chinese aanbieders, zoals $0,14 per miljoen inputtokens voor DeepSeek V4 Flash, maken veel AI taken aanzienlijk goedkoper.
De totale AI uitgaven kunnen toch groeien: organisaties draaien meer agents, automatiseren meer processen en verwerken veel grotere tokenvolumes.