L’indice SDLLMTK de Silicon Data a atteint 0,97 $ par million de tokens le 1er septembre 2026, un plus bas historique et moins de la moitié de son sommet du début de l’été. Des API chinoises à bas coût, comme DeepSeek V4 Flash à 0,14 $ par million de tokens d’entrée, ont modifié la répartition des charges de travail...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How has the Chinese AI-lab price war—marked by June 2026 international API cuts of 50–99% by DeepSeek, Alibaba Cloud, ByteDance, Moonshot AI. Article summary: China’s price war appears to have reset the marginal market price of LLM inference rather than reduced demand. Aggressive low-cost Chinese APIs pulled customers toward cheaper models and altered the usage mix, helping dr. Topic tags: general, general web, user generated, education, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
Le prix effectif des tokens utilisés par les grands modèles de langage est passé sous le seuil symbolique de 1 $. Le 1er septembre 2026, le LLM Token Expenditure Index de Silicon Data (SDLLMTK) s’est établi à 0,97 $ par million de tokens, un record bas et moins de la moitié de son point haut du début de l’été. 2
4
Ce mouvement ne signifie pas que la demande d’IA s’est effondrée. L’indice mesure le prix effectif, pondéré par les usages, payé pour un million de tokens ; il ne mesure ni le nombre total de tokens consommés ni l’ensemble des dépenses consacrées à l’IA. 2
4
Silicon Data présente le SDLLMTK comme un indicateur du prix agrégé de l’inférence des grands modèles de langage. Il combine les tarifs des fournisseurs et les usages observés sur un univers défini de modèles afin d’obtenir un prix effectif par million de tokens. 2
4
La nuance est essentielle : si les entreprises confient une part plus importante de leurs tâches à des modèles moins chers, l’indice baisse, même lorsque le volume total de tokens — et potentiellement les dépenses globales d’IA — augmente. L’indicateur reflète donc à la fois un prix et une composition des charges de travail, et non le chiffre d’affaires total du marché.
La compétition entre laboratoires et fournisseurs d’API chinois a mis sur le marché des options très bon marché pour les usages ne nécessitant pas les modèles les plus avancés. DeepSeek V4-Flash était ainsi affiché à 0,14 $ par million de tokens d’entrée et 0,28 $ par million de tokens de sortie. 49
DeepSeek a également réduit de 75 % les tarifs de V4-Pro en mai 2026, une décision décrite comme une intensification de la concurrence entre fournisseurs chinois de modèles. 58 D’autres baisses tarifaires et offres à bas coût dans l’écosystème chinois ont renforcé la pression sur les acteurs qui se disputent les charges d’inférence à très grand volume.
4
52
Les éléments disponibles établissent une forte association entre cet environnement concurrentiel et la baisse du prix moyen pondéré des tokens. En revanche, ils ne permettent pas d’attribuer une part causale précise à un laboratoire, à un modèle ou à une réduction tarifaire donnée. Les gains d’efficacité des modèles, l’extension des capacités de calcul et les choix de routage des clients jouent aussi sur l’indice.
L’apparente contradiction disparaît avec une relation simple :
dépense totale en tokens = prix effectif par token × volume de tokens
La baisse du prix unitaire rend rentables de nouveaux cas d’usage : automatisation de processus, contextes plus longs, génération accrue de code ou déploiement de systèmes d’agents. Si le volume de tokens augmente plus vite que le prix effectif ne diminue, la dépense totale progresse.
Ce schéma concorde avec les estimations selon lesquelles le prix par token aurait chuté de plus de 90 % depuis 2023, tandis que les dépenses liées à l’usage des grands modèles de langage auraient approximativement doublé depuis la fin de 2025. 41
43 La baisse de prix n’échoue donc pas à réduire les coûts unitaires : elle élargit surtout le nombre de tâches pour lesquelles l’automatisation devient économiquement intéressante.
Selon des projections gouvernementales citées par Reuters, la consommation quotidienne de tokens IA en Chine a dépassé 140 000 milliards en mars 2026, contre 100 000 milliards à la fin de 2025. 18
Les informations publiées par des entreprises, notamment dans le secteur financier, vont dans le même sens. China Merchants Bank a indiqué que son débit quotidien moyen de tokens avait augmenté de plus de 78 % sur un an. D’autres informations situent sa consommation autour de 33 milliards de tokens par jour à la fin mai. 19
29 Certaines banques chinoises auraient connu des progressions bien plus fortes de leur consommation quotidienne moyenne.
20
Ces chiffres ne constituent ni une mesure directe des revenus des API ni une preuve que chaque charge de travail produit un rendement économique. Ils montrent néanmoins que l’inférence à bas coût se traduit par une hausse massive des usages.
Pour les acheteurs, la chute des prix d’inférence est une bonne nouvelle. Pour les fournisseurs de modèles, l’équation devient plus délicate : le revenu par token peut baisser alors que les dépenses en puces, centres de données, entraînement et développement de modèles restent élevées.
La question centrale n’est donc plus de savoir si les clients consommeront des tokens bon marché : les données suggèrent que oui. Elle est de déterminer si l’augmentation des volumes, les offres haut de gamme et les produits destinés aux entreprises généreront assez vite des revenus durables et des gains de productivité mesurables pour justifier la poursuite des investissements dans les infrastructures. Le recul de l’indice met directement sous pression le pouvoir de fixation des prix des fournisseurs. 4
36
Au-delà du tarif affiché d’un modèle, quatre éléments sont particulièrement utiles :
À retenir : la concurrence des API chinoises à bas coût a contribué à faire tomber sous 1 $ le prix moyen effectif de l’inférence par million de tokens. Mais cette baisse encourage de nouveaux usages ; la consommation de tokens et les dépenses agrégées en IA peuvent donc continuer d’augmenter en même temps. 2
4
41
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
L’indice SDLLMTK de Silicon Data a atteint 0,97 $ par million de tokens le 1er septembre 2026, un plus bas historique et moins de la moitié de son sommet du début de l’été.
L’indice SDLLMTK de Silicon Data a atteint 0,97 $ par million de tokens le 1er septembre 2026, un plus bas historique et moins de la moitié de son sommet du début de l’été. Des API chinoises à bas coût, comme DeepSeek V4 Flash à 0,14 $ par million de tokens d’entrée, ont modifié la répartition des charges de travail vers des modèles moins chers.
Un token moins cher ne réduit pas nécessairement la facture totale : davantage d’agents, d’automatisations et de générations de code peuvent faire progresser les volumes plus vite que les prix ne baissent.