Cena za používání velkých jazykových modelů (LLM) klesá na nové minimum. Index LLM Token Expenditure Index od Silicon Data dosáhl 1. září 2026 hodnoty 0,97 USD za milion tokenů. Jde o rekordní minimum a o méně než polovinu dřívějšího letního maxima. Neznamená to však, že by poptávka po AI slábla: ukazatel měří efektivní cenu zaplacenou za milion tokenů, váženou podle skutečného využití, nikoli celkový počet spotřebovaných tokenů ani všechny výdaje na AI.
2
4
Co hodnota 97 centů skutečně vyjadřuje
Silicon Data popisuje SDLLMTK jako ukazatel kombinované ceny inference LLM — tedy provozu modelu při zpracování dotazu a generování odpovědi. Propojuje ceníky poskytovatelů s pozorovaným využitím modelů v definovaném souboru a výsledkem je efektivní tržní cena za milion tokenů.
2
4
To je podstatný rozdíl. Pokud firmy přesunou větší podíl úloh na levnější modely, index může klesat i ve chvíli, kdy celkový objem tokenů i celkové firemní výdaje na AI rostou. Ukazatel zachycuje proměnu ceny a skladby používaných modelů, ne souhrnné tržby celého odvětví.
Jak čínská konkurence změnila cenový mix
Cenová válka přinesla mimořádně levné alternativy pro úlohy, které nepotřebují nejdražší špičkové modely. Model DeepSeek V4-Flash například uváděl cenu 0,14 USD za milion vstupních tokenů a 0,28 USD za milion výstupních tokenů.
49
DeepSeek v květnu 2026 snížil cenu V4-Pro o 75 %, což tehdejší zpravodajství označilo za další vyhrocení soutěže mezi čínskými poskytovateli modelů.
58 Další zlevňování a levné nabídky v čínském ekosystému zvýšily tlak na firmy, které soupeří o inference ve velkém objemu.
4
52
Dostupné podklady ukazují silnou souvislost mezi tímto konkurenčním prostředím a poklesem kombinovaných cen tokenů. Neumožňují ale přesně vyčíslit, jakou část změny způsobil konkrétní poskytovatel, model nebo jedno oznámené zlevnění. Index ovlivňuje také vyšší efektivita modelů, rozšiřování výpočetní kapacity i to, jak zákazníci mezi modely rozdělují své úlohy.
Proč mohou s levnějšími tokeny růst výdaje na AI
Zdánlivý rozpor vysvětluje jednoduchý vztah:
celkové výdaje za tokeny = efektivní cena za token × objem tokenů
Nižší jednotková cena zlevňuje dříve neekonomické scénáře. Firmy mohou provozovat více automatizovaných procesů, používat delší prompty a kontexty, generovat více kódu nebo nasazovat více agentních systémů. Roste-li objem tokenů rychleji, než klesá efektivní cena, celkové výdaje se zvýší.
Tomu odpovídají zprávy, podle nichž cena tokenu od roku 2023 klesla o více než 90 %, zatímco výdaje na používání LLM se od konce roku 2025 zhruba zdvojnásobily.
41
43 Příčinou není neúspěch zlevňování, ale širší využití: levnější inference rozšiřuje okruh úloh, u nichž se automatizace vyplatí.
Čínská spotřeba tokenů ukazuje rozsah poptávky
Denní spotřeba AI tokenů v Číně podle vládních projekcí citovaných agenturou Reuters překročila v březnu 2026 140 bilionů. Na konci roku 2025 to bylo 100 bilionů.
18
Stejným směrem ukazují i údaje podniků a finančního sektoru. China Merchants Bank uvedla, že její průměrný denní průtok tokenů meziročně vzrostl o více než 78 %. Jiné zpravodajství uvádělo, že banka ke konci května spotřebovávala přibližně 33 miliard tokenů denně.
19
29 U některých čínských bank byl hlášen ještě výraznější růst průměrné denní spotřeby.
20
Tato čísla nejsou přímým ukazatelem příjmů z API ani důkazem, že je každá taková úloha ekonomicky přínosná. Ukazují ale, že levnější inference se ve velkém měřítku mění ve výrazně vyšší využití.
Tlak na poskytovatele modelů
Pro zákazníky jsou klesající náklady na inferenci výhodné. Pro dodavatele modelů znamenají složitější ekonomiku: výnos na jeden token může klesat, zatímco výdaje na čipy, datová centra, trénování a vývoj modelů zůstávají vysoké.
Klíčová otázka proto už nezní, zda budou zákazníci levné tokeny spotřebovávat. Dosavadní data naznačují, že ano. Důležitější je, zda vyšší objemy, prémiové modely a podnikové produkty dokážou dostatečně rychle vytvořit stabilní příjmy a měřitelné přínosy produktivity, které ospravedlní pokračující investice do infrastruktury. Zprávy o propadu indexu upozorňují právě na riziko oslabení cenové síly poskytovatelů.
4
36
Co sledovat dál
Nejdůležitější není ceníková cena jediného modelu, ale vztah mezi několika ukazateli:
- Kombinované efektivní ceny tokenů, například SDLLMTK — ukazují, kam zákazníci skutečně směrují úlohy.
2
- Objem tokenů — napovídá, zda nižší ceny rozšiřují poptávku.
- Tržby a marže — ukazují, zda poskytovatelé umějí rostoucí využití přetavit v udržitelný výnos.
- Kvalita a přínos úloh — vysoká spotřeba tokenů sama o sobě nedokládá obchodní hodnotu.
Hlavní závěr je jednoduchý: levná čínská API a ostrá konkurence pomohly stlačit kombinovanou cenu inference LLM pod 1 USD za milion tokenů. Nižší ceny ale podporují širší nasazování AI, takže spotřeba tokenů i souhrnné výdaje na AI mohou růst současně.
2
4
41