Průměrný denní objem tokenových volání v Číně přesáhl v březnu 2026 140 bilionů, oproti 100 miliardám na začátku roku 2024. Optimalizace softwaru je nejrychlejší způsob, jak z omezeného hardwaru získat více užitečného výkonu: jednodušší požadavky lze směrovat na levnější nebo domácí čipy, zatímco Nvidia GPU zůstávaj...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Chinese AI companies optimizing inference software and stretching scarce Nvidia GPU capacity as AI shifts from model training to lar. Article summary: Chinese AI companies are shifting effort from training ever-larger models to serving huge volumes of real-time requests. They are optimizing inference software—such as scheduling workloads across mixed hardware, improvin. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Čínský problém s výpočetní kapacitou pro umělou inteligenci se stále méně týká samotného trénování modelů. Kritické úzké hrdlo se přesouvá do fáze, kdy už model slouží uživatelům a musí odpovídat na obrovské množství požadavků.
Zvláštní tlak přitom vytvářejí AI agenti: systémy, které nejen odpovídají, ale také uvažují v několika krocích, volají externí nástroje, kontrolují výsledky a úkoly opakují. Pro čínské firmy to znamená, že nestačí mít dostatek čipů obecně. Potřebují správnou kombinaci výkonu, paměti, spolehlivosti a softwarové podpory.
Trénování vytvoří model. Inference, česky provoz či odvozování, je pozdější fáze, v níž natrénovaný model generuje odpovědi pro uživatele.
Část inferenčních úloh lze přizpůsobit domácím akcelerátorům. Toto řešení ale není univerzální. Náročné aplikace stále vyžadují hardware a software, které se jen obtížně nahrazují. Čínské firmy proto pracují s heterogenní infrastrukturou: jednodušší úlohy mohou běžet na domácích čipech, zatímco omezené zásoby výkonných procesorů Nvidia se rezervují pro práci, u níž je rozdíl ve výkonu nejvýraznější. Podle průmyslových zdrojů představují zvláštní problém komplexní programovací úlohy.
Běžný dotaz a odpověď mohou vyžadovat relativně málo výpočtů. Programovací asistent nebo autonomní agent je mnohem náročnější. Musí udržovat dlouhý kontext, napsat kód, použít externí nástroje, prozkoumat výsledek a následně jej několikrát opravit.
Ekonomika provozu se tím mění. Nejde jen o počet čipů, které firma vlastní, ale o to, kolik spolehlivé a kvalitní práce na nich dokáže dokončit. Pokud domácí procesory podávají u složitých programovacích a reasoningových úloh slabší výkon, úplný přesun inferenční zátěže mimo Nvidia hardware může zhoršit kvalitu nebo efektivitu. Nejvzácnější GPU proto musí zamířit k úlohám, u nichž na jejich výkonu nejvíce záleží.
Počet tokenů — základních jednotek textu zpracovávaných jazykovým modelem — je užitečným ukazatelem poptávky. Ne všechny tokeny ale představují stejnou práci.
Jednoduchý a levný výstup lze směrovat na méně výkonný hardware. Kvalitní odpověď ze silnějšího modelu, delšího řetězce uvažování nebo opakovaných volání nástrojů vyžaduje více výpočtů a pro zákazníka může mít vyšší hodnotu.
Růst celkového počtu tokenů proto může skutečný nedostatek prémiové inferenční kapacity podhodnocovat. Na trhu může vznikat více tokenů celkem, a přesto může výrazněji chybět hardware potřebný k tvorbě spolehlivých výsledků u složitých úkolů. Na tento rozdíl upozorňují i investice do produkce kvalitních tokenů a do systémů, které kombinují různé typy výpočetních zdrojů.
Průměrný denní objem tokenových volání v Číně přesáhl v březnu 2026 140 bilionů. Na začátku roku 2024 přitom činil přibližně 100 miliard — podle údajů čínské Národní správy dat jde o více než tisícinásobný růst.
Čísla ukazují změnu ve způsobu využívání AI. Modely se přesouvají od experimentů a jednotlivých promptů k asistentům, podnikovému softwaru a agentům, kteří vykonávají reálné pracovní postupy. Inference se tak stává jedním z hlavních zdrojů spotřeby výpočetního výkonu, nikoli jen vedlejší fází po trénování modelu.
Získat další špičkové procesory je obtížné. Přístup k pokročilým produktům Nvidia omezují exportní pravidla, nabídka je omezená a nahrazení celého hardwarového ekosystému je nákladné. Čínští vývojáři navíc používají modely, nástroje a pracovní postupy hluboce navázané na zavedené softwarové platformy. Přechod na jinou architekturu proto znamená značné technické a finanční náklady.
Optimalizace softwaru sice nevytvoří nový křemík, může však zvýšit množství užitečné práce získané z každého dostupného procesoru. V praxi jde zejména o tyto postupy:
Tato opatření představují most mezi rostoucí poptávkou a omezenou nabídkou. Nejsou však úplnou náhradou špičkového hardwaru, zejména u úloh, kde zákazníci citlivě vnímají kvalitu a spolehlivost.
Nedostatek se řeší o to hůře, že ceny inferenčních služeb jsou pod tlakem. Analytici Jefferies odhadli, že čínské modely stojí v průměru přibližně šestinu ceny za token ve srovnání s nabídkami velkých amerických společností.
Nízké ceny mohou urychlit adopci, zároveň ale omezují příjmy, z nichž lze financovat vzácnou prémiovou výpočetní kapacitu. Programovací asistenti a agentní produkty přitom mohou spotřebovávat výrazně více zdrojů než jednoduchý chat.
Čínské AI firmy tak čelí nepříjemné kombinaci: poptávka rychle roste, zákazníci očekávají levný přístup a nejvýkonnější inferenční kapacitu nelze snadno rozšířit ani nahradit.
Napětí se už projevilo v dostupnosti služeb. Podle zprávy z trhu někteří velcí čínští vývojáři modelů a poskytovatelé cloudových služeb omezovali výkon, přidělovali přístup na příděl nebo zvyšovali ceny, protože poptávka převýšila dostupné výpočetní zdroje. Největší potíže se týkaly právě náročných programovacích asistentů.
Čínský problém s AI infrastrukturou není jen nedostatkem čipů. Jde o nedostatek konkrétní kombinace pokročilých procesorů, kompatibilního softwaru a ekonomicky udržitelné kapacity pro hodnotnou inferenci.
Domácí hardware může postupně převzít větší část zátěže, pokud se zlepší software a nasazení se přizpůsobí jeho silným stránkám. Současná strategie však vypadá přechodně: optimalizovat každou vrstvu provozu modelů, využívat domácí čipy tam, kde jsou dostatečné, a šetřit omezené kapacity Nvidia pro nejtěžší úkoly.
To může prodloužit životnost stávajících zdrojů, samo o sobě to ale nestačí. Trvalý růst agentní AI bude záviset na tom, zda Čína dokáže rozšířit nejen dodávky hardwaru, ale také softwarový ekosystém, díky němuž bude možné prakticky a levně kombinovat různé procesory.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Průměrný denní objem tokenových volání v Číně přesáhl v březnu 2026 140 bilionů, oproti 100 miliardám na začátku roku 2024.
Průměrný denní objem tokenových volání v Číně přesáhl v březnu 2026 140 bilionů, oproti 100 miliardám na začátku roku 2024. Optimalizace softwaru je nejrychlejší způsob, jak z omezeného hardwaru získat více užitečného výkonu: jednodušší požadavky lze směrovat na levnější nebo domácí čipy, zatímco Nvidia GPU zůstávají pro složité úlohy.
Největší tlak vytvářejí programovací asistenti a AI agenti, jejichž provoz vyžaduje více výpočtů, delší kontext a opakované volání nástrojů.