China Telecom v Chang čou, ZTE a Zhonghao Xinying nasadily 1 024 čipů Chana TPU na platformě Taize; první fáze má výkon 400 PFLOPS. Provozovatel uvádí více než desetinásobné zvýšení efektivity výstupu tokenů a pokles nákladů zhruba ze 100 jüanů na méně než 10 jüanů za milion tokenů.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Nejdůležitější na nasazení v čínském Chang-čou není samotné číslo 1 024 čipů. Podstatné je, že China Telecom v Chang-čou, ZTE a Zhonghao Xinying spojily domácí TPU první generace Chana s platformou Taize, servery, síťovou infrastrukturou klastru a plánováním úloh do systému o výkonu 400 PFLOPS pro trénování velkých modelů, AI inferenci a vědecké výpočty. Projekt je popisován jako první rozsáhlé nasazení domácího TPU klastru v rámci China Telecom a zároveň první domácí tisícikaretní TPU klaster ve východní Číně. 17
20
První fáze využívá 1 024 TPU Chana na výpočetní platformě Taize společnosti Zhonghao Xinying. Partneři uvádějí domácí původ napříč vrstvami akcelerátoru, serverového hardwaru, klastrové sítě i plánování výpočtů. 17
18
To je zásadní rozdíl oproti pouhé demonstraci čipu. U velkého AI klastru neurčuje použitelný výkon jen počet akcelerátorů: záleží také na souhře serverů, síťové fabric, modelového softwaru a plánovače úloh. Cílem projektu je podle popisu proměnit TPU v provozovatelnou výpočetní službu, ne jen ve samostatně předváděný čip. 18
Inference velkých jazykových modelů má dvě rozdílné fáze:
Každá fáze zatěžuje infrastrukturu jinak. Jejich oddělení umožňuje přidělovat a plánovat kapacitu pro zpracování promptů a pro generování tokenů nezávisle, namísto toho, aby obě úlohy soutěžily o stejný pool zařízení v jediném harmonogramu. V produkčním provozu ale takové řešení vyžaduje koordinaci klastru a odpovídající konfiguraci sítě, jak ukazuje dokumentace k nasazení služeb SGLang s oddělenými fázemi Prefill–Decode. 2
Hangzhou Telecom uvedl, že po několika měsících softwarového a hardwarového ladění — od verzí modelů a operátorů přes konfigurace serverů a šířku síťového pásma až po plánování — vzrostla efektivita výstupu tokenů oproti začátku roku více než desetkrát. Náklad na milion tokenů měl současně klesnout přibližně ze 100 jüanů na méně než 10 jüanů. 9
11
Tato čísla je však potřeba číst jako výsledky uváděné provozovatelem, nikoli jako univerzální benchmark TPU. Dostupné zprávy nepopisují skladbu modelů, použitou přesnost, velikosti dávek, charakter provozu, míru využití ani metodiku výpočtu nákladů. Úspory proto nelze nezávisle zopakovat ani přímo porovnat s jinou inferenční platformou.
Projekt propojuje tři vrstvy, které se často hodnotí odděleně:
Právě prostředí telekomunikačního operátora je pro domácí AI čip praktickým testem: rozhoduje nejen špičková specifikace křemíku, ale i plánování úloh, přizpůsobení modelů, chování sítě a dlouhodobý provoz. Architektura projektu výslovně zahrnuje výpočetní zdroje, plánování, adaptaci modelů, provozní správu i oborové aplikace. 18
TPU je tensorově orientovaný AI akcelerátor. Jeho přínos nespočívá jen v maximálním počtu operací za sekundu, ale v efektivním provádění maticově náročných úloh typických pro trénování a inferenci velkých modelů.
Ve velkém klastru však výkon akcelerátoru nelze oddělit od propojení čipů, práce s pamětí, kolektivní komunikace, plánování, spolehlivosti a kompatibility modelového softwaru. Domácí alternativa tak musí dokázat víc než funkční hardware: modely, inferenční enginy, operátory, kvantizační postupy a pracovní postupy zákazníků musejí na novém stacku fungovat spolehlivě.
Dodané zdroje potvrzují nasazení v Chang-čou a plánované rozšíření, ale nedokládají širokou srovnatelnost s hlavními GPU ekosystémy napříč modely a frameworky.
Ve druhé fázi partneři plánují využít TPU druhé generace Xuyu od Zhonghao Xinying. Celkový plánovaný výkon má přesáhnout 10 000 PFLOPS. 17
19
Společnost uvádí pro Xuyu výkon 896 TFLOPS ve smíšené přesnosti a 1 792 TOPS pro 8bitovou inferenci při jmenovité spotřebě 600 W. Dále deklaruje přibližně trojnásobný výkon proti Chana a o 50 % nižší spotřebu než u konvenčních čipů při srovnatelném výkonu. Jde o parametry uváděné samotnou společností. 19
20
Podle veřejné prezentace má být Xuyu určen také pro superuzly s až 2 048 čipy propojenými celooptickou sítí. 20
Projekt v Chang-čou ukazuje pokus sestavit domácí AI výpočetní stack od čipu po službu: akcelerátor, instrukční sadu, servery, síť, plánování i provozní řízení. 18
19
Rozhodující bude, zda takový stack dlouhodobě zvládne rozmanité produkční zátěže s kompatibilním softwarem, předvídatelným výkonem a transparentní ekonomikou. Nasazení o výkonu 400 PFLOPS i plán rozšíření s Xuyu jsou široce uváděny. Výraznější tvrzení — více než desetinásobná efektivita výstupu tokenů a cena pod 10 jüanů za milion tokenů — zůstávají prozatím tvrzeními provozovatele a účastníků projektu, dokud nebudou zveřejněny metodiky benchmarků a podrobnosti o zátěži. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
China Telecom v Chang čou, ZTE a Zhonghao Xinying nasadily 1 024 čipů Chana TPU na platformě Taize; první fáze má výkon 400 PFLOPS.
China Telecom v Chang čou, ZTE a Zhonghao Xinying nasadily 1 024 čipů Chana TPU na platformě Taize; první fáze má výkon 400 PFLOPS. Provozovatel uvádí více než desetinásobné zvýšení efektivity výstupu tokenů a pokles nákladů zhruba ze 100 jüanů na méně než 10 jüanů za milion tokenů.
Druhá fáze má využít TPU Xuyu a překročit 10 000 PFLOPS; deklarované parametry čipu jsou 896 TFLOPS ve smíšené přesnosti a 1 792 TOPS pro 8bitovou inferenci.