China Telecom Hangzhou, ZTE en Zhonghao Xinying bouwden een cluster met 1.024 Chana TPU’s en een opgegeven capaciteit van 400 PFLOPS. Volgens Hangzhou Telecom steeg de tokenoutput na optimalisaties meer dan tienvoudig en daalden de kosten van circa ¥100 naar minder dan ¥10 per miljoen tokens.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
De opmerkelijkste kant van het TPU-cluster in Hangzhou is niet zozeer het getal van 1.024 chips, maar de software- en infrastructuurlaag eromheen. China Telecom in Hangzhou bouwde het systeem samen met ZTE en chipmaker Zhonghao Xinying. De eerste fase koppelt eerste-generatie Chana-TPU’s aan het Taize-platform, servers, clusternetwerk en planningssoftware. Het resultaat is een systeem van 400 PFLOPS voor het trainen van grote taalmodellen, AI-inferentie en wetenschappelijke berekeningen. Het project geldt volgens de berichtgeving als China Telecoms eerste grootschalige inzet van een binnenlands TPU-cluster en als Oost-China’s eerste binnenlandse TPU-cluster op duizendkaartsschaal. 17
20
De eerste fase gebruikt 1.024 Chana-TPU’s op het Taize-platform van Zhonghao Xinying. De partners presenteren de installatie als een binnenlands opgebouwde keten: van AI-versneller en serverhardware tot clusternetwerk en rekencapaciteitsplanning. 17
18
Dat onderscheid is belangrijk. Een groot AI-cluster bestaat niet simpelweg uit veel versnellers in racks. De praktisch bruikbare prestaties hangen ook af van de samenhang tussen servers, netwerkfabric, modelsoftware en de scheduler die taken over de machines verdeelt. In Hangzhou is het doel daarom nadrukkelijk een operationele rekendienst, en niet alleen een demonstratie van een chip. 18
Inferentie met grote taalmodellen kent grofweg twee fasen:
Die fasen belasten hardware verschillend. Door ze los van elkaar in te plannen, kan een platform capaciteit afzonderlijk toewijzen aan promptverwerking en tokengeneratie, in plaats van beide typen werk op dezelfde pool hardware volgens één planning te laten draaien. In een productieomgeving vergt dit ook clusterorkestratie en een passende netwerkconfiguratie, zoals implementatiehandleidingen voor gescheiden Prefill-Decode-diensten met SGLang laten zien. 2
Hangzhou Telecom meldt dat maanden van gezamenlijke optimalisatie van hard- en software — waaronder modelversies, operators, serverconfiguraties, netwerkbandbreedte en scheduling — de tokenoutputefficiëntie met meer dan een factor tien hebben verhoogd ten opzichte van het begin van het jaar. De organisatie rapporteerde ook dat de kosten per miljoen tokens daalden van ongeveer ¥100 naar minder dan ¥10. 9
11
Die cijfers moeten echter worden gelezen als door de exploitant gemelde resultaten uit een specifieke uitrol, niet als universele TPU-benchmark. De beschikbare berichtgeving vermeldt niet welke modellen zijn gebruikt, met welke precisie en batchgroottes is gewerkt, wat het verkeerspatroon en de bezettingsgraad waren, of hoe de kosten precies zijn berekend. Daardoor zijn de besparingen niet onafhankelijk te reproduceren of eerlijk naast een ander inferentieplatform te leggen.
Het project brengt drie doorgaans afzonderlijk beoordeelde lagen samen:
Voor een binnenlandse AI-chip is zo’n telecomomgeving relevant, omdat de proef daarmee verschuift van piekspecificaties op chipniveau naar de levering van een dienst. Planning, modelaanpassing, netwerkgedrag en dagelijks beheer bepalen uiteindelijk of klanten voorspelbare inferentiecapaciteit krijgen. De architectuur omvat expliciet rekenbronnen, scheduling, modelaanpassing, operationeel beheer en toepassingen per sector. 18
Een TPU is een tensorgerichte AI-versneller. De potentiële kracht zit niet uitsluitend in hoge FLOPS-waarden, maar in efficiënte uitvoering van matrixintensieve taken, die dominant zijn bij training en inferentie van grote modellen. Op clusterniveau zijn de prestaties echter onlosmakelijk verbonden met interconnects, geheugengedrag, collectieve communicatie, planning, betrouwbaarheid en compatibiliteit met modelsoftware.
Een binnenlands alternatief moet dus meer bewijzen dan dat het silicium functioneert. Modellen, inferentie-engines, operators, quantisatiemethoden en klantworkflows moeten stabiel op de nieuwe stack kunnen draaien. De beschikbare bronnen onderbouwen de installatie in Hangzhou en de geplande uitbreiding, maar tonen geen brede gelijkwaardigheid met de gevestigde GPU-softwareecosystemen voor uiteenlopende modellen en frameworks aan.
De partners plannen een tweede fase met Zhonghao Xinyings tweede-generatie-TPU Xuyu, waarmee de totale geplande rekenkracht boven 10.000 PFLOPS moet uitkomen. 17
19
Volgens het bedrijf levert Xuyu 896 TFLOPS aan mixed-precision floating-point-prestaties en 1.792 TOPS voor 8-bitsinferentie, bij een nominaal verbruik van 600 watt. Zhonghao Xinying stelt verder dat Xuyu ongeveer driemaal de prestaties van Chana biedt en bij vergelijkbare prestaties 50% minder stroom verbruikt dan conventionele chips. Dit zijn door het bedrijf gerapporteerde specificaties. 19
20
Op systeemniveau is Xuyu volgens de openbare presentatie ontworpen voor supernodes met maximaal 2.048 chips via volledig optische interconnects. 20
Het project laat zien dat er wordt gewerkt aan een binnenlandse AI-rekenstack die loopt van chip tot platform: versneller, instructieset, servers, netwerk, scheduling en dienstverlening. 18
19 De belangrijkste test volgt pas in de praktijk: kan die stack uiteenlopende productieworkloads langdurig ondersteunen met compatibele software, voorspelbare prestaties en transparante kosten?
De uitrol van 400 PFLOPS en de geplande uitbreiding met Xuyu worden breed gemeld. De meest in het oog springende claims — meer dan tien keer hogere tokenoutputefficiëntie en minder dan ¥10 per miljoen tokens — zijn denkbare uitkomsten van een beter benut inferentiesysteem, maar blijven uitspraken van de exploitant en projectpartners zolang benchmarkmethoden en workloadgegevens niet openbaar zijn gemaakt. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
China Telecom Hangzhou, ZTE en Zhonghao Xinying bouwden een cluster met 1.024 Chana TPU’s en een opgegeven capaciteit van 400 PFLOPS.
China Telecom Hangzhou, ZTE en Zhonghao Xinying bouwden een cluster met 1.024 Chana TPU’s en een opgegeven capaciteit van 400 PFLOPS. Volgens Hangzhou Telecom steeg de tokenoutput na optimalisaties meer dan tienvoudig en daalden de kosten van circa ¥100 naar minder dan ¥10 per miljoen tokens.
Een tweede fase met de Xuyu TPU moet de totale geplande rekenkracht boven 10.000 PFLOPS brengen.