China Telecom w Hangzhou, ZTE i Zhonghao Xinying wdrożyły 1024 chipy Chana TPU na platformie Taize, tworząc klaster o deklarowanej mocy 400 PFLOPS. Według operatora rozdzielenie etapów Prefill i Decode oraz wielomiesięczne strojenie systemu podniosły wydajność generowania tokenów ponad 10 krotnie.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Dla rynku AI w Chinach wdrożenie w Hangzhou jest istotne nie tylko dlatego, że obejmuje 1024 chipy. Ważniejsze jest to, co zbudowano wokół akceleratorów. Oddział China Telecom w Hangzhou, ZTE i Zhonghao Xinying połączyły TPU pierwszej generacji Chana z platformą Taize, serwerami, siecią klastrową i oprogramowaniem do planowania zadań. Powstał system o deklarowanej mocy 400 PFLOPS, przeznaczony do trenowania dużych modeli, wnioskowania AI i obliczeń naukowych. Projekt jest opisywany jako pierwsze duże wdrożenie klastra krajowych TPU w strukturach China Telecom oraz pierwszy wschodniochiński klaster tysiąca kart TPU produkcji krajowej. 17
20
Pierwsza faza opiera się na 1024 akceleratorach Chana TPU działających na platformie Taize firmy Zhonghao Xinying. Partnerzy deklarują krajowe pochodzenie kolejnych warstw rozwiązania: od akceleratora, przez sprzęt serwerowy i sieć, po system planowania mocy obliczeniowej. 17
18
To rozróżnienie ma znaczenie, ponieważ klaster AI nie jest po prostu zbiorem chipów w szafach serwerowych. Jego użyteczna wydajność zależy od współdziałania serwerów, sieci, oprogramowania modelowego i harmonogramu zadań. Celem projektu jest więc przekształcenie TPU z demonstracji układu scalonego w usługę obliczeniową, którą można eksploatować na większą skalę. 18
Wnioskowanie dużych modeli językowych składa się z dwóch odmiennych etapów:
Etapy te inaczej obciążają infrastrukturę. Ich rozdzielenie pozwala niezależnie przydzielać i planować zasoby dla przetwarzania promptów oraz generowania odpowiedzi, zamiast obsługiwać oba typy pracy przez tę samą pulę urządzeń i jeden harmonogram. W praktyce wymaga to także orkiestracji klastra i odpowiedniej konfiguracji sieci, co pokazują instrukcje wdrożeniowe usług SGLang z rozdzielonym Prefill–Decode. 2
Hangzhou Telecom podał, że po kilku miesiącach strojenia sprzętu i oprogramowania — obejmującego wersje modeli, operatory, konfiguracje serwerów, przepustowość sieci i harmonogramowanie — wydajność generowania tokenów wzrosła ponad 10-krotnie w porównaniu z początkiem roku. Według firmy koszt miliona tokenów spadł z około 100 juanów do mniej niż 10 juanów. 9
11
To jednak wyniki deklarowane przez operatora, a nie uniwersalny, niezależnie zweryfikowany benchmark TPU. W dostępnych materiałach nie podano zestawu modeli, precyzji obliczeń, wielkości partii, charakterystyki ruchu, poziomu wykorzystania klastra ani metody rozliczania kosztów. Nie da się więc rzetelnie odtworzyć tych rezultatów ani bezpośrednio porównać ich z inną platformą do inferencji.
Wdrożenie łączy kompetencje, które często są oceniane osobno:
Dla krajowego układu AI takie środowisko operatora telekomunikacyjnego jest cenne, bo przenosi próbę z poziomu szczytowych parametrów chipu do codziennego świadczenia usługi. O tym, czy użytkownik otrzyma przewidywalną moc inferencyjną, decydują m.in. harmonogramowanie, adaptacja modeli, zachowanie sieci i bieżąca eksploatacja. Architektura projektu obejmuje wprost zasoby obliczeniowe, planowanie zadań, dostosowanie modeli, zarządzanie operacyjne i zastosowania branżowe. 18
TPU to akcelerator AI zoptymalizowany do operacji tensorowych. Jego atutem nie jest wyłącznie wysoka liczba FLOPS, lecz potencjalnie sprawne wykonywanie intensywnych obliczeń macierzowych, typowych dla trenowania i wnioskowania w dużych modelach.
W skali klastra wydajność akceleratora jest jednak nierozerwalnie związana z połączeniami między układami, pamięcią, komunikacją zbiorową, planowaniem zadań, niezawodnością oraz zgodnością z oprogramowaniem modeli. Krajowa alternatywa musi zatem udowodnić nie tylko, że jej krzem działa. Modele, silniki inferencyjne, operatory, metody kwantyzacji i procesy klientów muszą działać na nowym stosie stabilnie i przewidywalnie.
Dostarczone materiały potwierdzają samo wdrożenie w Hangzhou oraz plan rozbudowy. Nie dowodzą natomiast szerokiej równoważności z dominującymi ekosystemami GPU pod względem modeli, frameworków i narzędzi programistycznych.
W drugiej fazie partnerzy planują użyć TPU drugiej generacji Xuyu. Łączna planowana moc obliczeniowa ma przekroczyć 10 000 PFLOPS. 17
19
Firma podaje, że Xuyu osiąga 896 TFLOPS w obliczeniach zmiennoprzecinkowych mieszanej precyzji i 1792 TOPS w 8-bitowym wnioskowaniu, przy znamionowym poborze mocy 600 W. Deklaruje też około trzykrotnie wyższą wydajność niż Chana oraz o 50% niższe zużycie energii niż w konwencjonalnych chipach o porównywalnej wydajności. Są to parametry zgłaszane przez producenta. 19
20
Według publicznej prezentacji firmy Xuyu zaprojektowano również do pracy w superwęzłach łączących optycznie do 2048 chipów. 20
Klaster w Hangzhou pokazuje próbę zbudowania krajowego stosu obliczeniowego AI — od chipu i zestawu instrukcji, przez serwery, sieć oraz planowanie zadań, po operacyjne dostarczanie usług. 18
19
Najważniejszy test dopiero nadejdzie: czy ten stos będzie w stanie stale obsługiwać zróżnicowane obciążenia produkcyjne, zapewniać zgodność programową, przewidywalną wydajność i przejrzystą ekonomię. Samo wdrożenie o mocy 400 PFLOPS oraz plan ekspansji z użyciem Xuyu są szeroko opisywane. Najbardziej przyciągające uwagę deklaracje — ponad 10-krotny wzrost wydajności tokenowej i koszt poniżej 10 juanów za milion tokenów — pozostają jednak twierdzeniami operatora i uczestników projektu, dopóki nie zostaną ujawnione metodologia testów oraz szczegóły obciążeń. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
China Telecom w Hangzhou, ZTE i Zhonghao Xinying wdrożyły 1024 chipy Chana TPU na platformie Taize, tworząc klaster o deklarowanej mocy 400 PFLOPS.
China Telecom w Hangzhou, ZTE i Zhonghao Xinying wdrożyły 1024 chipy Chana TPU na platformie Taize, tworząc klaster o deklarowanej mocy 400 PFLOPS. Według operatora rozdzielenie etapów Prefill i Decode oraz wielomiesięczne strojenie systemu podniosły wydajność generowania tokenów ponad 10 krotnie.
Planowana druga faza ma wykorzystać TPU Xuyu i przekroczyć 10 000 PFLOPS, ale kluczowym sprawdzianem pozostaje dojrzałość oprogramowania i zgodność z rzeczywistymi obciążeniami.