Підрозділ China Telecom у Ханчжоу, ZTE та Zhonghao Xinying розгорнули 1 024 чиповий кластер Chana TPU на платформі Taize із заявленою продуктивністю 400 PFLOPS. Оператор повідомив про більш ніж десятикратне зростання ефективності видавання токенів і зниження ціни мільйона токенів приблизно зі 100 до менш ніж 10 юані...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Не кількість у 1 024 чипи є головною особливістю ханчжоуського проєкту. Значно важливіше те, що навколо цих прискорювачів зібрали повний обчислювальний контур: TPU першого покоління Chana, платформу Taize, сервери, мережу кластера та програмне планування. Підрозділ China Telecom у Ханчжоу, ZTE і Zhonghao Xinying заявляють, що отримали систему на 400 PFLOPS для навчання великих моделей, ШІ-інференсу та наукових обчислень. Її називають першим масштабним розгортанням кластера на вітчизняних TPU в системі China Telecom і першим у Східному Китаї кластером такого класу на тисячу карт. 17
20
На першому етапі встановили 1 024 TPU Chana на платформі Taize, розробленій Zhonghao Xinying. Учасники проєкту описують систему як вітчизняну на всіх ключових рівнях: від прискорювача та серверного обладнання до кластерної мережі й платформи розподілу обчислювальних ресурсів. 17
18
Для ШІ-кластера самі чипи — лише частина системи. Практична продуктивність залежить від того, наскільки злагоджено працюють сервери, мережева фабрика, програмне забезпечення моделей і планувальник завдань. Заявлена мета проєкту — перетворити TPU з окремого чипа на керований сервіс обчислювальної потужності. 18
Інференс великої мовної моделі складається з двох різних за характером етапів:
Навантаження на цих етапах відрізняється. Їхнє розділення дає змогу окремо виділяти та планувати ресурси для опрацювання промптів і для генерації відповіді, замість того щоб обидва типи роботи конкурували за один пул пристроїв за єдиним розкладом. На практиці такий підхід потребує оркестрації кластера й налаштованої мережевої взаємодії — це, зокрема, видно з інструкцій із розгортання сервісів SGLang із розділеними Prefill та Decode. 2
Hangzhou Telecom повідомила, що кілька місяців спільного налаштування програмного й апаратного забезпечення — версій моделей, операторів, конфігурацій серверів, пропускної здатності мережі та планування — підвищили ефективність видавання токенів більш ніж у 10 разів порівняно з початком року. Також оператор заявив про зниження вартості мільйона токенів приблизно зі 100 до менш ніж 10 юанів. 9
11
Ці цифри слід сприймати саме як заявлені оператором результати конкретного розгортання, а не як універсальний бенчмарк TPU. У доступних матеріалах не розкрито набір моделей, точність обчислень, розмір пакетів, характер трафіку, рівень завантаження системи та методику обліку витрат. Тому незалежно відтворити або напряму порівняти заявлену економію з іншою платформою інференсу неможливо.
У проєкті поєднано три типи компетенцій, які часто оцінюють окремо:
Для вітчизняного ШІ-чипа операторське середовище корисне тим, що перевірка переходить від пікових характеристик кристала до якості сервісу: планування, адаптації моделей, поведінки мережі та безперервної експлуатації. Архітектура проєкту прямо охоплює обчислювальні ресурси, планування, адаптацію моделей, операційне управління та галузеві застосування. 18
TPU — це спеціалізований тензорний прискорювач для ШІ. Його потенційна перевага полягає не лише у піковому показнику FLOPS, а й в ефективному виконанні матричних операцій, типових для навчання та інференсу великих моделей.
Втім, на рівні кластера продуктивність прискорювача невіддільна від міжз’єднань, поведінки пам’яті, колективних комунікацій, планування, надійності й сумісності з модельним ПЗ. Тому для вітчизняної альтернативи недостатньо довести, що працює сам кремній. Моделі, рушії інференсу, оператори, методи квантизації та робочі процеси клієнтів мають стабільно працювати на новому стеку.
Наявні повідомлення підтверджують розгортання в Ханчжоу та план розширення, але не доводять широкої паритетності з провідними GPU-екосистемами за всіма моделями й фреймворками.
На другому етапі партнери планують використати TPU другого покоління Xuyu. Сукупна запланована продуктивність системи має перевищити 10 000 PFLOPS. 17
19
За даними компанії, Xuyu забезпечує 896 TFLOPS продуктивності зі змішаною точністю та 1 792 TOPS в 8-бітному інференсі, а його номінальне енергоспоживання становить 600 Вт. Також заявлено приблизно утричі вищу продуктивність проти Chana та на 50% нижче енергоспоживання, ніж у традиційних чипів за порівнюваної продуктивності. Це специфікації, заявлені компанією. 19
20
Згідно з публічною презентацією виробника, Xuyu розрахований на суперноди, що можуть об’єднувати до 2 048 чипів за допомогою повністю оптичного міжз’єднання. 20
Проєкт показує спробу зібрати вітчизняний ШІ-стек від чипа до платформи: прискорювач, систему команд, сервери, мережі, планування та операційне надання послуг. 18
19 Найважливішою перевіркою стане здатність цієї системи підтримувати різноманітні виробничі навантаження з сумісним ПЗ, передбачуваною продуктивністю та прозорою економікою.
Розгортання системи на 400 PFLOPS і запланований перехід до Xuyu широко висвітлювалися. Натомість найгучніші показники — більш ніж 10-разове зростання ефективності видавання токенів і ціна нижче 10 юанів за мільйон токенів — залишаються заявами оператора та учасників проєкту, доки не буде оприлюднено методологію вимірювань і параметри навантажень. 9
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Підрозділ China Telecom у Ханчжоу, ZTE та Zhonghao Xinying розгорнули 1 024 чиповий кластер Chana TPU на платформі Taize із заявленою продуктивністю 400 PFLOPS.
Підрозділ China Telecom у Ханчжоу, ZTE та Zhonghao Xinying розгорнули 1 024 чиповий кластер Chana TPU на платформі Taize із заявленою продуктивністю 400 PFLOPS. Оператор повідомив про більш ніж десятикратне зростання ефективності видавання токенів і зниження ціни мільйона токенів приблизно зі 100 до менш ніж 10 юанів — це результати, заявлені учасниками проєкту.
Другий етап має отримати TPU Xuyu та перевищити 10 000 PFLOPS; компанія заявляє для Xuyu 896 TFLOPS змішаної точності, 1 792 TOPS INT8 і номінальне споживання 600 Вт.