China Telecom в Ханчжоу, ZTE и Zhonghao Xinying запустили кластер из 1 024 TPU Chana с заявленной мощностью 400 PFLOPS. Оператор сообщает о росте эффективности выдачи токенов более чем в 10 раз и снижении стоимости миллиона токенов примерно со 100 до менее 10 юаней, однако методика расчёта не раскрыта.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Для рынка важна не столько цифра в 1 024 чипа, сколько то, что было построено вокруг них. Подразделение China Telecom в Ханчжоу, ZTE и Zhonghao Xinying объединили TPU первого поколения Chana, платформу Taize, серверы, кластерную сеть и систему планирования задач в комплекс на 400 PFLOPS для обучения больших моделей, ИИ-инференса и научных расчётов. Проект называют первым крупномасштабным развёртыванием отечественного TPU-кластера в системе China Telecom и первым отечественным TPU-кластером «тысячекарточного» класса в Восточном Китае. 17
20
Первая очередь построена на 1 024 TPU Chana и платформе Taize от Zhonghao Xinying. Участники проекта заявляют, что отечественными являются все ключевые слои: ускорители, серверное оборудование, кластерная сеть и платформа управления вычислениями. 17
18
Это существенная оговорка. Крупный ИИ-кластер — не просто набор стоек с ускорителями. Его практическая производительность определяется тем, как согласованы серверы, сеть, программное обеспечение моделей и планировщик заданий. Заявленная задача проекта — превратить TPU из демонстрационного чипа в работающую сервисную инфраструктуру. 18
Инференс большой языковой модели обычно состоит из двух разных по характеру этапов:
Нагрузка на вычисления, память и сеть на этих этапах различается. Если разделить их, можно независимо выделять и планировать мощности для обработки входного запроса и для генерации ответа, а не использовать один общий пул устройств с единым расписанием. В промышленной реализации для этого также нужны оркестрация кластера и специальная настройка сети — это видно, например, из руководств по развёртыванию SGLang-сервисов с разделением Prefill–Decode. 2
По словам Hangzhou Telecom, несколько месяцев совместной оптимизации программного и аппаратного обеспечения — версий моделей, операторов, конфигураций серверов, пропускной способности сети и алгоритмов планирования — повысили эффективность выдачи токенов более чем в 10 раз по сравнению с началом года. Компания также сообщила о снижении стоимости миллиона токенов примерно со 100 до менее 10 юаней. 9
11
Эти показатели следует рассматривать именно как результаты, заявленные оператором и участниками проекта, а не как универсальный бенчмарк TPU. В доступных материалах не раскрыты наборы моделей, точность вычислений, размеры батчей, профиль трафика, загрузка оборудования и методика расчёта себестоимости. Поэтому независимо воспроизвести результат или корректно сравнить его с другой платформой нельзя.
В проекте соединили компетенции, которые нередко оценивают по отдельности:
Для отечественного ИИ-чипа операторская среда важна тем, что проверяет не только пиковые характеристики кремния. На первый план выходят планирование задач, адаптация моделей, поведение сети и постоянная эксплуатация — то есть способность стабильно предоставлять клиентам инференс как услугу. Архитектура проекта включает вычислительные ресурсы, планирование, адаптацию моделей, операционное управление и отраслевые приложения. 18
TPU — специализированный ускоритель для тензорных вычислений. Его ценность заключается не только в пиковом числе FLOPS, а в эффективном выполнении матричных операций, на которых держатся обучение и инференс трансформерных моделей.
Но в кластере производительность неотделима от межсоединений, работы памяти, коллективных коммуникаций, планировщика, отказоустойчивости и совместимости с программным стеком. Одного исправно работающего чипа недостаточно: модели, движки инференса, операторы, методы квантования и пользовательские процессы должны стабильно работать на новой платформе.
Именно поэтому отечественной альтернативе предстоит доказать больше, чем работоспособность процессора. Имеющиеся материалы подтверждают запуск кластера в Ханчжоу и планы его расширения, но не показывают широкую сопоставимость с распространёнными GPU-экосистемами по всем моделям и фреймворкам.
Во второй очереди партнёры намерены использовать TPU второго поколения Xuyu. Совокупная запланированная вычислительная мощность должна превысить 10 000 PFLOPS. 17
19
Компания указывает для Xuyu 896 TFLOPS производительности в смешанной точности и 1 792 TOPS для 8-битного инференса; номинальное энергопотребление одного чипа заявлено на уровне 600 Вт. Также заявляется примерно трёхкратное преимущество над Chana по производительности и на 50% меньшее энергопотребление по сравнению с традиционными чипами при сопоставимой производительности. Это характеристики, опубликованные самой компанией. 19
20
Согласно публичной презентации Zhonghao Xinying, Xuyu рассчитан на сверхузлы с объединением до 2 048 чипов через полностью оптическое межсоединение. 20
Кластер в Ханчжоу показывает попытку собрать отечественный ИИ-стек целиком: от ускорителя, системы команд и серверов до сети, планировщика и эксплуатации сервиса. 18
19 Главным испытанием станет способность этой системы поддерживать разнообразные производственные нагрузки с совместимым ПО, предсказуемой производительностью и прозрачной экономикой.
Само развёртывание комплекса на 400 PFLOPS и план перехода к Xuyu широко освещались в источниках. Однако наиболее заметные цифры — рост эффективности выдачи токенов более чем в 10 раз и цена ниже 10 юаней за миллион токенов — пока остаются заявлениями оператора и участников проекта. Без публикации методики бенчмарков и параметров нагрузки они не могут считаться независимо подтверждёнными. 9
11
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
China Telecom в Ханчжоу, ZTE и Zhonghao Xinying запустили кластер из 1 024 TPU Chana с заявленной мощностью 400 PFLOPS.
China Telecom в Ханчжоу, ZTE и Zhonghao Xinying запустили кластер из 1 024 TPU Chana с заявленной мощностью 400 PFLOPS. Оператор сообщает о росте эффективности выдачи токенов более чем в 10 раз и снижении стоимости миллиона токенов примерно со 100 до менее 10 юаней, однако методика расчёта не раскрыта.
Вторая очередь должна превысить 10 000 PFLOPS и использовать TPU второго поколения Xuyu с заявленной производительностью 896 TFLOPS в смешанной точности.