China Telecom Hangzhou, ZTE y Zhonghao Xinying instalaron 1.024 TPU Chana en una primera fase con una potencia declarada de 400 PFLOPS. La operadora atribuye una mejora de más de 10 veces en la eficiencia de salida de tokens a meses de ajuste y a la separación entre las fases Prefill y Decode.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying deploy China’s first domestic 1,024-chip Chana TPU cluster delivering 400. Article summary: China Telecom’s Hangzhou branch, ZTE, and Zhonghao Xinying built the first phase as a production-oriented, fully domestic TPU stack rather than merely installing accelerators: 1,024 first-generation Chana TPUs were integ. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
La relevancia del despliegue de Hangzhou no está tanto en el titular de las 1.024 unidades como en todo lo que se ha integrado alrededor de ellas. La filial de China Telecom en Hangzhou, ZTE y Zhonghao Xinying combinaron TPU Chana de primera generación con la plataforma de cómputo Taize, servidores, red de clúster y software de planificación para formar un sistema de 400 PFLOPS destinado al entrenamiento de grandes modelos, la inferencia de IA y la computación científica. Las informaciones disponibles lo describen como el primer despliegue a gran escala de un clúster de TPU nacionales dentro de China Telecom y como el primer clúster de TPU nacionales de mil tarjetas de China oriental. 17
20
La primera fase emplea 1.024 TPU Chana sobre la plataforma Taize de Zhonghao Xinying. Los socios presentan el conjunto como una infraestructura desarrollada en China de extremo a extremo: acelerador, hardware de servidores, red del clúster y planificación de recursos. 17
18
La distinción es importante: un gran clúster de IA no es solo un conjunto de aceleradores en bastidores. Su rendimiento útil depende de cómo se coordinan los servidores, la red, el software de los modelos y el planificador de tareas. El objetivo declarado del proyecto es convertir la TPU en un servicio de capacidad de cómputo operable, y no limitarse a demostrar un chip aislado. 18
La inferencia de un modelo de lenguaje grande tiene dos etapas distintas:
Ambas fases exigen recursos de manera diferente. Separarlas permite que una plataforma de inferencia asigne y planifique por separado la capacidad para procesar la petición inicial y para generar tokens, en lugar de obligar a un único grupo de dispositivos a atender ambas cargas con la misma programación. Las implementaciones de producción también requieren orquestación de clúster y configuración de red, como muestra la guía de despliegue de servicios SGLang con separación Prefill–Decode. 2
Hangzhou Telecom afirmó que varios meses de ajuste conjunto de software y hardware —incluidas versiones de modelos, operadores, configuración de servidores, ancho de banda de red y planificación— elevaron en más de diez veces la eficiencia de salida de tokens frente al inicio del año. También comunicó que el coste por millón de tokens bajó de unos 100 yuanes a menos de 10 yuanes. 9
11
Estas cifras deben leerse como resultados comunicados por el operador, no como pruebas de rendimiento universales de una TPU. Los informes disponibles no detallan los modelos utilizados, la precisión, el tamaño de los lotes, el patrón de tráfico, el nivel de utilización ni el método de cálculo de costes. Por ello, no es posible reproducir de forma independiente los ahorros ni compararlos directamente con otra plataforma de inferencia.
El clúster reúne tres capacidades que a menudo se evalúan por separado:
Para un chip de IA nacional, un entorno de operador de telecomunicaciones permite poner a prueba algo más que las especificaciones máximas del silicio. La planificación, la adaptación de modelos, el comportamiento de la red y la operación continuada determinan si los clientes reciben capacidad de inferencia predecible. La arquitectura del proyecto incluye explícitamente recursos de cómputo, planificación, adaptación de modelos, gestión operativa y aplicaciones sectoriales. 18
Una TPU es un acelerador de IA orientado a operaciones tensoriales. Su promesa no reside únicamente en los FLOPS máximos, sino en ejecutar eficientemente cargas de trabajo intensivas en operaciones matriciales, habituales en el entrenamiento y la inferencia de grandes modelos.
Pero, a escala de clúster, el rendimiento del acelerador es inseparable de la interconexión, el comportamiento de la memoria, las comunicaciones colectivas, la planificación, la fiabilidad y la compatibilidad con el software de los modelos.
Por eso, una alternativa nacional debe demostrar más que el funcionamiento de su silicio. Modelos, motores de inferencia, operadores, métodos de cuantización y flujos de trabajo de clientes deben ejecutarse de forma fiable en la nueva pila tecnológica. Las informaciones aportadas respaldan el despliegue de Hangzhou y su expansión prevista, pero no prueban una paridad amplia con los ecosistemas de software de GPU predominantes en distintos modelos y marcos de trabajo.
Los socios prevén una segunda fase con la TPU Xuyu, de segunda generación de Zhonghao Xinying, que llevaría la capacidad total planificada por encima de los 10.000 PFLOPS. 17
19
La compañía indica que Xuyu ofrece 896 TFLOPS de rendimiento de coma flotante de precisión mixta y 1.792 TOPS en inferencia de 8 bits, con un consumo nominal de 600 W. También sostiene que Xuyu alcanza aproximadamente tres veces el rendimiento de Chana y reduce en un 50 % el consumo frente a chips convencionales con un rendimiento comparable. Son especificaciones comunicadas por la empresa. 19
20
A nivel de sistema, Xuyu está diseñada para supernodos de hasta 2.048 chips conectados mediante interconexión totalmente óptica, según la presentación pública de la compañía. 20
El proyecto evidencia un intento de construir una pila nacional de computación para IA desde el chip hasta la plataforma: acelerador, conjunto de instrucciones, servidores, red, planificación y operación del servicio. 18
19 La prueba decisiva será comprobar si esa pila puede mantener cargas de producción diversas con software compatible, rendimiento predecible y una economía transparente.
El despliegue de 400 PFLOPS y la expansión prevista con Xuyu han sido ampliamente comunicados. Las afirmaciones más llamativas —más de diez veces de mejora en la eficiencia de salida de tokens y un coste inferior a 10 yuanes por millón de tokens— pueden ser objetivos plausibles para un sistema de inferencia mejor aprovechado, pero por ahora siguen siendo datos de la operadora y los participantes del proyecto mientras no se publiquen la metodología de las pruebas y los detalles de las cargas de trabajo. 9
11
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
China Telecom Hangzhou, ZTE y Zhonghao Xinying instalaron 1.024 TPU Chana en una primera fase con una potencia declarada de 400 PFLOPS.
China Telecom Hangzhou, ZTE y Zhonghao Xinying instalaron 1.024 TPU Chana en una primera fase con una potencia declarada de 400 PFLOPS. La operadora atribuye una mejora de más de 10 veces en la eficiencia de salida de tokens a meses de ajuste y a la separación entre las fases Prefill y Decode.
La segunda fase prevé incorporar las TPU Xuyu y superar los 10.000 PFLOPS, aunque las especificaciones y los ahorros comunicados son datos de las empresas participantes.