Huawei annonce qu’un Atlas 960E SuperPoD pourra réunir 4 096 NPU avec adressage mémoire unifié, pour 8 EFLOPS en FP8 ou 16 EFLOPS en FP4. UnifiedBus rassemble plus de dix protocoles d’interconnexion sous un même protocole et une même sémantique mémoire, selon Huawei.
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How is Huawei’s new AI computing architecture—centered on the near-packaged-optics Atlas 960E SuperPoD, Ascend 960 chips, and UnifiedBus int. Article summary: Huawei’s approach is to treat communication and memory access—not just accelerator throughput—as the limiting resource in giant AI clusters. It combines tightly coupled Ascend NPUs, a single UnifiedBus protocol and memor. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
L’enjeu, pour Huawei, n’est pas seulement de produire des accélérateurs d’IA plus rapides. À l’échelle de plusieurs milliers de processeurs, une part importante du temps peut être perdue à déplacer des paramètres, des activations, des caches et des accès mémoire entre machines. L’Atlas 960E SuperPoD, la feuille de route Ascend 960 et le réseau UnifiedBus constituent la réponse proposée par le groupe chinois.
Les chiffres de performances et d’efficacité ci-dessous sont toutefois des annonces de Huawei : ils ne correspondent pas à des benchmarks indépendants. 9
18
Dans les grands clusters classiques, processeurs CPU, accélérateurs, stockage et mémoire restent souvent des ressources distinctes, reliées par plusieurs protocoles. Huawei affirme qu’UnifiedBus regroupe plus de dix protocoles d’interconnexion sous un protocole unique et une sémantique mémoire commune. L’objectif est de permettre des accès directs de pair à pair entre CPU, NPU, mémoire et SSD. 18
Concrètement, Huawei veut réduire l’attente liée aux copies et à la coordination explicite des données entre nœuds. Grâce à un espace global d’adressage mémoire au sein d’un SuperPoD, les logiciels pourraient traiter la mémoire distribuée davantage comme une ressource mutualisée. C’est particulièrement pertinent pour les modèles et les données intermédiaires qui ne tiennent plus dans la mémoire locale d’un seul accélérateur. 18
Huawei affirme faire passer la capacité d’interconnexion d’un ordre de grandeur d’environ 100 Go/s à des niveaux de l’ordre du To/s, tout en abaissant la latence aller-retour d’environ 7 microsecondes à 2 microsecondes. Il s’agit de caractéristiques revendiquées pour l’architecture UnifiedBus, et non d’une comparaison indépendante avec des solutions concurrentes. 18
L’Atlas 960E SuperPoD associe de futurs processeurs Ascend 960, UnifiedBus et le moteur Hi-ONE de Huawei reposant sur les near-packaged optics (NPO), une approche qui rapproche l’optique du boîtier des composants. Huawei présente ce système entièrement refroidi par liquide comme un SuperPoD NPO destiné à l’entraînement et à l’inférence de modèles allant jusqu’à 10 000 milliards de paramètres. 9
Sa configuration phare annoncée comprend 4 096 NPU avec adressage mémoire unifié, pour une puissance déclarée de 8 EFLOPS en FP8 ou de 16 EFLOPS en FP4. 9
L’optique est au centre de cette conception : à mesure que la bande passante et la taille du cluster augmentent, les liaisons électriques deviennent plus difficiles à faire évoluer. Huawei indique que chaque moteur optique Hi-ONE atteint 7,2 Tbit/s. Dans le système envisagé à 4 096 NPU, environ 5 500 moteurs Hi-ONE remplaceraient quelque 48 000 modules optiques 800G conventionnels. Le groupe annonce ainsi plus de 550 kW de consommation en moins et une disponibilité de 99,8 %. Ces valeurs restent des projections de Huawei pour cette architecture. 9
Huawei décline cette architecture à plusieurs niveaux physiques du cluster :
Pour les organisations qui n’ont pas besoin d’un SuperPoD géant, l’Atlas 650E vise une configuration plus compacte de 16 NPU en maillage complet, fondée sur UnifiedBus Link 2.0. Huawei annonce jusqu’à 4,0 To/s de bande passante de lecture-écriture de la mémoire intégrée et 13,4 To/s de bande passante UB Link par serveur à 16 NPU. 20
Huawei affirme que le développement de l’Ascend 960 a dépassé ses attentes et que les performances prévues ont doublé. La société n’a cependant pas publié les éléments de benchmark indépendants permettant de vérifier cette affirmation. 11
Le calendrier annoncé est le suivant :
Huawei assure également que les systèmes Atlas 950 SuperPod, de génération antérieure, sont déjà utilisés à grande échelle sur le plan commercial. Cette déclaration ne doit pas être confondue avec un déploiement de matériel Atlas 960E, lié à la future génération Ascend 960. 3
9
UnifiedBus peut être compris comme une réponse de Huawei, à l’échelle du système, au même problème général que les interconnexions d’accélérateurs telles que NVLink de Nvidia : alimenter suffisamment vite un grand nombre d’accélérateurs et leur permettre de communiquer avec assez de rapidité pour que l’ajout de puces ne se traduise pas surtout par davantage de synchronisation.
Les éléments différenciants mis en avant par Huawei sont l’unification plus large des protocoles, l’adressage mémoire global à l’intérieur d’un SuperPoD, l’accès direct entre composants hétérogènes et l’intégration des NPO à l’échelle du SuperPoD. 18
9
En revanche, les informations disponibles ne permettent pas d’établir une comparaison directe avec NVLink sur la bande passante, la latence, la maturité logicielle, la fiabilité, le coût ou le débit réel lors de l’entraînement. Elles ne démontrent pas non plus qu’UnifiedBus soit une norme ouverte et multi-fournisseurs, comparable dans sa gouvernance ou ses objectifs d’interopérabilité aux initiatives d’interconnexion ouvertes pour accélérateurs. UnifiedBus est présenté comme l’architecture et l’écosystème propres à Huawei. 18
L’annonce est importante parce qu’elle place le design global du système — interconnexion, optique, topologie réseau et sémantique mémoire — au centre de la stratégie d’infrastructure IA de Huawei. Cette approche peut être déterminante quand le facteur limitant est autant la communication et la capacité mémoire que la puissance de calcul d’une puce individuelle.
La validation viendra plus tard : livraison effective des Ascend 960 et des Atlas 960E, débit d’entraînement et taux d’utilisation mesurés sur des charges réelles, outils logiciels réellement exploitables, fiabilité à grande échelle et capacité à produire ces systèmes en volume. D’ici là, le SuperPoD à 4 096 NPU et le SuperCluster à un million de NPU restent des ambitions architecturales, non des résultats démontrés de manière indépendante. 9
11
18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Huawei annonce qu’un Atlas 960E SuperPoD pourra réunir 4 096 NPU avec adressage mémoire unifié, pour 8 EFLOPS en FP8 ou 16 EFLOPS en FP4.
Huawei annonce qu’un Atlas 960E SuperPoD pourra réunir 4 096 NPU avec adressage mémoire unifié, pour 8 EFLOPS en FP8 ou 16 EFLOPS en FP4. UnifiedBus rassemble plus de dix protocoles d’interconnexion sous un même protocole et une même sémantique mémoire, selon Huawei.
Les Ascend 960DT et 960PR sont attendus respectivement au premier et au troisième trimestre 2027, en avance sur la précédente feuille de route de Huawei.