Huawei afferma che Atlas 960E potrà estendere l’indirizzamento unificato della memoria a 4.096 NPU, con 8 EFLOPS FP8 o 16 EFLOPS FP4 dichiarati per SuperPoD. UnifiedBus riunisce oltre dieci protocolli di interconnessione in un’unica infrastruttura con semantica di memoria comune.
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is Huawei’s new AI computing architecture—centered on the near-packaged-optics Atlas 960E SuperPoD, Ascend 960 chips, and UnifiedBus int. Article summary: Huawei’s approach is to treat communication and memory access—not just accelerator throughput—as the limiting resource in giant AI clusters. It combines tightly coupled Ascend NPUs, a single UnifiedBus protocol and memor. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Per addestrare modelli IA molto grandi non basta sommare la potenza dei chip: spesso il collo di bottiglia è il movimento di parametri, attivazioni, cache e dati fra migliaia di processori. Huawei costruisce attorno a questo problema la sua nuova proposta: Atlas 960E SuperPoD, la roadmap Ascend 960 e il fabric di interconnessione UnifiedBus.
La tesi è semplice: un cluster deve comportarsi meno come un insieme di server separati e più come una grande macchina coordinata. Va però chiarito un punto: i dati su prestazioni, efficienza e scalabilità sono dichiarazioni di Huawei, non benchmark indipendenti. 9
18
Nei grandi cluster tradizionali, CPU, acceleratori, storage e memoria sono risorse distinte, collegate attraverso più protocolli. Huawei afferma che UnifiedBus accorpa oltre dieci protocolli di interconnessione in un solo protocollo e in una semantica di memoria comune, consentendo accesso diretto peer-to-peer fra CPU, NPU, memoria e SSD. 18
L’obiettivo pratico è ridurre le attese. Invece di copiare continuamente i dati o coordinarne esplicitamente il passaggio fra nodi isolati, il software potrebbe indirizzare la memoria dell’intero SuperPoD tramite uno spazio di indirizzamento globale unificato. In teoria, questo rende la memoria distribuita più simile a una risorsa condivisa, utile quando modello e dati intermedi non entrano nella memoria locale di un singolo acceleratore. 18
Huawei dichiara un passaggio della capacità di interconnessione dalla classe di circa 100 GB/s a quella dei TB/s e una riduzione della latenza di andata e ritorno da circa 7 microsecondi a 2 microsecondi. Si tratta di obiettivi misurati sulla progettazione UnifiedBus descritta dall’azienda, non di un confronto generale e verificato in modo indipendente con piattaforme concorrenti. 18
L’Atlas 960E SuperPoD combina i futuri processori Ascend 960, UnifiedBus e il motore Hi-ONE di Huawei basato su near-packaged optics (NPO), cioè collegamenti ottici collocati molto vicino al package dei chip. Il sistema, interamente raffreddato a liquido, è progettato per training e inferenza su modelli fino a 10.000 miliardi di parametri. 9
La configurazione di punta dichiarata è di 4.096 NPU con indirizzamento unificato della memoria, per una capacità di 8 EFLOPS in FP8 oppure 16 EFLOPS in FP4. 9
L’ottica NPO è un elemento centrale perché, all’aumentare di banda e dimensioni del cluster, le connessioni elettriche diventano più difficili da scalare. Huawei sostiene che ogni motore ottico Hi-ONE arrivi a 7,2 Tbit/s. Nel sistema proposto da 4.096 NPU, circa 5.500 motori Hi-ONE sostituirebbero all’incirca 48.000 moduli ottici convenzionali da 800G, con oltre 550 kW di consumi in meno e una disponibilità portata al 99,8%. Anche in questo caso, sono proiezioni dell’azienda per il proprio progetto. 9
Huawei ha previsto componenti distinti per i diversi livelli fisici del cluster:
Per organizzazioni che non richiedono un SuperPoD di queste dimensioni, l’Atlas 650E propone una configurazione full-mesh più compatta, con 16 NPU e UnifiedBus Link 2.0. Huawei indica fino a 4,0 TB/s di banda di lettura/scrittura della memoria on-chip e 13,4 TB/s di banda UB Link per server da 16 NPU. 20
Huawei afferma che lo sviluppo di Ascend 960 abbia superato le aspettative e che le prestazioni previste siano raddoppiate. Mancano però dati di benchmark indipendenti e sufficientemente dettagliati per verificare questa affermazione. 11
La tabella di marcia annunciata è la seguente:
Huawei ha inoltre dichiarato che i sistemi Atlas 950 SuperPod, della generazione precedente, sono già impiegati commercialmente su larga scala. Questa affermazione non va confusa con una diffusione dell’hardware Atlas 960E, legato alla futura generazione Ascend 960. 3
9
UnifiedBus può essere letto come la risposta di Huawei allo stesso problema affrontato da tecnologie di interconnessione per acceleratori quali Nvidia NVLink: mantenere molti acceleratori alimentati dai dati e consentire loro di comunicare abbastanza rapidamente da evitare che la crescita del cluster si traduca soprattutto in sincronizzazioni e tempi morti.
Le differenze rivendicate da Huawei sono l’unificazione di più protocolli, l’indirizzamento globale della memoria nel SuperPoD, l’accesso diretto fra componenti eterogenei e l’integrazione dell’NPO a livello di SuperPoD. 18
9
Il materiale disponibile, tuttavia, non consente un confronto diretto con NVLink su banda, latenza, maturità del software, affidabilità, costi o throughput reale nell’addestramento. Né dimostra che UnifiedBus sia uno standard aperto e multi-fornitore, paragonabile per governance o obiettivi di interoperabilità alle iniziative aperte per i collegamenti fra acceleratori. UnifiedBus viene presentato come un’architettura e un ecosistema di prodotto Huawei. 18
L’annuncio è rilevante perché mette interconnessione, ottica, topologia e semantica della memoria al centro della strategia infrastrutturale per l’IA, non solo la potenza del singolo chip. È una scelta potenzialmente utile quando il carico di lavoro è limitato dalla comunicazione e dalla capacità di memoria quanto dal calcolo per acceleratore.
La verifica arriverà con i sistemi Ascend 960 e Atlas 960E effettivamente disponibili: serviranno misure di throughput e utilizzo su carichi reali, strumenti software utilizzabili, affidabilità su vasta scala e capacità di fornitura in volumi adeguati. Fino ad allora, il SuperPoD da 4.096 NPU e il SuperCluster da un milione di NPU restano obiettivi architetturali ambiziosi, non risultati dimostrati in modo indipendente. 9
11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei afferma che Atlas 960E potrà estendere l’indirizzamento unificato della memoria a 4.096 NPU, con 8 EFLOPS FP8 o 16 EFLOPS FP4 dichiarati per SuperPoD.
Huawei afferma che Atlas 960E potrà estendere l’indirizzamento unificato della memoria a 4.096 NPU, con 8 EFLOPS FP8 o 16 EFLOPS FP4 dichiarati per SuperPoD. UnifiedBus riunisce oltre dieci protocolli di interconnessione in un’unica infrastruttura con semantica di memoria comune.
Ascend 960DT è previsto nel primo trimestre 2027 e Ascend 960PR nel terzo trimestre 2027, entrambi in anticipo rispetto alla precedente roadmap di Huawei.