Huawei zufolge kann der Atlas 960E pro SuperPoD bis zu 4.096 NPUs über eine einheitliche Speicheradressierung verbinden; genannt werden 8 EFLOPS bei FP8 oder 16 EFLOPS bei FP4. UnifiedBus soll mehr als zehn Interconnect Protokolle unter einem gemeinsamen Protokoll und einer einheitlichen Speichersemantik bündeln.
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How is Huawei’s new AI computing architecture—centered on the near-packaged-optics Atlas 960E SuperPoD, Ascend 960 chips, and UnifiedBus int. Article summary: Huawei’s approach is to treat communication and memory access—not just accelerator throughput—as the limiting resource in giant AI clusters. It combines tightly coupled Ascend NPUs, a single UnifiedBus protocol and memor. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Bei sehr großen KI-Trainingssystemen ist nicht allein die Rechenleistung der Beschleuniger entscheidend. Oft wird die Auslastung dadurch begrenzt, wie schnell Parameter, Aktivierungen, Caches und Speicherzugriffe zwischen Tausenden Prozessoren bewegt werden können. Huaweis Antwort darauf heißt Atlas 960E SuperPoD, Ascend-960-Roadmap und UnifiedBus. Wichtig: Die genannten Leistungs- und Effizienzwerte sind Angaben des Herstellers, keine unabhängig bestätigten Benchmarks. 9
18
In herkömmlichen Großclustern sind CPUs, KI-Beschleuniger, Speicher und Storage häufig getrennte Ressourcen, die über verschiedene Protokolle verbunden werden. UnifiedBus soll laut Huawei mehr als zehn Interconnect-Protokolle unter einem gemeinsamen Protokoll und einer gemeinsamen Speichersemantik zusammenführen. CPUs, NPUs, Arbeitsspeicher und SSDs sollen dadurch direkt per Peer-to-Peer-Zugriff miteinander arbeiten können. 18
Der praktische Ansatz: weniger Wartezeit durch Datenkopien und explizite Abstimmung zwischen voneinander isolierten Knoten. Über einen einheitlichen globalen Adressraum soll Software den Speicher innerhalb eines SuperPoDs als gemeinsamen Pool ansprechen können. Das wäre besonders für Modelle relevant, deren Gewichte und Zwischendaten nicht in den lokalen Speicher eines einzelnen Beschleunigers passen. 18
Huawei spricht dabei von einem Sprung der Interconnect-Bandbreite aus der Größenordnung von 100 GB/s in den TB/s-Bereich. Die Round-Trip-Latenz soll von rund 7 auf 2 Mikrosekunden sinken. Diese Werte beziehen sich auf die von Huawei vorgesehene UnifiedBus-Architektur – sie sind kein allgemein gültiger, unabhängig getesteter Vergleich mit Konkurrenzsystemen. 18
Der Atlas 960E SuperPoD kombiniert die kommenden Ascend-960-Prozessoren mit UnifiedBus und Huaweis Hi-ONE-Engine für Near-Packaged Optics (NPO). Dabei werden optische Komponenten sehr nah an der Recheneinheit integriert, um die Grenzen rein elektrischer Verbindungen bei steigender Bandbreite und Clustergröße besser zu umgehen. Huawei beschreibt das vollständig flüssigkeitsgekühlte System als NPO-basiertes SuperPoD für Training und Inferenz mit Modellen bis zu 10 Billionen Parametern. 9
Die angekündigte Maximalkonfiguration umfasst 4.096 NPUs mit einheitlicher Speicheradressierung. Huawei nennt dafür 8 EFLOPS bei FP8 oder 16 EFLOPS bei FP4. 9
Jede Hi-ONE-Optik-Engine soll 7,2 Tbit/s liefern. In der geplanten 4.096-NPU-Konfiguration könnten laut Huawei rund 5.500 Hi-ONE-Engines etwa 48.000 herkömmliche 800G-Optikmodule ersetzen. Das soll den Strombedarf um mehr als 550 kW senken und die Verfügbarkeit auf 99,8 % erhöhen. Auch dies sind Projektionen des Unternehmens für sein eigenes Systemdesign. 9
Huawei ergänzt die Architektur mit Produkten für verschiedene Ebenen eines Clusters:
Für Organisationen, die kein riesiges SuperPoD benötigen, positioniert Huawei den Atlas 650E. Das System nutzt eine Full-Mesh-Konfiguration mit 16 NPUs auf Basis von UnifiedBus Link 2.0. Genannt werden bis zu 4,0 TB/s Lese-/Schreibbandbreite des On-Chip-Speichers und 13,4 TB/s UB-Link-Bandbreite pro Server mit 16 NPUs. 20
Huawei erklärt, die Entwicklung des Ascend 960 habe die eigenen Erwartungen übertroffen und die geplante Leistung sei verdoppelt worden. Für diese Aussage fehlen bislang öffentlich zugängliche, unabhängige Benchmarkdaten. 11
Der angekündigte Zeitplan:
Huawei hat zudem erklärt, dass Systeme der vorherigen Generation Atlas 950 SuperPod bereits großflächig kommerziell eingesetzt würden. Das ist nicht mit einer Auslieferung des Atlas 960E gleichzusetzen, dessen Hardware an die kommende Ascend-960-Generation gekoppelt ist. 3
9
UnifiedBus lässt sich am ehesten als Huaweis Antwort auf dieselbe grundlegende Herausforderung verstehen, für die auch Beschleunigerverbindungen wie Nvidias NVLink entwickelt wurden: Viele KI-Beschleuniger müssen schnell genug Daten austauschen, damit zusätzliches Compute nicht vor allem zu mehr Synchronisationsaufwand führt.
Als Unterschiede hebt Huawei die Vereinheitlichung zahlreicher Protokolle, die globale Speicheradressierung innerhalb eines SuperPoDs, direkte Zugriffe zwischen heterogenen Komponenten und die NPO-Integration auf SuperPoD-Ebene hervor. 18
9
Die verfügbaren Informationen erlauben jedoch keinen belastbaren Vergleich auf Augenhöhe mit NVLink – weder bei Bandbreite und Latenz noch bei Software-Reife, Zuverlässigkeit, Kosten oder tatsächlichem Trainingsdurchsatz. Ebenso wird UnifiedBus nicht als offener, herstellerübergreifender Standard präsentiert, der in Governance und Interoperabilitätszielsetzung mit offenen Accelerator-Link-Initiativen vergleichbar wäre. UnifiedBus ist Teil von Huaweis eigener Architektur und Produktwelt. 18
Die Ankündigung ist vor allem deshalb relevant, weil Huawei Interconnect, Optik, Netzwerktopologie und Speichersemantik ins Zentrum seiner KI-Infrastrukturstrategie stellt – nicht nur die Rechenleistung eines einzelnen Chips. Das kann entscheidend sein, wenn Kommunikation und Speicherkapazität ein KI-Training ähnlich stark begrenzen wie die Rechenleistung pro Beschleuniger.
Der Praxistest steht allerdings noch aus: Entscheidend werden lieferbare Ascend-960- und Atlas-960E-Systeme sein, messbarer Trainingsdurchsatz und tatsächliche Auslastung auf realen Workloads, nutzbare Software-Werkzeuge, Zuverlässigkeit im großen Maßstab sowie die Fähigkeit zur Produktion in hohen Stückzahlen. Bis dahin bleiben das 4.096-NPU-SuperPoD und der Million-NPU-Supercluster ambitionierte Architekturziele, nicht unabhängig demonstrierte Ergebnisse. 9
11
18
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Huawei zufolge kann der Atlas 960E pro SuperPoD bis zu 4.096 NPUs über eine einheitliche Speicheradressierung verbinden; genannt werden 8 EFLOPS bei FP8 oder 16 EFLOPS bei FP4.
Huawei zufolge kann der Atlas 960E pro SuperPoD bis zu 4.096 NPUs über eine einheitliche Speicheradressierung verbinden; genannt werden 8 EFLOPS bei FP8 oder 16 EFLOPS bei FP4. UnifiedBus soll mehr als zehn Interconnect Protokolle unter einem gemeinsamen Protokoll und einer einheitlichen Speichersemantik bündeln.
Der Ascend 960DT ist für das erste Quartal 2027 angekündigt, der Ascend 960PR für das dritte Quartal 2027 – beide früher als in Huaweis bisheriger Roadmap vorgesehen.