Lingqu UnifiedBus soll CPUs, KI Beschleuniger und Speicher über physische Server hinweg mit einem gemeinsamen Protokoll verbinden. OceanStor M900 nutzt das Netz für einen gemeinsam verwendeten, mehrstufigen KV Cache – ein Ansatz gegen Speicherengpässe bei der KI Inferenz.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How did Huawei present Lingqu UnifiedBus at Huawei Connect 2026 as the interconnect core of its Agentic AI SuperPoD and SuperCluster archite. Article summary: Huawei presented Lingqu UnifiedBus as the common interconnect for its Agentic AI SuperPoDs and SuperClusters: a way to make processors, memory and storage cooperate across cabinets and clusters, rather than treating each. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Bei großen KI-Systemen reicht es nicht, weitere Beschleuniger hinzuzufügen: Die Prozessoren müssen Daten zügig austauschen können, und für die Inferenz muss genügend Kontextspeicher verfügbar sein. Auf der Huawei Connect 2026 stellte Huawei Lingqu UnifiedBus als Verbindungsnetz für seine Agentic-AI-SuperPoDs und größere SuperCluster vor. Es soll Rechenleistung, Arbeitsspeicher und Speichergeräte über physische Server hinweg zu einem größeren System verbinden. 8
19
21
Nach Huawei-Angaben fasst UnifiedBus mehr als zehn Verbindungsprotokolle unter einem Protokoll mit Speichersemantik zusammen. Direkte Verbindungen zwischen Teilnehmern und Speicherzugriffe über Servergrenzen hinweg sollen CPUs, NPUs – Huaweis KI-Beschleuniger – und weitere Ressourcen enger zusammenarbeiten lassen. Huawei beziffert die Entwicklung der Verbindungsbandbreite mit einem Sprung von der Größenordnung 100 GB/s auf TB/s; die Umlaufzeit einer Datenübertragung soll von etwa 7 auf 2 Mikrosekunden sinken. Das sind Angaben zum Verbindungsnetz, keine gemessenen Beschleunigungen vollständiger KI-Anwendungen. 2
7
19
23
Das ist auch für Huaweis Konzept relevant, die Attention- und Feed-forward-Berechnungen eines Transformer-Modells auf geeignete Ressourcen aufzuteilen. Eine solche Trennung hilft nur, wenn der Transport der Zwischenergebnisse den möglichen Vorteil nicht wieder aufzehrt. Einen bezifferten Leistungsgewinn für die gesamte Anwendung belegen die vorliegenden Informationen nicht. 7
8
In Huaweis Systemkonzept übernimmt Kunpeng 950 allgemeine Rechenaufgaben, Ascend 960 die KI-Berechnung und OceanStor M900 die Bereitstellung von Kontextspeicher für die Inferenz. M900 soll über UnifiedBus einen gemeinsam nutzbaren, mehrstufigen KV-Cache bereitstellen. In diesem Cache liegen Zwischeninformationen, die ein Modell bei der Verarbeitung längerer Eingaben erneut benötigt; Huawei will ihn über Speicher auf dem Chip und DRAM hinaus bis auf SSDs erweitern. 4
21
Dabei geht es um zwei verschiedene Engpässe: Schneller Datenaustausch zwischen Prozessoren verbessert die Kommunikation, ein größerer geteilter KV-Cache erweitert die verfügbare Speicherkapazität. Wie schnell sich auf SSDs ausgelagerter Kontext tatsächlich nutzen lässt, hängt vom gesamten Zugriffsweg ab – nicht allein von der niedrigsten genannten Latenz des Verbindungsnetzes. 7
21
Huawei beschreibt UnifiedBus-Geräte für Verbindungen innerhalb von Racks, zwischen Racks und über Cluster hinweg. Für ein solches Verbindungsgerät werden 176 Ports mit jeweils 1,6 Tbit/s genannt, insgesamt also rund 280 Tbit/s Portkapazität. Diese Summe ist nicht mit der Bandbreite gleichzusetzen, die einem einzelnen Prozessor oder einer KI-Anwendung zur Verfügung steht. 7
19
Für größere Systeme setzt Huawei auch auf optische Verbindungen: Der Atlas 960E SuperPoD nutzt Optik nahe am Chipgehäuse. Für eine vollständig optische UnifiedBus-Konfiguration des TaiShan 950 SuperPoD nennt Huawei eine Unterstützung von bis zu 4.096 NPUs. Die weitergehende Vision reicht zu Clustern mit einer Million NPUs. Das ist ein Skalierungsziel, kein veröffentlichter Benchmark eines Clusters dieser Größe. 2
5
19
Huawei ordnet auch Verbindungstechnik der UBG-Ebene in das Konzept vom Rack bis zum Cluster ein. Aus den vorliegenden Belegen lässt sich jedoch weder die genaue Rolle oder der Einsatzstatus des Atlas 650E bestimmen noch eine konkrete Zahl zu möglichen Kupfereinsparungen absichern. Unabhängige Benchmarks eines vollständigen Clusters, die einen dauerhaften Nutzen der genannten Bandbreiten-, Latenz- und Skalierungswerte beim Training oder bei der Inferenz zeigen, liegen hier ebenfalls nicht vor. UnifiedBus ist daher vorerst als Huaweis integrierter Architekturansatz mit Herstellerangaben zu verstehen – nicht als unabhängig bestätigtes End-to-End-Leistungsergebnis. 7
8
19
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Lingqu UnifiedBus soll CPUs, KI Beschleuniger und Speicher über physische Server hinweg mit einem gemeinsamen Protokoll verbinden.
Lingqu UnifiedBus soll CPUs, KI Beschleuniger und Speicher über physische Server hinweg mit einem gemeinsamen Protokoll verbinden. OceanStor M900 nutzt das Netz für einen gemeinsam verwendeten, mehrstufigen KV Cache – ein Ansatz gegen Speicherengpässe bei der KI Inferenz.
Bandbreite, Latenz und eine mögliche Skalierung auf Millionen NPUs beruhen bislang auf Herstellerangaben und Architekturplänen, nicht auf unabhängigen Benchmarks für vollständige Cluster.