Huawei deklaruje, że Atlas 960E obsłuży jednolite adresowanie pamięci w konfiguracji do 4096 NPU oraz zapewni 8 EFLOPS FP8 lub 16 EFLOPS FP4 na SuperPoD. UnifiedBus ma łączyć ponad 10 protokołów komunikacyjnych w jedną strukturę o wspólnej semantyce pamięci.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is Huawei’s new AI computing architecture—centered on the near-packaged-optics Atlas 960E SuperPoD, Ascend 960 chips, and UnifiedBus int. Article summary: Huawei’s approach is to treat communication and memory access—not just accelerator throughput—as the limiting resource in giant AI clusters. It combines tightly coupled Ascend NPUs, a single UnifiedBus protocol and memor. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Największym problemem w treningu modeli AI nie zawsze jest już sama wydajność obliczeniowa akceleratorów. Przy tysiącach układów równie ważne staje się przesyłanie parametrów, aktywacji, pamięci podręcznych i danych między procesorami. Huawei buduje wokół tej tezy swoją nową infrastrukturę: Atlas 960E SuperPoD, planowane układy Ascend 960 oraz interkonekt UnifiedBus. Warto jednak pamiętać, że podawane osiągi i wskaźniki efektywności są deklaracjami producenta, a nie niezależnie zweryfikowanymi wynikami testów. 9
18
W typowym dużym klastrze procesory, akceleratory, pamięć i magazyny danych są osobnymi zasobami połączonymi przez różne protokoły. Huawei twierdzi, że UnifiedBus scala ponad 10 takich protokołów w jeden protokół i wspólną semantykę pamięci. Ma to umożliwiać bezpośredni dostęp peer-to-peer między CPU, NPU, pamięcią i dyskami SSD. 18
W praktyce chodzi o ograniczenie oczekiwania na dane. Zamiast wielokrotnie kopiować je między odizolowanymi węzłami albo ręcznie koordynować przesyłanie, oprogramowanie ma móc adresować pamięć w całym SuperPoD jak w jednolitej, globalnej przestrzeni. Według Huawei może to ułatwić wykorzystanie rozproszonej pamięci jako wspólnej puli, gdy model i dane pośrednie nie mieszczą się w pamięci lokalnej pojedynczego akceleratora. 18
Firma deklaruje wzrost możliwości interkonektu z poziomu około 100 GB/s do poziomu TB/s oraz skrócenie opóźnienia transmisji w obie strony (RTT) z około 7 do 2 mikrosekund. Są to parametry projektowanej architektury UnifiedBus, a nie niezależne porównanie z konkurencyjnymi systemami. 18
Atlas 960E SuperPoD łączy przyszłe procesory Ascend 960, UnifiedBus i silnik Hi-ONE wykorzystujący technologię NPO (near-packaged optics), czyli rozwiązanie optyczne umieszczone blisko układów. Huawei opisuje w pełni chłodzony cieczą system jako SuperPoD oparty na NPO, przeznaczony do treningu i inferencji modeli liczących do 10 bilionów parametrów. 9
Deklarowana konfiguracja obejmuje 4096 NPU ze wspólnym adresowaniem pamięci i ma oferować 8 EFLOPS przy FP8 albo 16 EFLOPS przy FP4. 9
NPO ma być kluczowe, ponieważ przy wzroście przepustowości i wielkości klastra coraz trudniej skalować połączenia elektryczne. Huawei podaje, że pojedynczy silnik optyczny Hi-ONE oferuje 7,2 Tbit/s. W projektowanym systemie z 4096 NPU około 5500 silników Hi-ONE miałoby zastąpić mniej więcej 48 000 klasycznych modułów optycznych 800G. Według firmy obniżyłoby to zużycie energii o ponad 550 kW i podniosło dostępność do 99,8%. To prognozy Huawei dotyczące własnej konstrukcji. 9
Huawei zapowiada też komponenty dla różnych poziomów fizycznej infrastruktury:
Dla firm, które nie potrzebują infrastruktury klasy SuperPoD, Huawei oferuje Atlas 650E: mniejszą konfigurację full-mesh z 16 NPU, opartą na UnifiedBus Link 2.0. Producent podaje do 4,0 TB/s przepustowości odczytu i zapisu pamięci na układzie oraz 13,4 TB/s przepustowości UB Link na serwer z 16 NPU. 20
Huawei twierdzi, że rozwój Ascend 960 przekroczył wewnętrzne oczekiwania firmy, a zakładana wydajność została podwojona. Nie opublikowano jednak szczegółowych, niezależnych benchmarków, które pozwoliłyby zweryfikować tę deklarację. 11
Zapowiedziany harmonogram wygląda następująco:
Huawei informował również, że systemy wcześniejszej generacji Atlas 950 SuperPod są już używane komercyjnie na dużą skalę. Nie należy jednak utożsamiać tego z wdrożeniem sprzętu Atlas 960E, który jest powiązany z nadchodzącą generacją Ascend 960. 3
9
UnifiedBus można rozumieć jako systemową odpowiedź Huawei na ten sam problem, który rozwiązują interkonekty akceleratorów, takie jak Nvidia NVLink: jak dostarczać dane wielu akceleratorom i umożliwić im szybką komunikację, aby zwiększanie skali przekładało się na użyteczną moc obliczeniową, a nie na narzut synchronizacji.
Wyróżnikami wskazywanymi przez Huawei są szersze ujednolicenie protokołów, globalne adresowanie pamięci wewnątrz SuperPoD, bezpośredni dostęp między różnymi typami komponentów oraz integracja NPO na poziomie SuperPoD. 18
9
Dostępne materiały nie pozwalają jednak na bezpośrednie porównanie UnifiedBus i NVLink pod względem przepustowości, opóźnień, dojrzałości oprogramowania, niezawodności, kosztu czy rzeczywistej przepustowości treningu. Nie wynika z nich też, by UnifiedBus był otwartym standardem wielodostawcowym, porównywalnym pod względem zasad współpracy i interoperacyjności z otwartymi inicjatywami dla łączy akceleratorowych. UnifiedBus jest przedstawiany jako architektura i ekosystem produktowy Huawei. 18
Znaczenie tej zapowiedzi polega na postawieniu projektu całego systemu — interkonektu, optyki, topologii i semantyki pamięci — w centrum strategii infrastruktury AI. To może być istotne tam, gdzie ograniczeniem są komunikacja i pojemność pamięci, a nie wyłącznie moc pojedynczego układu.
O skuteczności pomysłu przesądzą dopiero kolejne etapy: dostawy Ascend 960 i Atlas 960E, mierzalna wydajność treningu oraz wykorzystanie zasobów w realnych zadaniach, użyteczne narzędzia programistyczne, niezawodność w dużej skali i zdolność do produkcji takich systemów w odpowiednim wolumenie. Do tego czasu SuperPoD z 4096 NPU oraz SuperCluster z milionem NPU należy traktować jako ambitne cele architektoniczne, a nie niezależnie potwierdzone rezultaty. 9
11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei deklaruje, że Atlas 960E obsłuży jednolite adresowanie pamięci w konfiguracji do 4096 NPU oraz zapewni 8 EFLOPS FP8 lub 16 EFLOPS FP4 na SuperPoD.
Huawei deklaruje, że Atlas 960E obsłuży jednolite adresowanie pamięci w konfiguracji do 4096 NPU oraz zapewni 8 EFLOPS FP8 lub 16 EFLOPS FP4 na SuperPoD. UnifiedBus ma łączyć ponad 10 protokołów komunikacyjnych w jedną strukturę o wspólnej semantyce pamięci.
Ascend 960DT ma trafić na rynek w I kwartale 2027 r., a Ascend 960PR w III kwartale 2027 r.