화웨이는 Atlas 960E SuperPoD 한 대가 통합 메모리 주소 지정을 통해 최대 4,096개 NPU로 확장되며, FP8 기준 8 엑사플롭스, FP4 기준 16 엑사플롭스를 제공한다고 주장한다. UnifiedBus는 10개가 넘는 인터커넥트 프로토콜을 하나의 프로토콜·메모리 시맨틱으로 통합해 데이터 이동 대기 시간을 줄이겠다는 설계다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: How is Huawei’s new AI computing architecture—centered on the near-packaged-optics Atlas 960E SuperPoD, Ascend 960 chips, and UnifiedBus int. Article summary: Huawei’s approach is to treat communication and memory access—not just accelerator throughput—as the limiting resource in giant AI clusters. It combines tightly coupled Ascend NPUs, a single UnifiedBus protocol and memor. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
대규모 AI 학습에서 병목은 가속기 칩의 연산 성능만이 아니다. 수천 개 프로세서 사이에서 파라미터, 활성화값, 캐시, 메모리 접근을 얼마나 빠르게 주고받느냐가 실제 학습 효율을 좌우할 수 있다. 화웨이가 공개한 Atlas 960E SuperPoD, Ascend 960 로드맵, UnifiedBus는 바로 이 지점에 초점을 맞춘 AI 인프라 전략이다.
다만 성능과 효율 수치는 대부분 화웨이의 제품 발표 기반 주장이다. 독립 기관이 동일 조건에서 검증한 벤치마크로 받아들이기에는 아직 이르다. 9
18
일반적인 대규모 클러스터에서는 CPU, AI 가속기, 스토리지, 메모리가 여러 프로토콜로 연결된 별도 자원처럼 동작한다. 화웨이는 UnifiedBus가 10개가 넘는 인터커넥트 프로토콜을 하나의 프로토콜과 메모리 시맨틱으로 통합하고, CPU·NPU·메모리·SSD 사이의 직접 피어투피어 접근을 지원한다고 설명한다. 18
목표는 데이터 복사와 노드 간 명시적 조정에 드는 시간을 줄이는 것이다. UnifiedBus의 전역 통합 메모리 주소 지정이 적용된 SuperPoD에서는 소프트웨어가 여러 노드에 흩어진 메모리를 하나의 주소 공간처럼 다룰 수 있다. 단일 가속기의 로컬 메모리에 모델과 중간 데이터가 모두 들어가지 않는 워크로드에서, 분산 메모리를 공동 자원처럼 활용하려는 접근이다. 18
화웨이는 이 설계가 인터커넥트 성능을 약 100GB/s급에서 TB/s급으로 높이고, 왕복 지연시간(RTT)은 약 7마이크로초에서 2마이크로초로 낮춘다고 주장한다. 이는 UnifiedBus 목표 아키텍처에 관한 수치이며, 경쟁 제품과의 일반적·독립적 비교 결과는 아니다. 18
Atlas 960E SuperPoD는 차세대 Ascend 960 프로세서, UnifiedBus, 그리고 화웨이의 Hi-ONE 근접 패키지드 광학(NPO·Near-Packaged Optics) 엔진을 결합한다. 화웨이는 이 제품을 액체 냉각 방식의 NPO 기반 SuperPoD로 소개하며, 최대 10조 파라미터 모델의 학습과 추론을 겨냥한다고 밝혔다. 9
화웨이가 제시한 대표 구성은 다음과 같다.
NPO는 대역폭과 클러스터 규모가 커질수록 전기적 연결을 확장하기 어려워진다는 문제를 겨냥한다. 화웨이에 따르면 Hi-ONE 광학 엔진 하나는 7.2Tbit/s를 제공한다. 4,096-NPU 구성에서는 Hi-ONE 약 5,500개로 기존 800G 광 모듈 약 4만8,000개를 대체해 전력 사용량을 550kW 이상 줄이고, 가용성을 99.8%로 높일 수 있다는 설명이다. 이 역시 화웨이가 자사 설계를 대상으로 제시한 전망치다. 9
화웨이는 클러스터의 물리적 계층별로 연결 제품군도 제시했다.
초대형 SuperPoD가 필요하지 않은 조직을 위해서는 Atlas 650E도 내놨다. UnifiedBus Link 2.0 기반의 16-NPU 풀메시 구성으로, 화웨이는 NPU 내장 메모리 읽기·쓰기 대역폭을 최대 4.0TB/s, 16-NPU 서버당 UB Link 대역폭을 13.4TB/s로 제시한다. 20
화웨이는 Ascend 960 개발이 기대를 뛰어넘었고 계획 대비 성능이 두 배가 됐다고 밝혔지만, 이를 검증할 수 있는 상세한 독립 벤치마크는 공개하지 않았다. 11
공개된 일정은 다음과 같다.
화웨이는 이전 세대인 Atlas 950 SuperPod 시스템이 이미 대규모 상용 환경에서 쓰이고 있다고도 밝혔다. 그러나 이는 차세대 Ascend 960 기반 Atlas 960E가 이미 배치됐다는 뜻은 아니다. 3
9
UnifiedBus는 많은 가속기 간 데이터 공급과 통신을 빠르게 해, 규모를 키웠을 때 연산 성능이 동기화 대기로 낭비되지 않도록 하려는 시스템 수준의 인터커넥트다. 이런 문제의식은 엔비디아의 NVLink가 해결하려는 과제와 닮아 있다.
화웨이가 내세우는 차별점은 프로토콜의 광범위한 통합, SuperPoD 내부의 전역 메모리 주소 지정, 이기종 부품 간 직접 접근, SuperPoD 규모에서의 NPO 통합이다. 18
9
하지만 현재 공개된 자료만으로 UnifiedBus와 NVLink의 대역폭, 지연시간, 소프트웨어 성숙도, 신뢰성, 비용, 실제 학습 처리량을 같은 조건에서 비교할 수는 없다. 또한 UnifiedBus는 화웨이 자체 아키텍처 및 제품 생태계로 제시되고 있어, 개방형 가속기 연결 표준과 같은 거버넌스나 멀티벤더 상호운용성을 갖췄다는 근거도 없다. 18
이번 발표가 주목받는 이유는 화웨이가 AI 인프라 전략의 중심을 개별 칩 성능이 아니라 인터커넥트, 광학, 네트워크 토폴로지, 메모리 시맨틱을 아우르는 시스템 설계에 뒀기 때문이다. 통신 지연과 메모리 용량이 가속기 연산 성능만큼 중요한 워크로드라면 이 접근은 전략적 가치가 있을 수 있다.
다만 승부는 제품 출하 이후에 판가름 난다. Ascend 960과 Atlas 960E의 실제 공급, 실사용 워크로드에서의 학습 처리량과 가속기 활용률, 개발 도구의 완성도, 대규모 환경의 안정성, 물량 공급 능력이 검증돼야 한다. 그 전까지 4,096-NPU SuperPoD와 100만-NPU SuperCluster는 독립적으로 입증된 성과라기보다 야심 찬 아키텍처 목표로 보는 것이 타당하다. 9
11
18
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
화웨이는 Atlas 960E SuperPoD 한 대가 통합 메모리 주소 지정을 통해 최대 4,096개 NPU로 확장되며, FP8 기준 8 엑사플롭스, FP4 기준 16 엑사플롭스를 제공한다고 주장한다.
화웨이는 Atlas 960E SuperPoD 한 대가 통합 메모리 주소 지정을 통해 최대 4,096개 NPU로 확장되며, FP8 기준 8 엑사플롭스, FP4 기준 16 엑사플롭스를 제공한다고 주장한다. UnifiedBus는 10개가 넘는 인터커넥트 프로토콜을 하나의 프로토콜·메모리 시맨틱으로 통합해 데이터 이동 대기 시간을 줄이겠다는 설계다.
Ascend 960DT는 2027년 1분기, Ascend 960PR은 2027년 3분기 출시 예정이며, 각각 기존 화웨이 로드맵보다 앞당겨졌다.