AI 시스템을 키울 때는 칩을 더하는 것만으로 충분하지 않다. 칩과 서버 사이에서 데이터를 주고받는 속도, 추론 과정에서 필요한 문맥 정보를 보관할 공간도 중요하다. 화웨이는 ‘화웨이 커넥트 2026’에서 **링취 유니파이드버스(Lingqu UnifiedBus)**를 이 두 과제를 다루는 연결망으로 제시했다. 여러 물리 서버의 연산·메모리·스토리지를 묶어 슈퍼포드와 더 큰 슈퍼클러스터로 확장하겠다는 구상이다. 여기서 슈퍼포드는 여러 서버를 긴밀하게 연결해 하나의 큰 연산 시스템처럼 운용하려는 구성이다.
8
19
21
서버의 경계를 넘는 연결망
화웨이에 따르면 유니파이드버스는 10종이 넘는 연결 프로토콜을 공통 프로토콜로 통합하고, 서버를 가로지르는 메모리 접근을 지원한다. CPU와 AI 연산용 NPU, 메모리·스토리지가 서버별로 고립되지 않도록 자원을 직접 연결하는 방식이다. 화웨이가 제시한 연결 대역폭은 기존 초당 100GB 수준에서 초당 TB 수준으로, 왕복 지연시간은 약 7마이크로초에서 2마이크로초로 바뀐다. 이는 연결망에 관해 보고된 수치이지, AI 애플리케이션이 그만큼 빨라졌다는 측정 결과는 아니다.
2
7
19
23
이 속도는 트랜스포머 모델의 어텐션(Attention) 연산과 피드포워드 네트워크(FFN) 연산을 분리해 적합한 자원에 배치하려는 설계와도 맞닿아 있다. 연산을 나눠도 중간 데이터를 옮기는 데 시간이 많이 들면 이점이 줄어든다. 공개 자료는 이런 설계 의도를 설명하지만, 전체 작업에서 얻는 성능 향상을 수치로 입증하지는 않는다.
7
8
연결 속도와 문맥 저장 용량은 다른 문제
화웨이가 제시한 구성에서 쿤펑 950은 범용 연산, 어센드 960은 AI 연산을 맡고, OceanStor M900은 추론에 쓰이는 문맥 정보를 저장한다. M900은 유니파이드버스로 KV 캐시를 공유하는 저장 공간을 구성한다. KV 캐시는 모델이 앞서 처리한 내용을 추론에 활용할 수 있도록 보관하는 데이터다. 화웨이는 캐시의 저장 계층을 칩 내 메모리와 DRAM에서 SSD까지 넓혀 용량 한계를 완화하겠다고 설명한다.
4
21
따라서 프로세서 사이의 빠른 통신과 더 큰 KV 캐시 공간은 서로 보완하지만 같은 성능 지표는 아니다. SSD에 보관된 문맥 정보에 접근하는 실제 속도는 연결망 지연시간 하나가 아니라 전체 경로의 성능에 달려 있다.
7
21
캐비닛에서 광 연결 클러스터까지
화웨이는 캐비닛 내부, 캐비닛 사이, 클러스터 사이를 잇는 유니파이드버스 장비를 제시했다. 보도된 캐비닛 간 연결 장비의 사양은 포트 176개, 포트당 1.6Tbit/s로, 포트 용량을 합하면 약 280Tbit/s다. 이는 장비의 합산 포트 용량이며 개별 프로세서나 AI 작업에 보장되는 대역폭은 아니다.
7
19
더 큰 구성에는 광 연결 기술이 쓰인다. Atlas 960E 슈퍼포드는 광학 부품을 칩 패키지 가까이에 배치하는 근접 패키지 광학(NPO)을 채택했다. 화웨이는 전광 유니파이드버스를 적용한 TaiShan 950 슈퍼포드가 최대 4,096개의 NPU를 지원한다고 밝힌다. 장기적으로 제시한 ‘NPU 100만 개 규모 클러스터’는 확장 목표이지, 해당 규모에서 성능을 검증한 벤치마크가 아니다.
2
5
19
아직 확인되지 않은 것
화웨이는 UBG 연결 장비도 캐비닛에서 클러스터로 이어지는 구성의 일부로 제시한다. 그러나 제공된 자료만으로는 Atlas 650E의 정확한 역할이나 배치 상태, 구리 케이블 절감량을 특정할 수 없다. 공개된 지연시간·대역폭·규모 수치가 실제 학습 또는 추론 작업에서 지속적인 성능 향상으로 이어지는지 보여주는 독립적인 전체 클러스터 벤치마크도 없다. 현재로서는 유니파이드버스를 검증된 최종 성능 결과보다 화웨이의 통합 설계와 공개 사양으로 이해하는 편이 정확하다.
7
8
19