긴 문서를 다루거나 여러 단계를 거쳐 작업하는 AI 에이전트는 추론 과정에서 이전 문맥을 재사용하기 위한 키·값(KV) 캐시를 쌓는다. 이 데이터가 많아지면 NPU 가까이에 있는 칩 내부 메모리와 DRAM만으로는 필요한 문맥을 모두 유지하기 어렵다. 화웨이의 OceanStor M900은 여기에 SSD 기반 공유 캐시 계층을 더하는 방식으로 용량 문제를 풀겠다는 제품이다. SSD가 가장 빠른 메모리를 대체하는 것이 아니라, 더 많은 문맥을 저장하고 재사용할 수 있게 하는 구상이다.
8
10
12
‘NPU당 TB급’은 무엇을 뜻하나
화웨이에 따르면 링취(Lingqu·UnifiedBus) 인터커넥트가 여러 NPU가 사용하는 KV 캐시를 SuperPoD 안에서 공유하고, 칩 내부 메모리·DRAM·SSD에 나눠 배치한다. 화웨이는 클러스터당 최대 64PB의 용량을 제공하며, NPU 한 대가 이용할 수 있는 KV 캐시 용량을 GB급에서 TB급으로 넓힌다고 주장한다. 여기서 TB급은 공유된 다단계 저장공간에 접근할 수 있는 용량을 가리킨다. NPU 칩 안에 TB급 메모리가 새로 생긴다는 의미는 아니다.
8
10
따라서 M900은 연산을 수행하는 NPU나 장치들을 연결하는 인터커넥트를 대신하는 제품이 아니다. 인터커넥트를 통해 접근하는 추론용 문맥 저장 계층에 가깝다. 화웨이는 긴 문맥과 에이전트 중심 작업을 설계 대상으로 제시했고, 업계 보도는 Atlas 960 SuperPoD를 적용 대상으로 언급한다.
12
6
속도 개선 수치, 어디까지 확인됐나
화웨이는 CPU·네트워크 컨트롤러·NAND 컨트롤러 기능을 통합해 NPU가 CPU 중계나 프로토콜 변환 없이 SSD에 **한 번의 연결 단계(원홉)**로 접근하도록 했다고 설명한다. 그 결과 접근 지연시간이 **90% 줄어 60마이크로초(μs)**가 됐다는 주장이다. 또 클러스터 전체 합산 대역폭 40TB/s를 제시하며 비교 대상 솔루션보다 1.5배 높다고 밝힌다. 40TB/s는 NPU 한 대에 보장되는 속도가 아니라 클러스터 전체 수치다.
8
‘일반적인 AI 프로그래밍’ 작업에서는 추론 클러스터의 토큰 처리량이 2배, 첫 토큰이 나오기까지 걸리는 시간이 절반이 됐다고 화웨이는 발표했다. 이를 모든 긴 문맥·에이전트 요청에서 같은 개선이 나타난다는 뜻으로 받아들여서는 안 된다.
8
14
SSD 수명과 비용은 별도로 따져야 한다
화웨이에 따르면 KV-Aware 기술은 캐시 데이터의 사용 기간을 예측해 저장 매체별 배치를 조정한다. 회사는 이를 통해 하루 최대 **24회 전체 드라이브 쓰기(DWPD)**를 지원하고, SSD 매체 수명을 16배 늘려 3년간 안정적으로 운영할 수 있다고 주장한다. 교체와 유지보수 부담을 줄이면 추론 비용도 낮아질 수 있다는 설명이지만, 제시된 자료만으로는 토큰당 비용이 실제로 얼마나 절감되는지 확인할 수 없다.
8
핵심은 ‘더 많은 캐시를 이용할 수 있다’는 설계 목표와 ‘대규모 운영에서도 더 빠르고 저렴하다’는 검증 결과를 구분하는 것이다. 실제 작업에서 쓸 수 있는 용량과 캐시 적중률, 여러 NPU가 동시에 접근할 때의 지연시간과 지속 대역폭, 명시된 비교 기준에서의 토큰 처리량, 장기간의 SSD 마모와 총비용을 독립적으로 측정해야 한다. 현재 확인되는 제3자 보도는 화웨이의 성능 수치를 전달하지만 이를 독자적인 시험으로 입증하지는 않는다.
6
14