OceanStor M900은 SuperPoD의 KV 캐시를 칩 메모리·DRAM에서 공유 SSD 저장 공간까지 확장하며, 화웨이는 클러스터당 64PB 용량을 제시한다. 화웨이가 밝힌 약 60마이크로초 접근 지연과 클러스터 전체 40TB/s 대역폭은 모든 요청에서 보장되는 속도가 아니다.
OceanStor M900은 SuperPoD의 KV 캐시를 칩 메모리·DRAM에서 공유 SSD 저장 공간까지 확장하며, 화웨이는 클러스터당 64PB 용량을 제시한다.
화웨이가 밝힌 약 60마이크로초 접근 지연과 클러스터 전체 40TB/s 대역폭은 모든 요청에서 보장되는 속도가 아니다.
What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its UnifiAI-generated illustration; not a photograph of the OceanStor M900.
AI 프롬프트
Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
openai.com
화웨이가 HUAWEI CONNECT 2026에서 공개한 OceanStor M900은 대규모 AI 추론 시스템인 SuperPoD를 위한 ‘문맥 메모리’ 저장 장치다. 대화가 길어지고 AI 에이전트가 여러 차례 작업을 주고받을 때, 이미 계산한 내용을 더 많이 보관하고 여러 연산 장치가 다시 쓸 수 있게 하는 것이 핵심이다. 19
64PB는 어디에 저장되나
AI 모델의 KV(키·값) 캐시는 입력을 처리하면서 계산한 정보를 담는다. 새 요청에서 재사용할 수 있는 입력 부분이 있다면 같은 계산을 반복하지 않아도 된다. 하지만 긴 문맥과 반복적인 에이전트 작업에서 생기는 캐시를 신경망처리장치(NPU) 가까이의 메모리에만 담기는 어렵다. 136
M900은 화웨이의 UnifiedBus 네트워크를 이용해 칩 내부 메모리, DRAM, SSD에 걸친 KV 캐시를 묶어 공유한다. 화웨이는 클러스터 한 개가 64PB의 KV 캐시 용량을 제공하고, NPU 한 개가 접근할 수 있는 캐시 규모도 GB급에서 TB급으로 커진다고 설명한다. 64PB는 NPU 내부 메모리 용량이 아니라 클러스터 전체의 공유 저장 용량이다. 더 많은 문맥을 남겨두면 재사용 기회가 늘 수 있지만, 실제 효과는 요청 간에 재사용 가능한 부분이 얼마나 겹치는지에 달려 있다. 3617
SSD까지 빠르게 접근하는 방법
SSD를 추론용 캐시 계층으로 쓰려면 용량뿐 아니라 접근 속도도 중요하다. 화웨이는 CPU·네트워크 컨트롤러·NAND 컨트롤러 기능을 통합해 SuperPoD의 NPU에서 SSD까지 중간 단계를 줄인 ‘원홉’ 접근 경로를 제시한다. 기존 방식의 일부 프로토콜 변환과 CPU 경유 과정을 피한다는 설명이다. 회사가 밝힌 수치는 약 60마이크로초의 접근 지연과 클러스터 전체 40TB/s의 합산 대역폭이다. 이 수치가 개별 캐시 조회나 모든 요청의 속도를 뜻하지는 않는다. 362832
추론 속도와 비용, 어디까지 확인됐나
요청이 저장된 캐시를 활용하면 첫 토큰이 나올 때까지 걸리는 시간을 줄이고, 반복 계산에 쓰일 자원을 다른 토큰 생성에 돌릴 수 있다. 화웨이는 전형적인 AI 코딩 작업에서 추론 클러스터의 토큰 처리량이 두 배가 되고 첫 토큰 생성 시간은 절반으로 줄었다고 주장한다. 특정 작업에서 제시한 결과인 만큼 모든 모델이나 요청에 적용되는 성능 향상으로 받아들여서는 안 된다. 2833
화웨이는 KV 캐시 데이터가 각 저장 매체에 머무는 기간을 조절하는 배치 방식도 설명한다. SSD에 대해 하루 최대 24회 드라이브 전체 용량 쓰기(24 DWPD), 수명 16배 향상, 3년 안정 운영 목표를 제시했다. 반복 계산과 저장 장치 교체를 줄여 토큰당 추론 비용을 낮추겠다는 구상이다. 다만 제공된 자료만으로는 실제 운영 중인 SuperPoD에서 이러한 성능·수명·비용 효과가 독립적으로 검증됐다고 볼 수 없다. 6833
Studio Global AI
연구를 계속하세요
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
"화웨이 OceanStor M900, AI 추론용 ‘공유 KV 캐시’는 어떻게 작동하나"에 대한 짧은 대답은 무엇입니까?
OceanStor M900은 SuperPoD의 KV 캐시를 칩 메모리·DRAM에서 공유 SSD 저장 공간까지 확장하며, 화웨이는 클러스터당 64PB 용량을 제시한다.
먼저 검증할 핵심 포인트는 무엇인가요?
OceanStor M900은 SuperPoD의 KV 캐시를 칩 메모리·DRAM에서 공유 SSD 저장 공간까지 확장하며, 화웨이는 클러스터당 64PB 용량을 제시한다. 화웨이가 밝힌 약 60마이크로초 접근 지연과 클러스터 전체 40TB/s 대역폭은 모든 요청에서 보장되는 속도가 아니다.