Huawei cho biết OceanStor M900 bổ sung tầng SSD dùng chung cho bộ nhớ đệm KV của SuperPoD, với dung lượng tối đa 64 PB mỗi cụm. Mức bộ nhớ đệm hàng TB mà mỗi NPU có thể sử dụng là dung lượng dùng chung qua nhiều tầng, không phải bộ nhớ mới được gắn trực tiếp lên chip.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Khi AI xử lý ngữ cảnh dài hoặc thực hiện tác vụ qua nhiều bước, quá trình suy luận tạo ra bộ nhớ đệm khóa–giá trị (KV cache) có thể được tái sử dụng. Vấn đề là không phải toàn bộ dữ liệu ấy đều có thể nằm trong bộ nhớ tốc độ cao gần bộ xử lý. OceanStor M900 là cách Huawei đề xuất để nới giới hạn dung lượng: thêm một tầng bộ nhớ đệm trên SSD, được chia sẻ trong hệ thống SuperPoD, thay vì coi SSD là vật thay thế bộ nhớ nhanh nhất của NPU — bộ xử lý chuyên dụng cho AI. 8
10
12
Theo Huawei, mạng liên kết Lingqu (UnifiedBus) cho phép gom bộ nhớ đệm KV để các NPU cùng sử dụng, đồng thời phân tầng dữ liệu giữa bộ nhớ trên chip, DRAM và SSD. Hãng công bố dung lượng tối đa 64 PB mỗi cụm và cho biết dung lượng bộ nhớ đệm KV mà mỗi NPU có thể truy cập tăng từ mức GB lên TB. Điểm cần phân biệt: đây là dung lượng dùng chung qua nhiều tầng, không phải mỗi NPU được bổ sung hàng TB bộ nhớ trên chip. 8
10
Vì vậy, M900 được định vị là hệ thống lưu trữ ngữ cảnh phục vụ suy luận, không phải chip tính toán mới. Nó bổ trợ cho NPU và phụ thuộc vào mạng liên kết để chia sẻ dữ liệu, chứ không thay thế hai thành phần đó. Huawei hướng sản phẩm tới các tác vụ nhiều bước và ngữ cảnh dài; bài viết của Blocks & Files nhắc tới Atlas 960 SuperPoD như một môi trường triển khai mục tiêu. 12
6
Huawei nói thiết kế tích hợp chức năng CPU, bộ điều khiển mạng và bộ điều khiển NAND tạo đường truy cập một chặng từ NPU tới SSD, tránh chuyển tiếp qua CPU và chuyển đổi giao thức. Theo hãng, độ trễ truy cập giảm 90%, còn 60 micro giây. Hãng cũng công bố băng thông tổng hợp 40 TB/giây cho cả cụm, cao gấp 1,5 lần giải pháp được hãng dùng để so sánh — không phải mức băng thông được bảo đảm cho từng NPU. 8
Trong một tải công việc mà Huawei gọi là “lập trình AI điển hình”, hãng cho biết thông lượng token của cụm suy luận tăng gấp đôi và thời gian chờ token đầu tiên giảm một nửa. Không nên suy rộng các kết quả này cho mọi yêu cầu có ngữ cảnh dài hay nhiều bước. 8
14
Huawei cho biết cơ chế KV-Aware dự đoán vòng đời dữ liệu đệm để điều phối vị trí lưu trữ. Hãng tuyên bố hỗ trợ tối đa 24 lần ghi đầy ổ mỗi ngày (DWPD), kéo dài tuổi thọ SSD 16 lần và duy trì hoạt động ổn định trong ba năm. Lập luận của hãng là giảm thay ổ và công bảo trì sẽ giúp hạ chi phí suy luận; tài liệu được dẫn chưa đưa ra mức tiết kiệm chi phí trên mỗi token đã đo lường. 8
Khác biệt cốt lõi nằm ở dung lượng bộ nhớ đệm có thể truy cập lớn hơn so với hiệu quả nhanh hơn, rẻ hơn đã được chứng minh ở quy mô lớn. Để xác nhận các tuyên bố sau, cần thử nghiệm độc lập về dung lượng thực dùng và tỷ lệ truy xuất trúng bộ nhớ đệm, độ trễ và băng thông khi nhiều tác vụ cùng tranh tài nguyên, kết quả token so với một mốc đối chiếu rõ ràng, cũng như độ hao mòn SSD và tổng chi phí theo thời gian. Các bài viết bên thứ ba hiện dẫn lại số liệu hiệu năng của Huawei, chưa tự kiểm chứng chúng. 6
14
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Huawei cho biết OceanStor M900 bổ sung tầng SSD dùng chung cho bộ nhớ đệm KV của SuperPoD, với dung lượng tối đa 64 PB mỗi cụm.
Huawei cho biết OceanStor M900 bổ sung tầng SSD dùng chung cho bộ nhớ đệm KV của SuperPoD, với dung lượng tối đa 64 PB mỗi cụm. Mức bộ nhớ đệm hàng TB mà mỗi NPU có thể sử dụng là dung lượng dùng chung qua nhiều tầng, không phải bộ nhớ mới được gắn trực tiếp lên chip.
Các tuyên bố về độ trễ, thông lượng và tuổi thọ SSD đến từ Huawei; cần thử nghiệm độc lập để xác định hiệu quả trên tải công việc thực tế.