Tại HUAWEI CONNECT 2026, Huawei giới thiệu OceanStor M900, tầng KV Cache dùng chung cho SuperPoD AI inference hyperscale, với dung lượng tối đa 64 PB mỗi cụm. M900 dùng Lingqu UnifiedBus để gộp và phân tầng KV Cache từ bộ nhớ accelerator, DRAM đến SSD, nhắm vào ngữ cảnh cực dài và suy luận AI agent nhiều lượt.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Huawei announce at Huawei Connect 2026 about its OceanStor M900 AI memory storage for hyperscale inference SuperPoDs, including how. Article summary: Huawei announced OceanStor M900 Context Memory Storage: an SSD-backed, shared KV-cache tier for hyperscale AI inference SuperPoDs. It is intended to extend—not replace—accelerators’ HBM/DRAM or the SuperPoD interconnect:. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei đã giới thiệu OceanStor M900 Context Memory Storage như một hạ tầng lưu trữ phục vụ AI inference trong các trung tâm dữ liệu hyperscale. Đây không phải sản phẩm thay thế HBM hay DRAM trên accelerator, mà là một tầng bộ nhớ ngữ cảnh dùng chung, có thể mở rộng cho SuperPoD — nơi KV Cache dễ trở thành nút thắt khi mô hình phải xử lý prompt rất dài hoặc chuỗi tác vụ AI agent nhiều bước. 2
23
Trong quá trình suy luận của mô hình ngôn ngữ lớn, KV Cache lưu trạng thái trung gian của các token đã được xử lý. Nếu có thể tái sử dụng cache này ở các lượt hội thoại sau hoặc trong các tác vụ agent liên quan, hệ thống không cần tính lại toàn bộ ngữ cảnh từ đầu.
Theo cách Huawei mô tả, dung lượng bộ nhớ trên chip và DRAM sẽ dần không đủ hiệu quả về quy mô lẫn chi phí khi phải phục vụ cửa sổ ngữ cảnh cực dài và inference nhiều lượt. OceanStor M900 sử dụng UnifiedBus, còn được Huawei gọi là Lingqu, để tạo một KV Cache toàn cục, đa tầng ở quy mô petabyte với kết nối một chặng; cache được mở rộng từ bộ nhớ accelerator và DRAM sang SSD. 2
26
Nói ngắn gọn, M900 hướng tới việc giữ lại, chia sẻ và tái sử dụng nhiều ngữ cảnh hơn mà không buộc mọi dữ liệu phải nằm cố định trong các tầng bộ nhớ đắt tiền nhất.
Huawei cho biết một cụm M900 có thể cung cấp tới 64 PB KV Cache. Hãng cũng nói dung lượng KV Cache khả dụng trên mỗi NPU có thể tăng từ cấp gigabyte lên cấp terabyte, qua đó tăng tỷ lệ cache hit đối với các yêu cầu dùng ngữ cảnh dài. 2
26
Điểm cần lưu ý: đây là kiến trúc bộ nhớ dùng chung ở quy mô SuperPoD, không phải việc tăng dung lượng HBM cục bộ của một con chip. Giá trị thực tế sẽ phụ thuộc vào cách phần mềm phân bổ, truy xuất và tái sử dụng KV Cache, cũng như cơ cấu yêu cầu thực tế tại từng hệ thống triển khai.
Huawei cho biết M900 tích hợp CPU, bộ điều khiển mạng và bộ điều khiển NAND vào một kiến trúc. Cách tiếp cận này được hãng mô tả là cung cấp ngữ nghĩa KV gốc (native KV semantics), đồng thời cho phép NPU truy cập SSD theo đường một chặng, không cần chuyển đổi giao thức hay chuyển tiếp qua CPU. 20
26
Các chỉ số Huawei công bố gồm:
Đây đều là số liệu do nhà cung cấp đưa ra. Thông báo hiện không nêu đầy đủ mô hình thử nghiệm, mức đồng thời, tỷ lệ cache hit, cấu hình cụm hay phương pháp so sánh. Vì vậy, benchmark độc lập trên workload production đại diện mới có thể cho thấy hiệu quả vận hành thực tế.
Trong một kịch bản AI coding inference điển hình, Huawei cho biết M900 có thể đạt gấp đôi thông lượng token và giảm một nửa thời gian đến token đầu tiên (TTFT). 14 Tuy nhiên, khi chưa có thông tin đầy đủ về baseline và workload, không thể suy rộng các kết quả này cho mọi mô hình hay toàn bộ stack inference.
Huawei cũng giới thiệu cơ chế KV-aware adaptive storage, tức logic đặt dữ liệu dựa trên giá trị và vòng đời của cache để chọn loại phương tiện lưu trữ phù hợp. Hãng tuyên bố hệ thống hỗ trợ tới 24 DWPD và có thể cải thiện khoảng 16 lần tuổi thọ đọc/ghi của SSD nhờ phương tiện lai cùng thuật toán retention tối ưu. 16
18
Tương tự chỉ số hiệu năng, độ bền SSD cần được xác minh trong điều kiện ghi thực tế, với chính sách quản lý cache và cường độ workload tương ứng.
Sự xuất hiện của M900 mang tính tuyên bố kiến trúc nhiều hơn là một màn ra mắt thiết bị lưu trữ độc lập. Huawei mô tả UnifiedBus là liên kết kết nối các cụm và SuperPoD để phục vụ AI agent, trong đó M900 đóng vai trò tầng lưu trữ/bộ nhớ ngữ cảnh của toàn bộ stack. 23
Có thể hình dung các thành phần như sau:
Vì thế, M900 không tự bổ sung năng lực tính toán cho mô hình và cũng không thay thế accelerator hay các kết nối tốc độ cao. Cam kết chính của sản phẩm là giảm nút thắt do áp lực bộ nhớ khi cửa sổ ngữ cảnh lớn và những bước agent lặp lại khiến KV Cache trở nên quan trọng ngang với tài nguyên compute. 2
23
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Tại HUAWEI CONNECT 2026, Huawei giới thiệu OceanStor M900, tầng KV Cache dùng chung cho SuperPoD AI inference hyperscale, với dung lượng tối đa 64 PB mỗi cụm.
Tại HUAWEI CONNECT 2026, Huawei giới thiệu OceanStor M900, tầng KV Cache dùng chung cho SuperPoD AI inference hyperscale, với dung lượng tối đa 64 PB mỗi cụm. M900 dùng Lingqu UnifiedBus để gộp và phân tầng KV Cache từ bộ nhớ accelerator, DRAM đến SSD, nhắm vào ngữ cảnh cực dài và suy luận AI agent nhiều lượt.
Huawei công bố độ trễ khoảng 60 µs, băng thông tổng 40 TB/s và thông lượng token gấp đôi trong một kịch bản AI coding; các số liệu này vẫn cần benchmark độc lập xác thực.