Huawei cho biết một cụm OceanStor M900 có thể cung cấp 64 PB bộ nhớ đệm KV dùng chung; đây không phải dung lượng bộ nhớ nằm trong từng NPU. Các mức trễ truy cập khoảng 60 micro giây và băng thông gộp 40 TB/s là số liệu Huawei công bố, không phải tốc độ được bảo đảm cho mọi yêu cầu.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
OceanStor M900, được Huawei giới thiệu tại HUAWEI CONNECT 2026, là hệ thống lưu trữ ngữ cảnh phục vụ suy luận AI trên SuperPoD — cụm hạ tầng tính toán AI của hãng. Thay vì chỉ giữ dữ liệu cần tái sử dụng trong bộ nhớ gần bộ xử lý, M900 tạo một vùng bộ nhớ đệm có thể chia sẻ khi câu lệnh, cuộc hội thoại và quy trình của tác nhân AI ngày càng dài. 1
9
Trong lúc xử lý câu lệnh, mô hình tạo ra dữ liệu key–value (KV) để phục vụ các bước tính toán tiếp theo. Nếu một yêu cầu mới dùng lại được phần đầu của ngữ cảnh đã xử lý, hệ thống có thể lấy dữ liệu KV tương ứng thay vì tính lại từ đầu. Vấn đề là ngữ cảnh dài và các lượt tương tác liên tiếp làm lượng dữ liệu này tăng lên, trong khi bộ nhớ trên chip và DRAM gần mỗi NPU — bộ xử lý AI — có giới hạn. Huawei thiết kế M900 để mở rộng vùng đệm đó ra toàn SuperPoD. 1
3
6
Thông qua mạng kết nối UnifiedBus, M900 tổ chức bộ nhớ đệm KV theo nhiều tầng: bộ nhớ trên chip, DRAM và ổ SSD. Huawei công bố một cụm có thể cung cấp 64 PB dung lượng KV dùng chung, nâng lượng bộ nhớ đệm mà một NPU có thể truy cập từ mức GB lên mức TB. 64 PB là dung lượng của cụm, không phải bộ nhớ nằm bên trong một NPU. Giữ được nhiều ngữ cảnh hơn có thể tăng cơ hội tái sử dụng, nhưng chỉ khi các yêu cầu thực sự có phần nội dung phù hợp để dùng lại. 3
6
17
Để tầng SSD đáp ứng tác vụ suy luận, Huawei mô tả đường truy cập «một chặng» từ NPU tới SSD. Thiết kế tích hợp chức năng CPU, bộ điều khiển mạng và bộ điều khiển NAND nhằm bỏ bớt các bước chuyển đổi giao thức và chuyển tiếp qua CPU. Hãng công bố độ trễ truy cập khoảng 60 micro giây và băng thông gộp 40 TB/s cho mỗi cụm. Đây là thông số Huawei nêu cho kiến trúc và hệ thống, không có nghĩa mọi lần truy xuất đều đạt các mức đó. 3
6
28
32
Khi yêu cầu dùng lại được dữ liệu KV, hệ thống có thể tạo token đầu tiên sớm hơn và dành ít năng lực tính toán hơn cho việc xử lý lặp lại. Huawei cho biết trong một kịch bản lập trình AI điển hình, kiến trúc này tăng gấp đôi thông lượng token của cụm suy luận và giảm một nửa thời gian chờ token đầu tiên. Không nên áp các mức cải thiện theo tác vụ này cho mọi mô hình hay mọi loại yêu cầu. 28
33
M900 còn dùng cơ chế bố trí dữ liệu có xét đến KV để quyết định dữ liệu đệm được giữ bao lâu trên từng loại phương tiện lưu trữ. Huawei nêu mức chịu ghi SSD lên tới 24 lần dung lượng ổ mỗi ngày, cải thiện tuổi thọ 16 lần và mục tiêu vận hành ổn định trong ba năm. Lập luận về chi phí là giảm tính toán lại và giảm thay ổ, từ đó hạ chi phí cho mỗi token. Tuy nhiên, các tài liệu được cung cấp chưa xác nhận độc lập những kết quả về hiệu năng, tuổi thọ hoặc chi phí này trên các SuperPoD đang vận hành thực tế. 6
8
33
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Huawei cho biết một cụm OceanStor M900 có thể cung cấp 64 PB bộ nhớ đệm KV dùng chung; đây không phải dung lượng bộ nhớ nằm trong từng NPU.
Huawei cho biết một cụm OceanStor M900 có thể cung cấp 64 PB bộ nhớ đệm KV dùng chung; đây không phải dung lượng bộ nhớ nằm trong từng NPU. Các mức trễ truy cập khoảng 60 micro giây và băng thông gộp 40 TB/s là số liệu Huawei công bố, không phải tốc độ được bảo đảm cho mọi yêu cầu.
Lợi ích về tốc độ phản hồi, thông lượng và chi phí phụ thuộc vào khả năng tái sử dụng dữ liệu; các kết quả được nêu chưa được kiểm chứng độc lập trên SuperPoD vận hành thực tế.