OceanStor M900 estende la cache KV dei SuperPoD dalla memoria sul chip e dalla DRAM agli SSD, con una capacità dichiarata di 64 PB per cluster. Huawei indica circa 60 microsecondi di latenza d’accesso e 40 TB/s di banda aggregata: non sono valori garantiti per ogni richiesta.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Presentato a HUAWEI CONNECT 2026, OceanStor M900 è il sistema di archiviazione del contesto che Huawei propone per l’inferenza IA nei suoi SuperPoD, cluster di acceleratori progettati per lavorare insieme. L’obiettivo è mantenere disponibile più contesto riutilizzabile quando le richieste diventano lunghe e gli agenti IA affrontano interazioni ripetute. 1
9
La cache key–value (KV) conserva risultati calcolati dal modello durante l’elaborazione di un prompt. Se una nuova richiesta può riutilizzare una parte iniziale già elaborata, il sistema evita di calcolarla di nuovo. Con contesti lunghi e conversazioni a più passaggi, questa possibilità diventa più utile, ma la cache è anche più difficile da contenere nella memoria vicina a ogni NPU, l’acceleratore impiegato per l’inferenza. M900 punta a renderla accessibile e condivisibile nell’intero SuperPoD. 1
3
6
Attraverso la rete UnifiedBus, Huawei organizza la cache KV su più livelli: memoria sul chip, DRAM e SSD. Secondo l’azienda, un singolo cluster può offrire 64 PB di capacità e portare la cache accessibile a una NPU dall’ordine dei gigabyte a quello dei terabyte. I 64 PB riguardano il cluster condiviso, non la memoria interna di una singola NPU. Conservare più contesto può aumentare le occasioni di riutilizzo, ma il vantaggio effettivo dipende da quante richieste condividono parti già presenti nella cache. 3
6
17
Per rendere utile anche il livello SSD durante l’inferenza, Huawei descrive un percorso di accesso in un solo passaggio tra la NPU del SuperPoD e gli SSD. Il progetto integra funzioni di CPU, controller di rete e controller NAND per evitare alcuni passaggi di conversione del protocollo e inoltro tramite CPU. L’azienda dichiara una latenza d’accesso di circa 60 microsecondi e 40 TB/s di banda aggregata per cluster: sono dati riferiti all’architettura e al sistema, non una promessa sulla velocità di ogni singolo accesso. 3
6
28
32
Quando una richiesta trova nella cache una parte del lavoro già svolto, il primo token della risposta può arrivare prima; evitare calcoli ripetuti può anche liberare capacità per generare più token. Huawei afferma che, in un tipico scenario di programmazione assistita dall’IA, l’architettura ha raddoppiato il numero di token prodotti dal cluster nell’unità di tempo e dimezzato il tempo al primo token. Sono risultati riferiti a quello scenario, non incrementi validi per ogni applicazione. 28
33
Huawei descrive inoltre un sistema di collocazione dei dati consapevole della cache KV, che gestisce per quanto tempo mantenerli sui diversi supporti. Indica per gli SSD una resistenza fino a 24 riscritture complete dell’unità al giorno, un miglioramento della durata di 16 volte e un obiettivo di stabilità di tre anni. La logica economica è ridurre sia i calcoli ripetuti sia la sostituzione delle unità, abbassando il costo per token. Le fonti disponibili, tuttavia, non verificano in modo indipendente questi risultati di prestazione, durata o costo su SuperPoD in produzione. 6
8
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OceanStor M900 estende la cache KV dei SuperPoD dalla memoria sul chip e dalla DRAM agli SSD, con una capacità dichiarata di 64 PB per cluster.
OceanStor M900 estende la cache KV dei SuperPoD dalla memoria sul chip e dalla DRAM agli SSD, con una capacità dichiarata di 64 PB per cluster. Huawei indica circa 60 microsecondi di latenza d’accesso e 40 TB/s di banda aggregata: non sono valori garantiti per ogni richiesta.