Huawei dichiara fino a 64 PB di capacità per cluster, estendendo la cache KV dalla memoria dei processori e dalla DRAM a un livello condiviso su SSD. I terabyte di cache disponibili per NPU indicano accesso a una risorsa condivisa, non nuova memoria integrata in ciascun processore.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Quando un sistema di IA gestisce conversazioni lunghe o più passaggi affidati ad agenti, la cache KV conserva informazioni già elaborate che possono essere riutilizzate durante l’inferenza, cioè la generazione della risposta. Il problema è lo spazio: non tutto questo contesto può restare nella memoria più vicina ai processori. OceanStor M900 è la risposta proposta da Huawei: un livello di cache condivisa su SSD, aggiunto alla memoria integrata nei chip e alla DRAM, non destinato a sostituirle. 8
10
12
Secondo Huawei, la rete di interconnessione Lingqu, chiamata anche UnifiedBus, consente di condividere la cache KV tra le componenti di un SuperPoD e di distribuirla su diversi livelli di memoria. L’azienda dichiara fino a 64 PB per cluster e afferma che la capacità accessibile a ogni NPU, il processore dedicato all’IA, passa dall’ordine dei gigabyte a quello dei terabyte. È una distinzione importante: quei terabyte appartengono a uno spazio condiviso e suddiviso in livelli, non sono memoria veloce aggiunta a ogni NPU. 8
10
M900 si colloca quindi accanto ai processori che eseguono i calcoli e dipende dall’interconnessione per rendere disponibile la cache. È un sistema di archiviazione del contesto pensato per l’inferenza, non un nuovo chip né un sostituto della rete. Huawei lo presenta per carichi con agenti e contesti lunghi; la stampa di settore indica gli Atlas 960 SuperPoD tra gli ambienti a cui è destinato. 12
6
Huawei attribuisce a un’architettura che integra funzioni di CPU, controller di rete e controller NAND un percorso diretto in un solo passaggio dalla NPU all’SSD. Evitando, secondo l’azienda, l’inoltro tramite CPU e la conversione dei protocolli, la latenza di accesso scenderebbe del 90%, fino a 60 microsecondi. Huawei dichiara inoltre 40 TB/s di banda aggregata per cluster, pari a 1,5 volte quella della soluzione usata come confronto: non è una velocità garantita a ciascuna NPU. 8
In uno scenario che definisce «tipico» di programmazione con l’IA, l’azienda riferisce un raddoppio dei token prodotti dal cluster nell’unità di tempo e un dimezzamento del tempo necessario a ottenere il primo token. Non sono risultati da estendere automaticamente a tutte le richieste con contesti lunghi o agenti. 8
14
La tecnologia KV-Aware dovrebbe prevedere per quanto tempo i dati della cache resteranno utili e scegliere dove collocarli. Huawei dichiara il supporto fino a 24 riscritture complete dell’unità al giorno (DWPD), una durata dei supporti SSD 16 volte maggiore e tre anni di funzionamento stabile. Sostiene che meno sostituzioni e manutenzione possano ridurre i costi dell’inferenza, ma il materiale citato non documenta un risparmio misurato per token. 8
La promessa più chiara è dunque avere più cache a disposizione. Per stabilire se si traduca in inferenza più rapida ed economica su larga scala servono test indipendenti: quanta capacità sia effettivamente utilizzabile, quante richieste ritrovino i dati in cache, come cambino latenza e banda quando molte NPU accedono insieme al sistema, e quale sia l’usura degli SSD nel tempo. Anche i guadagni sui token andrebbero confrontati con una configurazione di partenza esplicitata. Le fonti terze disponibili riportano i numeri di Huawei, senza validarli con benchmark indipendenti. 6
14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei dichiara fino a 64 PB di capacità per cluster, estendendo la cache KV dalla memoria dei processori e dalla DRAM a un livello condiviso su SSD.
Huawei dichiara fino a 64 PB di capacità per cluster, estendendo la cache KV dalla memoria dei processori e dalla DRAM a un livello condiviso su SSD. I terabyte di cache disponibili per NPU indicano accesso a una risorsa condivisa, non nuova memoria integrata in ciascun processore.
Latenza, velocità di inferenza e risparmi operativi sono per ora dichiarazioni di Huawei: mancano verifiche indipendenti su carichi reali.