OceanStor M900 voegt volgens Huawei een gedeelde, op SSD’s gebaseerde laag toe aan de KV cache van een SuperPoD, met maximaal 64 PB capaciteit per cluster. ‘Terabytes per NPU’ betekent toegang tot gedeelde opslag, niet dat elke AI processor terabytes extra geheugen op de chip krijgt.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Bij lange gesprekken en AI-agenten die meerdere stappen uitvoeren, kan de key-value-cache (KV-cache) sterk groeien. Daarin bewaart een model informatie uit eerder verwerkte context om die opnieuw te kunnen gebruiken. Het geheugen op de chip en het werkgeheugen (DRAM) van een SuperPoD — Huawei’s opstelling met meerdere AI-processors — zijn niet onbeperkt. OceanStor M900 moet die capaciteitsgrens verleggen door ook een gedeelde laag op SSD’s beschikbaar te maken. Die laag is bedoeld als aanvulling op het snelle geheugen vlak bij de processors, niet als vervanging ervan. 8
10
12
Via Huawei’s Lingqu-netwerk, ook UnifiedBus genoemd, moet KV-cache tussen processors kunnen worden gedeeld en verdeeld over geheugen op de chip, DRAM en SSD’s. Huawei noemt maximaal 64 PB per cluster. Ook zou de KV-cache die voor een afzonderlijke NPU, een AI-processor, beschikbaar is van gigabytes naar terabytes gaan. Dat laatste gaat om toegang tot de gezamenlijke opslaglagen: er komt niet ineens terabytes aan fysiek geheugen op elke chip bij. 8
10
M900 is daarmee een opslagsysteem voor context tijdens inferentie — het gebruiken van een getraind AI-model — en geen nieuwe rekenchip. Het is gericht op taken met veel agentstappen of lange context en is voor gedeelde toegang afhankelijk van de netwerkverbinding. Vakberichtgeving noemt Huawei’s Atlas 960 SuperPoDs als beoogde omgeving. 12
6
Huawei zegt dat een ontwerp waarin CPU-, netwerkcontroller- en NAND-controllerfuncties zijn geïntegreerd, een directe verbinding in één stap van NPU naar SSD mogelijk maakt. Door CPU-doorgifte en protocolomzetting over te slaan, zou de toegangslatentie met 90% dalen tot 60 microseconden. Het bedrijf noemt daarnaast 40 TB/s aan gezamenlijke bandbreedte per cluster, naar eigen zeggen 1,5 keer de bandbreedte van de oplossing waarmee het vergelijkt. Dat is geen gegarandeerde bandbreedte voor elke NPU afzonderlijk. 8
Voor een door Huawei omschreven ‘typische AI-programmeertaak’ claimt het bedrijf een verdubbeling van de tokenverwerking door het inferentiecluster en een halvering van de wachttijd tot het eerste token. Die uitkomsten zijn niet zonder meer toepasbaar op iedere taak met een lange context of meerdere agentstappen. 8
14
De zogeheten KV-Aware-sturing voorspelt volgens Huawei hoe lang cachegegevens nuttig blijven en kiest op basis daarvan waar ze worden opgeslagen. Huawei claimt ondersteuning voor maximaal 24 volledige schrijfacties per schijf per dag (DWPD), een zestienmaal langere levensduur van de SSD-media en drie jaar stabiele werking. Minder vervangingen en onderhoud zouden de inferentiekosten kunnen drukken, maar het aangehaalde materiaal toont geen gemeten besparing per token aan. 8
De kern is het verschil tussen meer cache binnen bereik brengen en aantonen dat AI-verzoeken op grote schaal sneller en goedkoper worden afgehandeld. Onafhankelijke tests zouden onder meer de bruikbare capaciteit en het aandeel hergebruikte cachegegevens bij echte taken moeten meten, evenals latentie en aanhoudende bandbreedte wanneer veel processors tegelijk toegang vragen. Ook de tokenwinst ten opzichte van een duidelijk omschreven uitgangssituatie, SSD-slijtage en totale kosten over langere tijd vragen om toetsing. De beschikbare externe berichtgeving vermeldt Huawei’s cijfers, maar valideert ze niet met eigen benchmarks. 6
14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OceanStor M900 voegt volgens Huawei een gedeelde, op SSD’s gebaseerde laag toe aan de KV cache van een SuperPoD, met maximaal 64 PB capaciteit per cluster.
OceanStor M900 voegt volgens Huawei een gedeelde, op SSD’s gebaseerde laag toe aan de KV cache van een SuperPoD, met maximaal 64 PB capaciteit per cluster. ‘Terabytes per NPU’ betekent toegang tot gedeelde opslag, niet dat elke AI processor terabytes extra geheugen op de chip krijgt.
De cijfers over snelheid, SSD levensduur en kosten komen van Huawei; onafhankelijke praktijktests ontbreken in de aangehaalde berichtgeving.