Huawei claimt 64 PB gedeelde KV cachecapaciteit per cluster. Dat is geen 64 PB geheugen in één AI chip. De genoemde toegangstijd van circa 60 microseconden en totale bandbreedte van 40 TB/s zijn systeemclaims, geen gegarandeerde prestaties per verzoek.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei presenteerde de OceanStor M900 tijdens HUAWEI CONNECT 2026 als opslagsysteem voor AI-inferentie in een SuperPoD: een cluster van samenwerkende AI-rekenchips. Het systeem moet meer eerder berekende context beschikbaar houden wanneer prompts, gesprekken en taken van AI-agents langer worden. 1
9
Tijdens het verwerken van een prompt bewaart een AI-model tussenresultaten in een key-value-cache, meestal KV-cache genoemd. Als een volgend verzoek een geschikt deel van die prompt opnieuw gebruikt, hoeft het systeem dat deel niet nog eens te berekenen. Bij lange contexten en herhaalde interacties is die cache waardevol, maar moeilijk volledig onder te brengen in het geheugen vlak bij elke NPU, Huawei’s type AI-rekenchip. De M900 moet de cache daarom op clusterniveau uitbreiden en deelbaar maken. Het voordeel ontstaat alleen als verzoeken ook werkelijk eerder berekende context kunnen hergebruiken. 1
3
6
Via Huawei’s UnifiedBus koppelt de M900 KV-cachegegevens in chipgeheugen, DRAM en SSD’s aan een gedeelde opslagpool. Volgens Huawei biedt één cluster 64 PB KV-cachecapaciteit en groeit de hoeveelheid cache die voor een NPU toegankelijk is van gigabytes naar terabytes. Die 64 PB is dus een capaciteit van het hele cluster, niet het geheugen in één NPU. 3
6
17
Om ook de SSD-laag snel genoeg toegankelijk te maken voor inferentie, beschrijft Huawei een verbinding van de NPU naar de SSD’s via één netwerkstap. Het ontwerp combineert functies van een CPU, netwerkcontroller en NAND-controller, waardoor bepaalde stappen voor protocolomzetting en doorgeleiding via de CPU vervallen. Huawei noemt een toegangstijd van ongeveer 60 microseconden en een totale bandbreedte van 40 TB/s per cluster. Dat zijn opgegeven architectuur- en systeemcijfers; ze zeggen niet dat ieder afzonderlijk verzoek die waarden haalt. 3
6
28
32
Een verzoek dat een bruikbaar deel van de cache terugvindt, kan eerder zijn eerste gegenereerde token opleveren. Minder herberekening kan bovendien ruimte vrijmaken om in totaal meer tokens te verwerken. Huawei stelt dat in een typisch AI-programmeerscenario de tokendoorvoer van het inferentiecluster verdubbelde en de tijd tot het eerste token halveerde. Die uitkomsten zijn specifiek voor dat scenario, niet voor elke toepassing. 28
33
De M900 gebruikt volgens Huawei ook KV-bewuste plaatsing: het systeem bepaalt hoe lang cachegegevens op verschillende opslagmedia blijven staan. Het bedrijf noemt een SSD-duurzaamheid van maximaal 24 volledige schijfschrijfacties per dag, een zestien keer langere levensduur en een doel van drie jaar stabiele werking. Minder herberekening en minder vervanging van opslag moeten de kosten per gegenereerd token verlagen. De beschikbare bronnen bevestigen die prestatie-, levensduur- en kostenresultaten echter niet met onafhankelijke metingen in operationele SuperPoD-clusters. 6
8
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei claimt 64 PB gedeelde KV cachecapaciteit per cluster. Dat is geen 64 PB geheugen in één AI chip.
Huawei claimt 64 PB gedeelde KV cachecapaciteit per cluster. Dat is geen 64 PB geheugen in één AI chip. De genoemde toegangstijd van circa 60 microseconden en totale bandbreedte van 40 TB/s zijn systeemclaims, geen gegarandeerde prestaties per verzoek.