Huawei uppger att OceanStor M900 kan ge upp till 64 PB delad KV cachekapacitet per kluster genom att lägga till en SSD baserad nivå. Terabyte tillgänglig cache per NPU betyder åtkomst till gemensamt lagringsutrymme – inte mer fysiskt minne på själva kretsen.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
När en AI-modell arbetar med långa konversationer eller utför uppgifter i flera steg byggs en KV-cache upp. Den lagrar information som kan återanvändas under inferensen – när modellen tar fram sitt svar. Problemet är att mängden cache kan bli större än vad som ryms nära processorerna. Huawei vill lösa kapacitetsbristen med OceanStor M900: en delad lagringsnivå på SSD under kretsarnas eget minne och arbetsminnet, DRAM. SSD-enheterna ska alltså komplettera det snabbaste minnet, inte ersätta det. 8
10
12
Via sammankopplingstekniken Lingqu, även kallad UnifiedBus, säger Huawei att KV-cachen kan delas inom ett SuperPoD-system och fördelas mellan minne på kretsen, DRAM och SSD. Bolaget anger upp till 64 PB per kluster och säger att den cachekapacitet som varje NPU, en processor för AI-beräkningar, kan komma åt ökar från gigabyte till terabyte. Det är tillgång till gemensam kapacitet på flera lagringsnivåer, inte terabyte nytt fysiskt minne i varje NPU. 8
10
M900 är därmed byggd för att lagra och återanvända kontext vid inferens, snarare än för att utföra AI-beräkningarna. Den kompletterar processorerna och är beroende av sammankopplingen för delad åtkomst; den ersätter varken beräkningskretsarna eller nätverket mellan dem. Huawei lyfter särskilt fram arbetslaster med AI-agenter och långa kontexter. Branschmediet Blocks & Files pekar ut Atlas 960 SuperPoD som en tänkt miljö. 12
6
Huawei beskriver en direkt åtkomstväg från NPU till SSD i ett steg, möjliggjord av en konstruktion som integrerar funktioner för CPU, nätverksstyrenhet och NAND-styrenhet. Enligt bolaget undviks vidarebefordran via CPU och protokollomvandling. Det ska minska åtkomstlatensen med 90 procent, till 60 mikrosekunder. Huawei anger också 40 TB/s i sammanlagd bandbredd per kluster, 1,5 gånger dess angivna jämförelselösning. Bandbreddssiffran gäller hela klustret, inte varje enskild NPU. 8
I vad Huawei kallar ett typiskt scenario för AI-programmering uppger bolaget dubbel tokengenomströmning i inferensklustret och halverad tid till första token – alltså tills svaret börjar komma. Resultatet kan inte utan vidare överföras till alla förfrågningar med långa kontexter eller AI-agenter. 8
14
Tekniken KV-Aware ska enligt Huawei förutsäga hur länge cachedata behöver finnas kvar och styra var de placeras. Bolaget uppger stöd för upp till 24 fullständiga skrivningar av en SSD:s kapacitet per dag, 16 gånger längre livslängd för SSD-mediet och tre års stabil drift. Färre byten och mindre underhåll skulle kunna sänka kostnaderna, men det tillgängliga underlaget visar ingen uppmätt besparing per producerad token. 8
Den viktiga skillnaden går mellan mer cache inom räckhåll och bevisat snabbare och billigare inferens i stor skala. Oberoende tester behöver visa hur mycket kapacitet som faktiskt kan användas och hur ofta cachen ger träff vid verkliga arbetslaster. De behöver också mäta latens och uthållig bandbredd när många delar på systemet, jämföra tokenprestanda mot en tydligt angiven utgångspunkt samt följa SSD-slitage och totalkostnad över tid. Den tillgängliga tredjepartsrapporteringen återger Huaweis siffror, men verifierar dem inte självständigt. 6
14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei uppger att OceanStor M900 kan ge upp till 64 PB delad KV cachekapacitet per kluster genom att lägga till en SSD baserad nivå.
Huawei uppger att OceanStor M900 kan ge upp till 64 PB delad KV cachekapacitet per kluster genom att lägga till en SSD baserad nivå. Terabyte tillgänglig cache per NPU betyder åtkomst till gemensamt lagringsutrymme – inte mer fysiskt minne på själva kretsen.
Påståendena om lägre latens, högre tokengenomströmning och längre SSD livslängd behöver prövas oberoende.