Huawei presenterade OceanStor M900 vid HUAWEI CONNECT 2026 som ett delat KV cachelager för hyperskaliga AI inferenskluster, med upp till 64 PB per kluster. Systemet använder Lingqu UnifiedBus för att poola och nivåindela KV cache mellan acceleratorminne, DRAM och SSD, med fokus på långa kontextfönster och agentbaser...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei announce at Huawei Connect 2026 about its OceanStor M900 AI memory storage for hyperscale inference SuperPoDs, including how. Article summary: Huawei announced OceanStor M900 Context Memory Storage: an SSD-backed, shared KV-cache tier for hyperscale AI inference SuperPoDs. It is intended to extend—not replace—accelerators’ HBM/DRAM or the SuperPoD interconnect:. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei har presenterat OceanStor M900 Context Memory Storage, ett lagringssystem för AI-inferens i hyperskaliga datacenter. Produkten är inte tänkt att ersätta HBM eller DRAM i AI-acceleratorer, utan att lägga till ett delat och skalbart minneslager för SuperPoDs – mycket stora AI-kluster – där KV-cache kan bli en flaskhals vid mycket långa promptar och agentbaserade arbetsflöden i flera steg. 2
23
Vid inferens med stora språkmodeller sparar KV-cachen mellanliggande tillstånd från token som modellen redan har behandlat. Att kunna återanvända den informationen är värdefullt när samma eller närliggande kontext återkommer, exempelvis i fleromgångschattar eller när en AI-agent utför flera deluppgifter.
Huawei positionerar M900 som ett svar på kapacitetsbegränsningar i minne på chipet och i DRAM vid extremt långa kontextfönster och inferens i flera omgångar. Med UnifiedBus, som företaget även kallar Lingqu, ska systemet skapa en global KV-cache i flera nivåer med anslutning i ett enda hopp. Cachelagret utökas från acceleratorernas minne och DRAM till SSD-enheter. 2
26
I praktiken är tanken att mer av kontexten ska kunna sparas, delas och återanvändas utan att hela datamängden måste ligga kvar i de dyraste minneslagren.
Enligt Huawei kan ett M900-kluster erbjuda upp till 64 PB KV-cache. Bolaget uppger också att tillgänglig KV-cache per NPU – en AI-processor – kan gå från gigabyte- till terabytenivå, i syfte att öka träffsäkerheten i cachen för förfrågningar med lång kontext. 2
26
Det handlar alltså om delat minne på SuperPoD-nivå, inte om att den lokala HBM-kapaciteten i varje chip utökas. Den faktiska nyttan beror därför på hur mjukvaran fördelar, hämtar och återanvänder KV-cachen – och på vilken typ av förfrågningar som körs i den aktuella miljön.
Huawei uppger att M900 integrerar CPU, nätverksstyrenhet och NAND-styrenhet i en gemensam arkitektur. Det ska ge inbyggd KV-semantik och möjliggöra åtkomst från NPU till SSD i ett enda hopp, utan protokollomvandling eller vidarebefordran via CPU:n. 20
26
Bolagets publicerade prestandamål är:
Siffrorna är leverantörens egna uppgifter. I lanseringsmaterialet redovisas inte fullständiga detaljer om modell, samtidig belastning, cacheträffar, klusterkonfiguration eller jämförelsemetod. Oberoende tester med representativa produktionsarbetslaster behövs därför för att bedöma den praktiska prestandan.
För ett typiskt AI-kodningsscenario uppger Huawei dubbelt tokenflöde och halverad tid till första token (TTFT). 14 Utan närmare information om referenssystem och arbetslast går det dock inte att dra någon generell slutsats för alla modeller eller inferensplattformar.
Företaget beskriver också en funktion för KV-medveten adaptiv lagring. Den ska ta hänsyn till cachens värde och förväntade livslängd när data placeras på olika lagringsmedier. Huawei hävdar stöd för upp till 24 DWPD – hela disköverskrivningar per dag – och omkring 16 gånger längre läs- och skrivlivslängd för SSD-enheter genom hybridmedier och en optimerad bevarandealgoritm. 16
18
Även dessa hållbarhetsuppgifter behöver bekräftas i verkliga driftsmiljöer, där skrivintensitet och cachepolicyer kan skilja sig väsentligt mellan installationer.
M900 är mer än en fristående lagringslansering. Huawei beskriver UnifiedBus som ett sammankopplingslager för kluster och SuperPoDs i agentbaserad AI, medan M900 blir lagrings- och kontextlagret i den arkitekturen. 23
I denna modell står:
M900 tillför därmed inte beräkningskapacitet till modellen i sig och ersätter varken acceleratorkretsar eller höghastighetsnätverk. Huaweis löfte är i stället att minska den minnespress som uppstår när långa kontextfönster och upprepade agentsteg gör KV-cache till en lika viktig begränsning som själva beräkningskraften. 2
23
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei presenterade OceanStor M900 vid HUAWEI CONNECT 2026 som ett delat KV cachelager för hyperskaliga AI inferenskluster, med upp till 64 PB per kluster.
Huawei presenterade OceanStor M900 vid HUAWEI CONNECT 2026 som ett delat KV cachelager för hyperskaliga AI inferenskluster, med upp till 64 PB per kluster. Systemet använder Lingqu UnifiedBus för att poola och nivåindela KV cache mellan acceleratorminne, DRAM och SSD, med fokus på långa kontextfönster och agentbaserade arbetsflöden.
Huawei uppger omkring 60 µs åtkomstlatens, 40 TB/s samlad bandbredd och dubbelt tokenflöde i ett AI kodningsscenario, men detaljer om testmiljö och jämförelseunderlag saknas.