Huawei oplyser, at én M900 klynge kan rumme 64 PB delt KV cache. Det er ikke hukommelse inde i den enkelte AI processor.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei præsenterede OceanStor M900 på HUAWEI CONNECT 2026 som et lagersystem til AI-inferens i virksomhedens SuperPoD-systemer. Idéen er at bevare mere af den kontekst, som allerede er beregnet, så den kan bruges igen på tværs af AI-processorer, når samtaler og agentopgaver bliver længere. 1
9
Når en AI-model behandler en prompt, kan den gemme mellemresultater i en nøgle-værdi-cache, også kaldet en KV-cache. Hvis en senere forespørgsel kan genbruge en passende del af den samme prompt, behøver systemet ikke udføre alle beregningerne igen. Udfordringen er, at lange kontekster kræver mere plads, end der nødvendigvis er tæt på den enkelte NPU – den processor, der udfører AI-beregningerne. 1
3
6
M900 bruger Huaweis UnifiedBus-forbindelse til at samle KV-cachen på flere niveauer: hukommelse på chippen, DRAM og SSD-lager. Ifølge Huawei kan én klynge stille 64 PB KV-cache til rådighed, så den cache, en NPU kan tilgå, går fra gigabyte- til terabyteklassen. De 64 PB er delt lagerkapacitet i klyngen, ikke hukommelse indbygget i hver NPU. Mere plads giver mulighed for at bevare mere kontekst, men hjælper kun, når opgaverne faktisk kan genbruge den. 3
6
17
For at gøre SSD-niveauet brugbart under inferens beskriver Huawei en forbindelse med ét hop fra en SuperPoD-NPU til SSD’erne. Designet integrerer funktioner fra CPU, netværkscontroller og NAND-controller og skal undgå nogle af de sædvanlige trin med protokolkonvertering og videresendelse via CPU. Huawei angiver en adgangstid på omkring 60 mikrosekunder og en samlet båndbredde på 40 TB/s pr. klynge. Tallene beskriver den oplyste arkitektur og klyngeydelse – ikke nødvendigvis hver enkelt cacheadgang. 3
6
28
32
Når en forespørgsel kan bruge en gemt del af sin kontekst, kan modellen potentielt begynde at generere svar hurtigere. Huawei hævder, at arkitekturen i et typisk scenarie med AI-kodning fordoblede en inferensklynges token-gennemløb og halverede tiden til første token. Det er et resultat for den beskrevne arbejdsbelastning, ikke et løfte om samme gevinst for alle opgaver. 28
33
Huawei beskriver også KV-bevidst placering, der styrer, hvor længe cachedata ligger på forskellige lagermedier. Virksomheden angiver SSD-udholdenhed på op til 24 fulde drevskrivninger om dagen, 16 gange længere levetid og et mål om tre års stabil drift. Færre gentagne beregninger og færre udskiftninger skal sænke omkostningen pr. token. De fremlagte kilder dokumenterer dog ikke uafhængigt, at gevinsterne i ydelse, levetid eller pris opnås i SuperPoD-systemer i drift. 6
8
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei oplyser, at én M900 klynge kan rumme 64 PB delt KV cache. Det er ikke hukommelse inde i den enkelte AI processor.
Huawei oplyser, at én M900 klynge kan rumme 64 PB delt KV cache. Det er ikke hukommelse inde i den enkelte AI processor. Virksomheden angiver omkring 60 mikrosekunders adgangstid og 40 TB/s samlet båndbredde pr.
Gevinsterne ved hurtigere svar og lavere omkostninger afhænger af, hvor meget tidligere beregnet kontekst der kan genbruges.