Huawei vil udvide KV cachen i sine SuperPoD systemer med et delt SSD baseret lag på op til 64 PB pr. Terabyte cache til rådighed pr.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Når en AI-model arbejder med lange samtaler eller flere trin i en opgave, kan dens KV-cache vokse: Den gemmer beregnede dele af konteksten, så de kan genbruges. Huaweis OceanStor M900 skal gøre mere af den cache tilgængelig i en SuperPoD, selv når chippenes hukommelse og DRAM ikke kan rumme det hele. Løsningen lægger et delt, SSD-baseret lag under den hurtigere hukommelse – den erstatter den ikke. 8
10
12
Via forbindelsesteknologien Lingqu, også kaldet UnifiedBus, vil Huawei samle KV-cachen på tværs af en SuperPoD og fordele den mellem hukommelse på chippen, DRAM og SSD’er. Virksomheden angiver op til 64 PB kapacitet pr. klynge og siger, at den cachekapacitet, hver NPU – chippen, der udfører AI-beregningerne – kan tilgå, stiger fra gigabyte til terabyte. Det er adgang til et fælles lager i flere niveauer, ikke terabyte ekstra hukommelse på hver NPU. 8
10
M900 er dermed et lagersystem målrettet inferens, altså brugen af en færdigtrænet model. Det supplerer NPU’erne og er afhængigt af forbindelsen mellem dem og lageret; det erstatter hverken beregningschippen eller forbindelsesteknologien. Huawei fremhæver opgaver med lange kontekster og AI-agenter, mens branchemediet Blocks & Files peger på Atlas 960 SuperPoD som et tiltænkt miljø. 12
6
Huawei siger, at en konstruktion, som integrerer funktioner fra CPU, netværkscontroller og NAND-controller, giver adgang fra NPU til SSD i ét hop uden videresendelse gennem CPU’en og uden protokolkonvertering. Ifølge virksomheden reducerer det adgangstiden med 90 % til 60 mikrosekunder. Huawei angiver også 40 TB/s i samlet båndbredde pr. klynge, 1,5 gange niveauet for den løsning, virksomheden sammenligner med. Tallet gælder hele klyngen, ikke hver enkelt NPU. 8
I et scenarie, som Huawei betegner som typisk AI-programmering, hævder virksomheden, at inferensklyngen leverer dobbelt så mange tokens pr. tidsenhed, mens tiden til første token halveres. Det dokumenterer ikke en tilsvarende forbedring for alle opgaver med lang kontekst eller AI-agenter. 8
14
Huaweis KV-Aware-teknologi skal forudsige, hvor længe cachedata er nyttige, og styre deres placering på de forskellige lagermedier. Virksomheden hævder understøttelse af op til 24 fulde drevskrivninger om dagen, 16 gange længere levetid for SSD-medierne og stabil drift i tre år. Færre udskiftninger og mindre vedligeholdelse kan ifølge Huawei sænke omkostningerne, men det fremlagte materiale dokumenterer ikke en målt besparelse pr. token. 8
Det afgørende spørgsmål er derfor ikke kun, hvor meget cache systemet kan stille til rådighed, men hvor meget der reelt kan genbruges hurtigt og økonomisk under belastning. Uafhængige test må blandt andet undersøge cachetræffere, latenstid og vedvarende båndbredde, når mange NPU’er bruger lageret samtidig, samt token-ydelse, SSD-slitage og samlede omkostninger over tid. Den tilgængelige tredjepartsdækning gengiver Huaweis tal uden selvstændigt at efterprøve dem. 6
14
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei vil udvide KV cachen i sine SuperPoD systemer med et delt SSD baseret lag på op til 64 PB pr.
Huawei vil udvide KV cachen i sine SuperPoD systemer med et delt SSD baseret lag på op til 64 PB pr. Terabyte cache til rådighed pr. NPU betyder adgang til fælles lager – ikke mere hurtig hukommelse på selve chippen.
Tal for latenstid, token hastighed og SSD levetid stammer fra Huawei og kræver uafhængige test.