Huawei verspricht mit OceanStor M900 einen gemeinsam genutzten, mehrstufigen KV Cache mit bis zu 64 PB Kapazität pro Cluster. Terabyte an verfügbarem Cache pro NPU bedeuten Zugriff auf gemeinsam genutzten Speicher – nicht zusätzlichen Speicher direkt auf dem Chip.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Bei langen KI-Unterhaltungen und Aufgaben, in denen KI-Agenten wiederholt auf Kontext zugreifen, kann der Key-Value-Cache (KV-Cache) stark wachsen. Er hält Informationen aus bereits verarbeiteten Eingaben für die weitere Antwortgenerierung bereit. Passt nicht genug davon in den schnellen Speicher eines SuperPoD-Rechenverbunds, wird die Wiederverwendung schwieriger. Huaweis OceanStor M900 soll deshalb eine gemeinsam genutzte, SSD-basierte Speicherebene ergänzen – nicht den schnellen Speicher der KI-Prozessoren ersetzen. 8
10
12
Über das Verbindungsnetz Lingqu, auch UnifiedBus genannt, will Huawei den KV-Cache im SuperPoD gemeinsam nutzbar machen und zwischen On-Chip-Speicher, DRAM und SSDs verteilen. Das Unternehmen nennt bis zu 64 PB pro Cluster. Die für eine einzelne NPU – einen KI-Prozessor – verfügbare Cache-Kapazität soll dadurch von Gigabyte- auf Terabyte-Größenordnung steigen. Entscheidend ist das Wort verfügbar: Die Terabyte liegen nicht plötzlich direkt auf dem NPU-Chip, sondern in einem gemeinsam genutzten, mehrstufigen Speicher. 8
10
M900 ist damit auf Kontextspeicherung während der Inferenz, also beim Erzeugen von KI-Antworten, zugeschnitten. Es ergänzt die Rechenprozessoren und ist für den gemeinsamen Zugriff auf UnifiedBus angewiesen. Huawei nennt lange Kontexte und agentenintensive Anwendungen als Einsatzfelder; ein Branchenbericht ordnet das System den Atlas-960-SuperPoDs zu. 12
6
Huawei beschreibt eine Architektur, die CPU-, Netzwerkcontroller- und NAND-Controller-Funktionen integriert. Sie soll der NPU einen direkten Zugriff auf SSDs mit nur einem Verbindungsschritt ermöglichen, ohne CPU-Weiterleitung oder Protokollumwandlung. Laut Huawei sinkt die Zugriffslatenz dadurch um 90 Prozent auf 60 Mikrosekunden. Hinzu kommen angeblich 40 TB/s aggregierte Bandbreite pro Cluster, das 1,5-Fache der von Huawei herangezogenen Vergleichslösung. Das ist ein Wert für den gesamten Cluster, keine garantierte Bandbreite je NPU. 8
Für ein von Huawei als typisch bezeichnetes KI-Programmierszenario meldet das Unternehmen doppelt so viele ausgegebene Token pro Zeiteinheit im Inferenz-Cluster und eine halbierte Zeit bis zum ersten Token. Daraus lässt sich kein allgemeiner Geschwindigkeitsgewinn für jede lange oder agentische Anfrage ableiten. 8
14
Die Steuerung KV-Aware soll laut Huawei abschätzen, wie lange Cache-Daten benötigt werden, und sie entsprechend auf die Speichermedien verteilen. Huawei nennt bis zu 24 vollständige Laufwerksbeschreibungen pro Tag (DWPD), eine 16-fach längere Lebensdauer der SSD-Medien und drei Jahre stabilen Betrieb. Weniger Austausch und Wartung sollen die Inferenzkosten senken; eine gemessene Ersparnis pro Token belegen die vorliegenden Angaben jedoch nicht. 8
Der Unterschied bleibt: Mehr erreichbarer Cache ist nicht gleich nachgewiesen schnellere und günstigere Inferenz im großen Maßstab. Unabhängige Tests müssten unter realen Lasten unter anderem nutzbare Kapazität, Cache-Trefferraten, Latenzen und dauerhafte Bandbreite bei gleichzeitigem Zugriff prüfen. Ebenso offen sind Vergleiche der Token-Leistung mit einer klar benannten Ausgangsbasis sowie SSD-Verschleiß und Gesamtkosten über längere Zeit. Die verfügbare Berichterstattung gibt Huaweis Leistungszahlen wieder, statt sie unabhängig zu bestätigen. 6
14
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Huawei verspricht mit OceanStor M900 einen gemeinsam genutzten, mehrstufigen KV Cache mit bis zu 64 PB Kapazität pro Cluster.
Huawei verspricht mit OceanStor M900 einen gemeinsam genutzten, mehrstufigen KV Cache mit bis zu 64 PB Kapazität pro Cluster. Terabyte an verfügbarem Cache pro NPU bedeuten Zugriff auf gemeinsam genutzten Speicher – nicht zusätzlichen Speicher direkt auf dem Chip.
Die Angaben zu Tempo, SSD Lebensdauer und Kosten stammen von Huawei; unabhängige Praxistests stehen aus.