Huawei rozšiřuje KV cache systémů SuperPoD z paměti čipů a DRAM také na sdílené SSD. Firma uvádí přístupovou latenci přibližně 60 mikrosekund a souhrnnou propustnost 40 TB/s na cluster.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei představil OceanStor M900 na konferenci HUAWEI CONNECT 2026 jako úložiště pro inference AI — fázi, kdy již natrénovaný model vytváří odpověď. Je určeno pro rozsáhlé výpočetní systémy SuperPoD. Místo aby se veškerý průběžně vypočtený kontext musel vejít do paměti u jednotlivých akcelerátorů, má být jeho část dostupná ze společného úložiště. 1
9
Při zpracování zadání si model ukládá mezivýsledky do takzvané KV cache (key–value cache). Pokud další požadavek využije stejný, již zpracovaný začátek zadání, systém může odpovídající výpočty použít znovu. To je zajímavé zejména u dlouhých konverzací a opakovaných kroků AI agentů. Přínos však nastane jen tehdy, když požadavky skutečně obsahují znovu využitelný kontext. 1
3
6
OceanStor M900 prostřednictvím sítě UnifiedBus propojuje několik úrovní KV cache: paměť přímo na čipech, operační paměť DRAM a SSD. Podle Huawei může jeden cluster nabídnout 64 PB kapacity sdílené KV cache; objem dostupný jednotlivé neuronové výpočetní jednotce (NPU) se tak má posunout z řádu gigabajtů do řádu terabajtů. Neznamená to, že má jedna NPU v sobě 64 PB paměti. Větší sdílený prostor má umožnit uchovat a opakovaně využít více kontextu. 3
6
17
Aby přístup na SSD nebyl pro inferenci příliš pomalý, Huawei popisuje cestu z NPU k SSD přes jediný síťový krok. Konstrukce integruje funkce CPU, síťového řadiče a řadiče NAND, čímž má omezit převody protokolů a předávání dat přes CPU. Firma udává latenci přibližně 60 mikrosekund a souhrnnou propustnost 40 TB/s na cluster. Jsou to údaje o navržené architektuře a systému, nikoli příslib rychlosti každého přístupu do cache. 3
6
28
32
Když se podaří znovu použít uložený začátek zadání, může se zkrátit čekání na první vygenerovaný token. Méně opakovaných výpočtů může zároveň uvolnit výkon pro zpracování dalších tokenů. Huawei tvrdí, že v typickém scénáři práce s kódem se propustnost inferenčního clusteru zdvojnásobila a doba do prvního tokenu klesla na polovinu. Výsledek konkrétního scénáře nelze automaticky vztáhnout na všechny úlohy. 28
33
Součástí návrhu je také řízení ukládání podle charakteru KV dat, které má rozhodovat, jak dlouho zůstanou na jednotlivých typech úložiště. Huawei uvádí výdrž SSD až 24 úplných přepisů disku denně, šestnáctinásobné prodloužení životnosti a cíl stabilního provozu po tři roky. Méně opakovaných výpočtů a méně výměn disků má snížit náklady na vygenerovaný token. Poskytnuté podklady však tyto výkonové, životnostní ani nákladové výsledky nezávisle nepotvrzují v produkčním provozu SuperPoDů. 6
8
33
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei rozšiřuje KV cache systémů SuperPoD z paměti čipů a DRAM také na sdílené SSD.
Huawei rozšiřuje KV cache systémů SuperPoD z paměti čipů a DRAM také na sdílené SSD. Firma uvádí přístupovou latenci přibližně 60 mikrosekund a souhrnnou propustnost 40 TB/s na cluster.
V testovaném scénáři práce s kódem Huawei hlásí dvojnásobnou propustnost tokenů a poloviční dobu do prvního tokenu; nezávislé ověření provozních výsledků v poskytnutých podkladech chybí.