O OceanStor M900 estende o cache KV da memória dos chips e da DRAM para SSDs compartilhados. A fabricante informa latência de acesso de cerca de 60 microssegundos e largura de banda agregada de 40 TB/s por cluster; esses números não descrevem o desempenho de toda requisição.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Apresentado na HUAWEI CONNECT 2026, o OceanStor M900 é um sistema de armazenamento voltado a guardar e compartilhar o contexto reutilizável durante a inferência de IA — a etapa em que um modelo gera respostas. Ele foi projetado para os SuperPoDs, conjuntos de aceleradores de IA da Huawei, em situações com conversas longas e interações repetidas com agentes. 1
9
Enquanto processa uma solicitação, o modelo produz dados intermediários chamados cache de chave e valor, ou cache KV. Se outra solicitação puder aproveitar um trecho já processado, reutilizar esses dados evita refazer parte do cálculo. O problema é manter esse cache disponível quando o contexto cresce e a memória próxima de cada NPU — a unidade de processamento neural — fica limitada. O M900 busca ampliar e compartilhar esse espaço entre aceleradores de um SuperPoD. O benefício, porém, depende de haver trechos que possam de fato ser reutilizados. 1
3
6
Pela rede UnifiedBus, o projeto reúne cache KV distribuído entre memória no chip, DRAM e SSDs. A Huawei afirma que um cluster pode oferecer 64 PB de capacidade de cache KV, elevando de gigabytes para terabytes o volume compartilhado acessível a uma NPU. Os 64 PB são capacidade do cluster, não memória instalada dentro de cada NPU. Manter mais contexto disponível pode aumentar as oportunidades de reutilização, sem garantir que toda carga de trabalho terá mais acertos no cache. 3
6
17
Para tornar a camada de SSDs útil à inferência, a Huawei descreve um caminho de um salto entre a NPU e os SSDs. A arquitetura integra funções de CPU, controlador de rede e controlador NAND para dispensar algumas etapas convencionais de conversão de protocolo e encaminhamento pela CPU. A fabricante informa latência de acesso de aproximadamente 60 microssegundos e 40 TB/s de largura de banda agregada por cluster. São números declarados para a arquitetura e o sistema, não uma promessa de velocidade para cada consulta ao cache. 3
6
28
32
Quando uma solicitação reaproveita cálculos, o primeiro token da resposta pode chegar mais cedo; evitar processamento repetido também pode liberar capacidade para gerar mais tokens. Em um cenário típico de programação com IA, a Huawei afirma que a arquitetura dobrou a vazão de tokens do cluster de inferência e reduziu pela metade o tempo até o primeiro token. Esses resultados são específicos do cenário divulgado, não ganhos universais. 28
33
O M900 também usa posicionamento de dados sensível ao cache KV para administrar por quanto tempo os dados permanecem em cada meio de armazenamento. A Huawei cita resistência dos SSDs de até 24 gravações completas por dia, aumento de 16 vezes na vida útil e uma meta de estabilidade de três anos. A proposta econômica é reduzir tanto o cálculo repetido quanto a troca de unidades, diminuindo o custo por token. As evidências fornecidas, porém, não verificam de forma independente esses resultados de desempenho, durabilidade ou custo em SuperPoDs em produção. 6
8
33
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O OceanStor M900 estende o cache KV da memória dos chips e da DRAM para SSDs compartilhados.
O OceanStor M900 estende o cache KV da memória dos chips e da DRAM para SSDs compartilhados. A fabricante informa latência de acesso de cerca de 60 microssegundos e largura de banda agregada de 40 TB/s por cluster; esses números não descrevem o desempenho de toda requisição.
Os ganhos anunciados de vazão, tempo de resposta e durabilidade dos SSDs dependem do uso real e não foram comprovados de forma independente em SuperPoDs em produção.