A Huawei afirma que o M900 amplia o cache KV dos SuperPoDs com uma camada compartilhada em SSDs, capaz de chegar a 64 PB por cluster. Terabytes disponíveis por NPU significam acesso a capacidade compartilhada, não mais memória física dentro do chip.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Em uma conversa longa com uma IA, parte do contexto já processado pode ser guardada no cache KV — uma forma de evitar que o sistema refaça o mesmo trabalho a cada novo trecho da resposta. O problema aparece quando esse cache cresce além do que cabe na memória mais próxima dos processadores. O OceanStor M900 é a resposta da Huawei a esse limite: manter mais contexto disponível para reutilização por meio de uma camada compartilhada em SSDs, sem apresentar os SSDs como substitutos da memória rápida da NPU, a unidade de processamento usada na inferência. 8
10
12
Segundo a Huawei, a interconexão Lingqu, também chamada UnifiedBus, permite reunir o cache KV de um SuperPoD — um conjunto de sistemas de computação interligados — e distribuí-lo entre memória no chip, DRAM e SSDs. A empresa anuncia até 64 PB de capacidade por cluster e diz que o cache acessível a cada NPU passa da escala de gigabytes para a de terabytes. Esse último número descreve o acesso a armazenamento compartilhado em camadas; não significa que cada chip ganhou terabytes de memória própria. 8
10
O M900, portanto, é infraestrutura de armazenamento de contexto voltada à inferência, não um novo chip de computação. Ele complementa as NPUs e depende da interconexão para compartilhar o cache. A Huawei o apresenta para tarefas com agentes de IA e contextos mais longos; a cobertura especializada aponta os Atlas 960 SuperPoDs como ambiente de uso. 12
6
A Huawei diz que a integração das funções de CPU, controle de rede e controle de memória NAND cria um caminho de um salto entre NPU e SSD, sem encaminhamento pela CPU nem conversão de protocolos. Com isso, afirma reduzir a latência de acesso em 90%, para 60 microssegundos. Anuncia também 40 TB/s de largura de banda agregada por cluster, 1,5 vez o valor da solução usada em sua comparação — não uma velocidade garantida para cada NPU. 8
Em um cenário que descreve como “típico” de programação com IA, a empresa relata o dobro da taxa de processamento de tokens no cluster de inferência e metade do tempo até o primeiro token. Não há base, nos materiais citados, para estender esses ganhos a toda solicitação longa ou tarefa com agentes. 8
14
O agendamento KV-Aware prevê por quanto tempo os dados do cache serão úteis e organiza sua distribuição entre os meios de armazenamento, segundo a Huawei. A empresa afirma atingir até 24 gravações completas por unidade ao dia, multiplicar por 16 a vida útil dos SSDs e sustentar três anos de operação estável. Menos trocas e manutenção poderiam reduzir custos, mas as fontes citadas não demonstram uma economia medida por token. 8
A distinção decisiva é entre colocar mais cache ao alcance dos processadores e comprovar inferência mais rápida e barata em escala. Para isso, seriam necessários testes independentes com cargas reais: capacidade efetivamente utilizável, frequência de reaproveitamento do cache, latência e largura de banda sob concorrência, ganhos frente a uma referência definida e desgaste e custo dos SSDs ao longo do tempo. A cobertura de terceiros disponível reproduz os números da Huawei, sem validá-los por meio de benchmarks próprios. 6
14
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Huawei afirma que o M900 amplia o cache KV dos SuperPoDs com uma camada compartilhada em SSDs, capaz de chegar a 64 PB por cluster.
A Huawei afirma que o M900 amplia o cache KV dos SuperPoDs com uma camada compartilhada em SSDs, capaz de chegar a 64 PB por cluster. Terabytes disponíveis por NPU significam acesso a capacidade compartilhada, não mais memória física dentro do chip.
Os ganhos anunciados de latência, velocidade de inferência e vida útil dos SSDs ainda precisam de testes independentes.