Durante o HUAWEI CONNECT 2026, a Huawei apresentou o OceanStor M900, uma camada compartilhada de KV Cache para SuperPoDs de inferência de IA em data centers de hiperescala, com até 64 PB por cluster. O M900 usa o UnifiedBus, também chamado de Lingqu, para reunir e distribuir a KV Cache entre a memória dos acelerador...
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Huawei announce at Huawei Connect 2026 about its OceanStor M900 AI memory storage for hyperscale inference SuperPoDs, including how. Article summary: Huawei announced OceanStor M900 Context Memory Storage: an SSD-backed, shared KV-cache tier for hyperscale AI inference SuperPoDs. It is intended to extend—not replace—accelerators’ HBM/DRAM or the SuperPoD interconnect:. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
A Huawei apresentou o OceanStor M900 Context Memory Storage como uma infraestrutura de armazenamento voltada à inferência de IA em data centers de hiperescala. A proposta não é substituir a HBM ou a DRAM dos aceleradores, mas acrescentar uma camada compartilhada e escalável de memória de contexto para SuperPoDs — grandes agrupamentos de computação para IA —, nos quais a KV Cache pode se tornar um gargalo relevante em prompts muito extensos e tarefas de agentes com várias etapas. 2
23
Na inferência de modelos de linguagem, a KV Cache guarda estados intermediários dos tokens que já foram processados. Reaproveitar esses dados é especialmente útil quando um contexto igual ou relacionado volta a aparecer em novos turnos de uma conversa ou em fluxos executados por agentes de IA.
A Huawei posiciona o M900 como resposta aos limites de capacidade da memória no chip e da DRAM em cenários de contexto extremamente longo e inferência multietapa. Por meio do UnifiedBus, que a empresa também chama de Lingqu, o sistema cria uma KV Cache global, em múltiplas camadas e com conexões de um salto, expandindo essa camada da memória do acelerador e da DRAM para SSDs. 2
26
Na prática, a ideia é manter uma parcela muito maior do contexto disponível para armazenamento, compartilhamento e reutilização, sem exigir que tudo permaneça nos níveis mais caros de memória.
Segundo a Huawei, um cluster M900 pode fornecer até 64 PB de KV Cache. A empresa também afirma que a KV Cache utilizável por NPU — unidade de processamento neural — pode sair da escala de gigabytes para a de terabytes, buscando elevar as taxas de acerto do cache em solicitações com contexto longo. 2
26
Trata-se de uma arquitetura de memória compartilhada no nível do SuperPoD, e não de um aumento da HBM local de cada chip. Portanto, o ganho prático dependerá de como o software distribui, recupera e reutiliza a KV Cache, além do perfil real de requisições de cada implantação.
De acordo com a Huawei, o M900 integra CPU, controlador de rede e controlador NAND em uma única arquitetura. A companhia diz que o desenho oferece semântica KV nativa e permite acesso de um salto entre NPU e SSD, evitando conversão de protocolo e encaminhamento pela CPU. 20
26
As metas divulgadas pela fabricante são:
Esses números devem ser tratados como alegações do fornecedor. O anúncio não detalha modelo utilizado, nível de concorrência, taxas de acerto de cache, configuração do cluster ou metodologia da comparação. Testes independentes em cargas representativas de produção serão necessários para avaliar o desempenho de forma mais conclusiva.
Em um cenário típico de inferência para programação com IA, a Huawei afirma obter o dobro do throughput de tokens e cortar pela metade o tempo até o primeiro token (TTFT). 14 Sem informações publicadas sobre a linha de base e a carga de trabalho, os dados não permitem estender a conclusão a todos os modelos ou stacks de inferência.
A empresa também descreve um esquema de armazenamento adaptativo orientado por KV. A lógica de posicionamento dos dados considera o valor e o tempo de vida do cache para selecionar o meio de armazenamento mais adequado. A Huawei declara suporte de até 24 DWPD — gravações por dia equivalentes à capacidade do disco — e uma melhora de cerca de 16 vezes na vida útil de leitura e gravação dos SSDs com mídia híbrida e um algoritmo de retenção otimizado. 16
18
Também nesse caso, a durabilidade precisará ser confirmada sob ritmos reais de gravação e políticas efetivas de gerenciamento de cache.
O lançamento do M900 é mais uma declaração de arquitetura do que um anúncio isolado de armazenamento. A Huawei apresenta o UnifiedBus como uma interconexão para conectar clusters e SuperPoDs voltados à IA agentiva; o M900 funciona como a camada de armazenamento e contexto dessa pilha. 23
Nesse arranjo:
Assim, o M900 não aumenta por si só o poder de processamento do modelo e não substitui aceleradores nem interconexões de alta velocidade. Sua promessa é reduzir a pressão sobre a memória quando janelas de contexto extensas e passos repetidos de agentes tornam a KV Cache um recurso tão importante quanto a capacidade de computação. 2
23
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Durante o HUAWEI CONNECT 2026, a Huawei apresentou o OceanStor M900, uma camada compartilhada de KV Cache para SuperPoDs de inferência de IA em data centers de hiperescala, com até 64 PB por cluster.
Durante o HUAWEI CONNECT 2026, a Huawei apresentou o OceanStor M900, uma camada compartilhada de KV Cache para SuperPoDs de inferência de IA em data centers de hiperescala, com até 64 PB por cluster. O M900 usa o UnifiedBus, também chamado de Lingqu, para reunir e distribuir a KV Cache entre a memória dos aceleradores, a DRAM e os SSDs, visando cargas de contexto muito longo e inferência com múltiplas etapas de ag...
A Huawei declara cerca de 60 µs de latência, 40 TB/s de largura de banda agregada e o dobro do throughput de tokens em um cenário de programação com IA; faltam, porém, detalhes completos dos testes e validação indepen...