Ao aproximar fisicamente memória e processamento, a arquitetura reduz a distância percorrida pelos dados, uma mudança que pode aumentar a largura de banda e diminuir o consumo de energia .
Segundo as projeções apresentadas pela Samsung:
A Samsung também apresentou o zNAND-O, outra arquitetura conceitual voltada à inferência de IA em dispositivos de borda, ou seja, processamento realizado mais próximo da origem dos dados .
O anúncio mais concreto da Samsung foi o V10 BV-NAND — Bonding V-NAND, ou V-NAND com ligação de wafers. A tecnologia separa a matriz de células de memória da lógica periférica e depois une as duas partes por meio de wafer bonding .
Os principais números divulgados são:
A diferença em relação ao zHBM é central: enquanto o zHBM continua sendo uma visão de futuro, o V10 BV-NAND representa uma tecnologia anunciada como disponível para produção comercial.
A SK hynix, em parceria com a SanDisk, divulgou a primeira especificação técnica aberta para o High Bandwidth Flash (HBF) por meio do Open Compute Project (OCP), iniciativa voltada à criação de padrões abertos para infraestrutura de computação .
O HBF foi pensado como uma camada intermediária entre a DRAM de alta velocidade — incluindo a HBM — e os SSDs NVMe convencionais. A ideia é oferecer mais capacidade que a memória de alto desempenho, mas com acesso muito mais rápido que o armazenamento tradicional, reduzindo gargalos em tarefas de inferência de IA .
A especificação inicial prevê:
Por ser um padrão aberto, o HBF busca facilitar a interoperabilidade entre componentes de diferentes empresas — algo relevante para evitar que a expansão da infraestrutura de IA fique presa a soluções proprietárias.
O ponto de convergência entre palestras e painéis foi que a HBM, apesar de extremamente rápida, não consegue atender sozinha ao crescimento da demanda por memória e dados gerado pela IA.
A alternativa defendida pelo setor é uma arquitetura hierárquica de memória. Nesse modelo, diferentes tecnologias trabalham em conjunto:
Apresentações da Marvell, por exemplo, trataram explicitamente da infraestrutura necessária para a inferência de uma IA mais autônoma, com um portfólio diversificado de memória e armazenamento em vez de uma dependência exclusiva da HBM . O debate sobre CXL também destacou recursos como agrupamento e compartilhamento de memória para lidar com as exigências de capacidade e latência da inferência em escala .
Duas afirmações presentes na pergunta original não puderam ser verificadas nas fontes publicadas consultadas sobre a FMS 2026.
A primeira é a suposta previsão da Nvidia de que o número de agentes de IA ultrapassará a população mundial e de que a precificação da memória migrará do custo por gigabyte para o custo por operação de entrada e saída, ou I/O.
A segunda é a alegação de que Samsung, SK hynix e Micron já teriam vendido toda a capacidade de produção de DRAM e HBM para 2027, com clientes recebendo apenas entre 60% e 70% dos volumes solicitados.
Essas declarações podem ter sido feitas em uma palestra ou painel ainda não registrado nos relatos indexados, mas não há confirmação suficiente nas fontes disponíveis para tratá-las como fatos.
A FMS 2026 apresentou três sinais claros:
O resultado é uma visão de infraestrutura em camadas: a HBM continuará importante, mas deverá funcionar ao lado de flash de alta largura de banda, CXL e armazenamento NVMe para acompanhar a escala da inteligência artificial.