L’obiettivo è ridurre drasticamente la distanza che i dati devono percorrere tra memoria e processore. Meno strada significa, almeno in prospettiva, più banda disponibile e minori consumi legati al trasferimento dei dati .
Secondo le stime presentate da Samsung, un sistema d’interfaccia basato su zHBM potrebbe raggiungere:
Alcune ricostruzioni riportano inoltre una velocità di trasferimento dei dati quattro volte superiore a HBM4 con un quarto della potenza assorbita . Si tratta però di proiezioni tecnologiche, non dei risultati di un prodotto già disponibile.
Il punto decisivo è proprio questo: zHBM è ancora un modello concettuale, non un componente in produzione . Le cifre annunciate descrivono il potenziale dell’architettura e non prestazioni già certificate su sistemi commerciali.
Samsung ha mostrato anche zNAND-O, un’architettura concettuale pensata per l’inferenza IA sul dispositivo, cioè per elaborare i dati vicino alla fonte — per esempio su sistemi edge — invece di trasferirli sempre a un data center .
La proposta più concreta di Samsung è la V10 BV-NAND, dove “BV-NAND” significa Bonding V-NAND. La tecnologia separa l’array di memoria dalla logica periferica e unisce successivamente i wafer mediante una tecnica di wafer bonding .
Il risultato supera i 400 strati attivi, il numero più alto mai dichiarato da Samsung per la propria famiglia V-NAND . Rispetto alla generazione precedente V9, la densità di memoria aumenta di circa il 58% .
Samsung attribuisce inoltre alla nuova struttura un miglioramento di circa tre volte dell’efficienza energetica e una riduzione della resistenza termica . L’aumento del numero di strati dovrebbe contribuire anche a migliorare le prestazioni di lettura, scrittura e I/O.
A differenza di zHBM, la V10 BV-NAND è indicata nelle fonti disponibili come già in produzione di massa, e viene descritta come la prima NAND commerciale a superare la soglia dei 400 strati . Alcuni resoconti parlano tuttavia anche di un “prototype”, perciò la distinzione tra presentazione iniziale e disponibilità presso i clienti va mantenuta con cautela.
SK hynix e SanDisk hanno presentato la prima specifica tecnica aperta per la High Bandwidth Flash (HBF) attraverso l’Open Compute Project (OCP) . L’iniziativa punta a creare un nuovo livello di memoria per i carichi di lavoro IA, soprattutto durante l’inferenza.
La specifica iniziale prevede:
L’HBF non vuole sostituire completamente l’HBM. Il suo ruolo sarebbe piuttosto quello di occupare lo spazio intermedio tra la memoria DRAM ad altissima velocità e gli SSD NVMe tradizionali: più capienza dell’HBM, ma accesso molto più rapido rispetto allo storage convenzionale .
A rafforzare l’ecosistema hanno partecipato anche Google DeepMind e Tenstorrent, entrate nell’alleanza HBF . Il ricorso a una specifica aperta, invece di un collegamento proprietario, potrebbe facilitare l’interoperabilità tra acceleratori, sistemi di memoria e piattaforme di diversi produttori.
Il filo conduttore di FMS 2026 è stato il superamento dell’idea che basti aggiungere altra HBM per risolvere i problemi di memoria dell’IA. I modelli sempre più grandi e l’inferenza con agenti IA spingono contemporaneamente sulla capacità, sulla banda, sulla latenza e sui consumi.
La direzione indicata da diversi interventi è una memoria gerarchica, cioè un sistema a più livelli che combina:
Le presentazioni di Marvell hanno sottolineato, in particolare, la necessità di un portafoglio diversificato per l’inferenza dell’IA agentica, invece di puntare esclusivamente sull’HBM . Anche gli interventi di altri operatori hanno evidenziato il ruolo crescente di flash, CXL e storage nel ridurre i colli di bottiglia della memoria .
In pratica, il futuro potrebbe assomigliare meno a una singola memoria “più veloce” e più a una rete di livelli coordinati: i dati urgenti restano vicini all’acceleratore, mentre contesto, cache e informazioni meno critiche vengono spostati su strati più capienti ed efficienti.
Due dichiarazioni contenute nella domanda originale non hanno trovato conferma nelle fonti pubblicate consultabili su FMS 2026.
La prima riguarda una presunta previsione di Nvidia secondo cui gli agenti IA supereranno in numero la popolazione mondiale e il prezzo della memoria passerà dal costo per gigabyte al costo per operazione di I/O. La seconda sostiene che Samsung, SK hynix e Micron avrebbero già venduto tutta la capacità produttiva DRAM e HBM del 2027, con i clienti costretti a ricevere soltanto il 60-70% dei volumi richiesti.
Queste affermazioni potrebbero essere state pronunciate durante un keynote o un panel non ancora documentato nei resoconti indicizzati, ma non possono essere presentate come fatti confermati sulla base delle fonti disponibili.
FMS 2026 ha prodotto tre segnali solidi:
La conclusione è meno spettacolare di una singola cifra — 8 volte le prestazioni o 3,0 TB/s — ma probabilmente più importante: nell’era dell’IA, la sfida non consiste soltanto nel rendere più veloce il processore. Consiste nel portare i dati al posto giusto, al momento giusto e con il minor consumo possibile.