Nvidia ha annunciato l’apertura delle API cuFile e dell’intero stack software verticale che le supporta. La tecnologia permette alle GPU, e non soltanto alle CPU, di leggere e scrivere direttamente sullo storage . cuFile è un componente fondamentale di GPUDirect Storage (GDS), la piattaforma Nvidia che abilita il trasferimento diretto dei dati verso la memoria della GPU .
Il progetto sarà ospitato su GitHub nella nuova organizzazione xio-sig, acronimo di Accelerated I/O Special Interest Group. Google, Intel, Nvidia e Meta sono indicati come manutentori iniziali . La scelta punta a trasformare cuFile da interfaccia legata a un singolo fornitore in una base aperta per migliorare interoperabilità e sviluppo dello storage destinato alle GPU .
C’è però una precisazione importante per chi gestisce infrastrutture in produzione: al 4 agosto 2026 non risultavano ancora disponibili pubblicamente un repository completo, una licenza, una matrice dei kernel supportati o una procedura di migrazione per le installazioni GPUDirect Storage già esistenti . Per ora, quindi, l’annuncio va letto come una direzione strategica, non necessariamente come un rilascio già pronto per tutti gli ambienti.
Nvidia ha inoltre lanciato formalmente Storage-Next, un’iniziativa che riunisce più di 40 produttori di storage e memoria flash, tra cui DDN, KIOXIA e Micron . Nel progetto rientrano anche produttori di controller, aziende specializzate nel raffreddamento e nell’orchestrazione, oltre a organismi di standardizzazione.
L’obiettivo è concordare il modo in cui i sistemi di storage dovrebbero rispondere ai carichi generati dalle GPU e trasformare questi sviluppi in standard aperti e interoperabili . In questo modo Nvidia prova a evitare che il nuovo modello dipenda da una sola combinazione di hardware e software: per sostenere l’IA, infatti, devono evolvere insieme SSD, controller, rete, gestione termica e piattaforme di calcolo .
La terza novità è SCADA, acronimo di Scaled, Accelerated Data Access. Il framework è la versione pronta per l’uso della ricerca BaM (Big Accelerator Memory) presentata da Nvidia e dai suoi partner ad ASPLOS 2023 .
Nei sistemi tradizionali, la CPU prepara e coordina ogni trasferimento. SCADA sposta invece una parte sostanziale del controllo sulla GPU: ciascuno dei suoi centinaia di migliaia di thread può avviare richieste di lettura, combinare piccoli accessi non contigui e recuperare i dati da una cache direttamente sulla GPU. Il sistema può accedere inoltre a storage NVMe locale o remoto .
L’addestramento e l’inferenza dei modelli IA non dipendono solo dalla potenza di calcolo. Se i dati non arrivano abbastanza rapidamente, la GPU rimane in attesa, mentre il costo dell’hardware continua a crescere.
Con l’I/O mediato dall’host, ogni operazione comporta attività della CPU, lancio di kernel e sincronizzazioni tra CPU e GPU. Anche quando il trasferimento effettivo richiede poco tempo, questi passaggi possono aggiungere latenza dell’ordine dei microsecondi .
cuFile elimina la CPU dal percorso dei dati: il trasferimento DMA può arrivare direttamente nella memoria della GPU . SCADA fa un passo ulteriore, togliendo la CPU anche dal percorso di controllo: sono i thread della GPU ad avviare le richieste, a raggruppare gli accessi più piccoli e a sfruttare la cache locale .
Nei test della ricerca BaM, eseguiti su hardware identico, i carichi di analisi dei dati hanno raggiunto prestazioni 5,3 volte superiori rispetto all’accesso avviato dalla CPU. Nei carichi di tipo grafo, la ricerca ha inoltre riportato costi hardware fino a 21,7 volte inferiori rispetto all’archiviazione dei dati nella memoria dell’host . Si tratta di risultati della ricerca BaM, non di una promessa generalizzata per ogni applicazione SCADA.
Le GPU moderne possono elaborare i dati più rapidamente di quanto molti sistemi di storage riescano a fornirli. Questo divario è diventato un collo di bottiglia per addestramento e inferenza .
Nvidia sostiene che cuFile possa rendere possibile un accesso sicuro ai dati con latenze nell’ordine dei microsecondi, sfruttando centinaia di migliaia di thread della GPU e memorie ad alta larghezza di banda . Il risultato atteso è una sorta di collegamento a bassa latenza tra lo storage “profondo” e la memoria della GPU, utile per applicazioni che devono recuperare grandi quantità di dati in parallelo.
Tra gli scenari indicati rientrano i sistemi RAG (retrieval-augmented generation), i modelli mixture-of-experts e i flussi di lavoro di IA agentica, tutti caratterizzati da richieste frequenti e massicce di dati . Storage-Next dovrebbe contribuire a rendere questo modello meno dipendente da un singolo fornitore, coordinando più di 40 aziende attorno a standard compatibili .
Permettere a una GPU di accedere direttamente allo storage aumenta le prestazioni, ma senza adeguate protezioni potrebbe consentire a un’applicazione di leggere o modificare i dati di un’altra . Per questo SCADA separa i livelli di privilegio.
Il codice applicativo responsabile delle prestazioni opera senza privilegi e al di fuori della trusted compute base, cioè l’insieme minimo di componenti considerati affidabili. Un componente privilegiato configura invece, durante la fase di inizializzazione, gli accessi protetti tra ogni applicazione e il solo storage autorizzato, facendo uso dei normali meccanismi di sicurezza di Linux .
Nvidia considera inoltre cuFile una base per la sicurezza informatica alimentata dall’IA: difese preventive e di rilevamento hanno bisogno di accedere rapidamente sia al contesto di sicurezza sia ai dati e allo storage . L’architettura è collegata anche alla nuova Open Secure AI Alliance .
Sul piano hardware, lo stack completo basato sui processori Nvidia Vera BlueField-4 STX utilizza la piattaforma di sicurezza unificata NVIDIA DOCA per applicare continuamente le policy nel percorso dei dati IA .
Le tre iniziative indicano un tentativo di correggere il disallineamento tra velocità di calcolo e velocità di distribuzione dei dati. L’apertura di cuFile potrebbe favorire interoperabilità e adozione, ma il suo impatto concreto dipenderà dalla disponibilità effettiva del codice, dalla licenza, dal supporto ai sistemi esistenti e dalla partecipazione della comunità .
Storage-Next punta a coordinare l’ecosistema: non basta avere una GPU più potente se SSD, controller e rete non riescono a sostenerne il ritmo. SCADA, infine, propone un percorso tecnico per rimuovere la CPU sia dal trasferimento dei dati sia dalla gestione delle singole richieste .
La promessa è quindi ambiziosa: meno GPU ferme ad aspettare, storage più vicino al calcolo e accessi più controllati. Ma per capire se Nvidia avrà davvero risolto il problema della “fame” di dati dell’IA bisognerà attendere i rilasci open source e le prime implementazioni interoperabili su larga scala.