L’objectif est de s’attaquer à trois limites devenues centrales pour les infrastructures d’intelligence artificielle : les GPU qui attendent des données, les systèmes de stockage qui peinent à suivre leur vitesse de calcul et les risques de sécurité associés à des accès directs aux données.
Nvidia prévoit de publier sous licence open source les API cuFile ainsi que la pile logicielle de stockage qui les accompagne. Cette technologie permet aux GPU — et non plus uniquement aux processeurs — de lire et d’écrire directement dans le stockage . cuFile constitue un composant clé de GPUDirect Storage (GDS) .
Le code doit être développé sur GitHub au sein de la nouvelle organisation xio-sig, pour Accelerated IO Special Interest Group. Google, Intel, Nvidia et Meta en sont les premiers mainteneurs . L’ambition est de faire de cuFile une interface ouverte et portée par la communauté, plutôt qu’une technologie dépendante du seul écosystème Nvidia .
Cette ouverture doit toutefois être replacée dans son calendrier réel. Une analyse publiée peu après l’annonce indiquait qu’au 4 août 2026, aucun dépôt public, aucune licence, aucune matrice de noyaux compatibles ni procédure de migration pour les installations GPUDirect Storage existantes n’étaient encore disponibles . Pour les architectes stockage, il s’agit donc d’abord d’une direction annoncée, et non d’une version immédiatement déployable.
Nvidia a également officialisé Storage-Next, une initiative réunissant plus de 40 fournisseurs de stockage et de mémoire flash, parmi lesquels DDN, KIOXIA et Micron. Des fabricants de contrôleurs, des spécialistes du refroidissement et des organismes de normalisation participent également à cette démarche .
Le but est de définir une approche commune du stockage piloté par les GPU, puis de transformer ces avancées en standards ouverts et interopérables . Cette coordination doit éviter que l’accélération de l’IA ne repose sur une solution isolée d’un seul fabricant : les SSD, les contrôleurs, les réseaux et les logiciels devront évoluer de concert.
SCADA, pour Scaled, Accelerated Data Access, est la version commercialisée des travaux de recherche BaM (Big Accelerator Memory) présentés en 2023 lors de la conférence ASPLOS .
Ce runtime permet à des GPU massivement parallèles d’initier et de gérer directement leurs propres opérations d’entrée-sortie. Des centaines de milliers de threads peuvent ainsi demander des données au stockage de manière indépendante, regrouper de petites requêtes dispersées et exploiter un cache situé côté GPU. SCADA prend en charge l’accès direct à des SSD NVMe ou à du stockage distant .
Dans une architecture traditionnelle, le processeur central prépare chaque transfert de données. Le GPU doit alors patienter pendant la configuration de l’opération, avec un coût de quelques microsecondes lié au lancement des noyaux et aux synchronisations entre CPU et GPU .
cuFile retire le CPU du chemin des données : les transferts DMA peuvent aller directement vers la mémoire du GPU . SCADA va plus loin en retirant également le CPU du chemin de contrôle. Les threads du GPU lancent eux-mêmes les lectures, regroupent les petites demandes et peuvent répondre depuis un cache local au GPU .
Dans le matériel étudié, les travaux BaM à l’origine de SCADA ont exécuté certaines charges d’analyse de données 5,3 fois plus rapidement qu’un accès initié par le CPU. Pour des traitements sur graphes, ils ont aussi affiché jusqu’à 21,7 fois moins de coûts matériels que le stockage des données dans la mémoire hôte . Ces résultats concernent les travaux de recherche sous-jacents, et non nécessairement tous les déploiements SCADA.
Les GPU peuvent désormais traiter les données plus vite que de nombreux systèmes de stockage ne parviennent à les fournir. Cet écart est devenu un goulet d’étranglement important pour l’entraînement et l’inférence des modèles d’IA .
Selon Nvidia, cuFile doit permettre un accès sécurisé aux données en quelques microsecondes, en combinant des centaines de milliers de threads GPU et de la mémoire à large bande passante . L’enjeu est de créer une liaison à faible latence entre le stockage profond et la mémoire du GPU, notamment pour les architectures de génération augmentée par récupération (RAG), les modèles à mélange d’experts et les systèmes d’IA agentique qui effectuent de nombreuses recherches de données en parallèle .
Avec ses plus de 40 participants, Storage-Next vise à faire de cette évolution un effort collectif. L’initiative doit aider l’ensemble de la chaîne du stockage à suivre les débits et les schémas d’accès imposés par les GPU .
Donner aux GPU un accès direct au stockage crée aussi un risque : sans mécanismes de protection, une application pourrait lire ou modifier les données d’une autre .
La conception de SCADA sépare donc les niveaux de privilège. Le code applicatif critique pour les performances s’exécute sans privilèges, en dehors de la base informatique de confiance. Lors de la configuration, un composant privilégié établit ensuite un accès protégé entre chaque application et les seules ressources de stockage qui lui sont autorisées, en s’appuyant sur les mécanismes de sécurité standards de Linux .
Nvidia présente également cuFile comme une brique pour la cybersécurité fondée sur l’IA. L’entreprise estime qu’un accès rapide et sécurisé aux données et au stockage est nécessaire pour alimenter les mécanismes de détection et de prévention à la vitesse requise par les défenses automatisées . Cette architecture doit aussi contribuer à la nouvelle Open Secure AI Alliance .
Côté matériel, la pile complète — notamment les processeurs Nvidia Vera BlueField-4 STX — s’appuie sur la pile de sécurité unifiée NVIDIA DOCA, conçue pour appliquer en continu les politiques de sécurité dans le chemin de données de l’IA .
Les annonces de FMS 2026 constituent la poussée la plus structurée de Nvidia à ce jour pour réduire le décalage entre la vitesse de calcul des GPU et celle du stockage. L’ouverture de cuFile doit favoriser le développement communautaire et l’interopérabilité . Storage-Next apporte la coordination industrielle nécessaire pour faire évoluer simultanément flash, contrôleurs, réseaux et refroidissement . SCADA, enfin, propose une voie concrète pour retirer le CPU du chemin des données comme du contrôle, en s’appuyant sur les recherches BaM .
La portée réelle de cette stratégie dépendra toutefois de la publication effective du code, de sa licence, de sa compatibilité avec les environnements existants et de l’adoption des standards par les fournisseurs. Pour l’heure, Nvidia a surtout posé les bases d’une architecture de stockage conçue autour du GPU.