Im Kern geht es um ein bekanntes Problem moderner KI-Systeme: Selbst sehr leistungsfähige GPUs stehen teilweise still, weil Daten nicht schnell genug aus dem Speicher eintreffen. Nvidias Ansatz soll deshalb Rechenleistung, Speicherzugriff und Sicherheitskontrollen näher zusammenbringen.
cuFile ist ein zentraler Bestandteil von GPUDirect Storage (GDS). Die Schnittstellen ermöglichen es GPUs, Daten direkt aus unterstützten lokalen oder verteilten Dateisystemen zu lesen und dorthin zu schreiben – ohne dass die CPU jeden Transfer im Datenpfad abwickeln muss . Nvidia will dafür nicht nur die APIs, sondern den gesamten darunterliegenden vertikalen Speicher-Software-Stack öffnen .
Der Code soll in der neuen GitHub-Organisation xio-sig (Accelerated IO Special Interest Group) entwickelt werden. Zu den ersten Maintainer-Unternehmen zählen Google, Intel, Nvidia und Meta . Damit soll cuFile zu einer offeneren, interoperablen Grundlage für GPU-zentrierte Speicherlösungen werden, statt ausschließlich an Nvidias eigene Schnittstellen gebunden zu sein .
Ein wichtiger Vorbehalt bleibt: Eine kurz nach der Ankündigung veröffentlichte Analyse stellte fest, dass zum 4. August 2026 noch kein allgemein verfügbarer Quellcode, keine Lizenz, keine unterstützte Kernel-Matrix und kein Migrationspfad für bestehende GPUDirect-Storage-Installationen vorlagen . Für Speicherarchitekten ist cuFile daher zunächst als angekündigte Richtung und nicht automatisch als sofort einsetzbares Release zu verstehen.
Storage-Next ist ein formelles Branchenbündnis mit mehr als 40 Speicher- und Flash-Anbietern. Dazu gehören unter anderem DDN, KIOXIA und Micron. Beteiligt sind außerdem Hersteller von Controllern, Spezialisten für Kühlung und thermisches Design sowie Standardisierungsorganisationen .
Das Ziel: Die Beteiligten sollen sich darauf verständigen, wie GPU-gesteuerte Speicherzugriffe funktionieren müssen, und daraus offene, herstellerübergreifende Standards entwickeln . Das ist entscheidend, weil ein schnellerer Zugriff wenig bringt, wenn SSDs, Controller, Netzwerke und Orchestrierung nicht zusammenspielen. Nvidia versucht damit, aus einer eigenen Technologie einen breiteren Ökosystem-Ansatz zu machen .
SCADA ist die produktisierte Weiterentwicklung von Nvidias BaM-Forschung (Big Accelerator Memory) aus dem Jahr 2023 . Das Laufzeitsystem soll massiv parallelen GPUs erlauben, ihre Speicher-I/O selbst zu initiieren und zu verwalten.
Statt dass die CPU jede einzelne Anfrage vorbereitet, können Hunderttausende GPU-Threads unabhängig Daten anfordern. SCADA fasst kleine, verstreute Lesezugriffe zusammen, nutzt einen Cache auf der GPU und greift direkt auf NVMe- oder entfernten Speicher zu . Damit soll nicht nur der Weg der Daten, sondern auch der Steuerungsweg von der CPU entlastet werden.
Bei herkömmlichen, von der CPU vermittelten I/O-Zugriffen muss die GPU warten, während der Host-Prozessor jeden Transfer vorbereitet. Kernel-Aufrufe und die Synchronisation zwischen CPU und GPU erzeugen dabei zusätzlichen Aufwand im Mikrosekundenbereich .
cuFile entfernt die CPU aus dem Datenpfad: Die Daten können per DMA direkt in den GPU-Speicher gelangen . SCADA geht einen Schritt weiter und nimmt die CPU auch aus dem Kontrollpfad. GPU-Threads starten ihre Lesevorgänge selbst, bündeln kleine Anforderungen und bedienen wiederkehrende Zugriffe aus dem GPU-Cache .
In der zugrunde liegenden BaM-Forschung liefen Datenanalyse-Workloads auf identischer Hardware bis zu 5,3-mal schneller als bei CPU-initiierten Zugriffen. Bei Graph-Workloads wurden im Vergleich zur Speicherung der Daten im Host-Speicher bis zu 21,7-mal niedrigere Hardwarekosten berichtet . Diese Werte stammen aus der Forschung und sind nicht automatisch als Leistungsversprechen für jede SCADA-Installation zu verstehen.
Moderne GPUs können Daten schneller verarbeiten, als viele Speichersysteme sie liefern. Diese Lücke wird bei KI-Training und -Inferenz zum Flaschenhals . cuFile soll mit Hunderttausenden GPU-Threads, schnellem High-Bandwidth Memory und direkten Zugriffen eine Datenübertragung mit Latenzen im Mikrosekundenbereich ermöglichen .
Besonders relevant ist das für Anwendungen, die viele Daten parallel abrufen müssen – etwa Retrieval-Augmented Generation (RAG), Mixture-of-Experts-Modelle und agentische KI-Workflows . In solchen Szenarien müssen Informationen häufig aus großen, tiefen Speicherebenen nachgeladen werden. Ein direkterer Pfad zum GPU-Speicher kann diese Transfers beschleunigen.
Storage-Next soll verhindern, dass daraus eine reine Ein-Anbieter-Lösung wird. Durch die Zusammenarbeit von mehr als 40 Unternehmen sollen interoperable Standards entstehen, mit denen die gesamte Speicherinfrastruktur mit dem Tempo GPU-getriebener I/O-Muster Schritt halten kann .
Direkte GPU-zu-Speicher-Zugriffe schaffen allerdings auch ein Sicherheitsrisiko. Ohne geeignete Schutzmechanismen könnte eine Anwendung Daten einer anderen Anwendung lesen oder beschädigen .
SCADA trennt deshalb die Berechtigungsstufen: Der performancekritische Anwendungscode läuft unprivilegiert außerhalb der Trusted Computing Base. Eine privilegierte Komponente richtet während der Initialisierung geschützte Verbindungen ein – jeweils nur zwischen einer Anwendung und dem für sie freigegebenen Speicher. Dabei kommen etablierte Linux-Sicherheitsmechanismen zum Einsatz .
Nvidia sieht cuFile außerdem als Grundlage für KI-gestützte Cybersicherheit. Nach Darstellung des Unternehmens müssen Sicherheitskontext, Daten und Speicher mit der Geschwindigkeit verfügbar sein, mit der KI-basierte Abwehrsysteme arbeiten . Der offene Ansatz soll auch die Open Secure AI Alliance unterstützen . Für den vollständigen Hardware-Stack nennt Nvidia zudem Vera- und BlueField-4-STX-Prozessoren sowie den einheitlichen NVIDIA-DOCA-Sicherheitsstack zur kontinuierlichen Durchsetzung von Richtlinien im KI-Datenpfad .
Zusammengenommen markieren cuFile, Storage-Next und SCADA Nvidias bisher umfassendsten Versuch, die architektonische Lücke zwischen GPU-Rechenleistung und Speicherbereitstellung zu schließen. cuFile soll den direkten Datenpfad öffnen, SCADA zusätzlich die Steuerung auf die GPU verlagern und Storage-Next dafür sorgen, dass verschiedene Anbieter nach gemeinsamen Regeln zusammenarbeiten .
Der praktische Nutzen wird jedoch davon abhängen, wann der angekündigte Open-Source-Code tatsächlich mit Lizenz, Dokumentation und einem belastbaren Migrationspfad verfügbar ist . Bis dahin ist die Richtung klar: KI-Systeme sollen nicht mehr vor allem auf Daten warten – sondern Speicherzugriffe ähnlich parallel und flexibel ausführen können wie ihre Berechnungen.