Matlamatnya ialah menangani masalah asas dalam infrastruktur AI moden: GPU yang terbiar kerana menunggu data, storan yang tidak mampu mengimbangi kelajuan pemprosesan GPU, serta risiko keselamatan apabila GPU mengakses storan secara terus.
Nvidia akan membuka sumber API cuFile bersama keseluruhan susunan perisian storan menegak yang menyokongnya. Teknologi ini membolehkan GPU—bukan CPU sahaja—membaca dan menulis data terus ke storan . cuFile ialah komponen penting dalam platform GPUDirect Storage (GDS) Nvidia .
Kod tersebut akan dihoskan di GitHub di bawah organisasi baharu xio-sig (Accelerated I/O Special Interest Group). Google, Intel, Nvidia dan Meta dinamakan sebagai penyelenggara sulung . Langkah ini berpotensi menjadikan cuFile antara muka yang lebih terbuka dan boleh dikembangkan bersama komuniti, bukannya teknologi yang bergantung sepenuhnya pada Nvidia .
Namun, pengumuman itu belum semestinya bermakna keluaran umum sudah tersedia. Analisis yang diterbitkan selepas pengumuman mendapati bahawa setakat 4 Ogos 2026, belum ada bukti mengenai kod awam, lesen, matriks kernel yang disokong atau laluan migrasi untuk penggunaan GPUDirect Storage sedia ada . Oleh itu, pasukan yang mengurus seni bina storan wajar menganggapnya sebagai hala tuju yang diumumkan, bukan produk yang sudah boleh digunakan secara meluas.
Nvidia turut melancarkan secara rasmi Storage-Next, sebuah inisiatif yang menghimpunkan lebih 40 vendor storan dan memori kilat, termasuk DDN, KIOXIA dan Micron . Inisiatif ini juga melibatkan pembuat pengawal, pakar penyejukan dan badan piawaian .
Fokusnya adalah untuk menyelaraskan cara storan yang dipacu GPU berfungsi, sebelum menukarkan kemajuan tersebut kepada piawaian industri yang terbuka dan boleh saling beroperasi . Pendekatan ini penting kerana peningkatan prestasi AI tidak boleh bergantung pada satu vendor sahaja; SSD, pengawal, rangkaian dan perisian perlu bergerak seiring dengan keperluan GPU.
SCADA, atau Scaled, Accelerated Data Access, ialah bentuk produk bagi penyelidikan BaM (Big Accelerator Memory) Nvidia yang dibentangkan pada ASPLOS 2023 . Ia merupakan runtime yang membolehkan GPU berbilang selari memulakan dan mengurus operasi I/O storan sendiri.
Dalam reka bentuk ini, setiap satu daripada ratusan ribu utas GPU boleh meminta data terus daripada storan. SCADA turut menyediakan cache pada GPU dan menyokong akses terus kepada storan NVMe tempatan atau storan jauh .
Dalam model I/O tradisional, CPU perlu menyediakan setiap pemindahan data. GPU terpaksa menunggu, manakala setiap operasi menambah kelewatan pada tahap mikrosaat akibat pelancaran kernel serta penyelarasan antara CPU dan GPU .
cuFile membuang CPU daripada laluan data—DMA boleh memindahkan data terus ke memori GPU . SCADA pergi lebih jauh dengan mengeluarkan CPU daripada laluan kawalan juga. Utas pada GPU boleh memulakan bacaan sendiri, menggabungkan permintaan kecil yang bertaburan dan menggunakan cache GPU untuk mempercepatkan akses .
Dalam perkakasan yang sama, penyelidikan BaM yang menjadi asas SCADA menjalankan beban kerja analitik data sehingga 5.3 kali lebih pantas berbanding akses yang dimulakan CPU. Bagi beban kerja graf, ia turut menunjukkan kos perkakasan sehingga 21.7 kali lebih rendah berbanding menyimpan data dalam memori hos .
GPU kini boleh memproses data lebih pantas daripada kebanyakan sistem storan menghantarnya. Jurang inilah yang menjadi antara halangan utama untuk latihan dan inferens AI .
Menurut Nvidia, cuFile membolehkan akses data storan pada tahap mikrosaat dengan memanfaatkan ratusan ribu utas GPU serta memori berlebar jalur tinggi . Hasilnya ialah laluan kependaman rendah antara storan berkapasiti besar dan memori GPU—sesuatu yang penting untuk sistem retrieval-augmented generation (RAG), model mixture-of-experts dan aliran kerja AI berasaskan ejen yang perlu menarik sejumlah besar data secara selari .
Storage-Next pula bertujuan memastikan penyelesaian ini tidak terkunci kepada satu ekosistem. Lebih 40 vendor bekerjasama membentuk piawaian yang boleh saling beroperasi supaya keseluruhan industri storan dapat mengejar kelajuan I/O yang dipacu GPU .
Akses GPU-ke-storan secara terus boleh menimbulkan risiko jika tiada kawalan yang sesuai. Sebuah aplikasi berpotensi membaca atau merosakkan data milik aplikasi lain .
Reka bentuk SCADA memisahkan tahap keistimewaan. Kod aplikasi yang mementingkan prestasi berjalan tanpa keistimewaan dan berada di luar asas pengkomputeran dipercayai. Sementara itu, komponen berkeistimewaan menetapkan akses terlindung antara setiap aplikasi dengan storan yang diluluskan semasa proses persediaan, menggunakan mekanisme keselamatan Linux standard .
Nvidia juga menganggap cuFile sebagai asas untuk keselamatan siber berkuasa AI. Menurut syarikat itu, akses pantas dan selamat kepada data serta storan diperlukan supaya sistem pertahanan siber pencegahan dan pengesanan dapat beroperasi pada kelajuan AI . Reka bentuk ini turut menyokong Open Secure AI Alliance .
Bagi keseluruhan susunan perkakasan, pemproses Nvidia Vera BlueField-4 STX menggunakan susunan keselamatan NVIDIA DOCA untuk penguatkuasaan polisi secara berterusan dalam laluan data AI .
Tiga pengumuman di FMS 2026 menunjukkan usaha Nvidia yang paling menyeluruh setakat ini untuk merapatkan jurang antara kelajuan pengiraan GPU dan keupayaan penghantaran data storan.
Pembukaan sumber cuFile ialah pertaruhan Nvidia bahawa pembangunan komuniti akan mempercepatkan penggunaan serta keserasian antara vendor . Storage-Next menyediakan penyelarasan industri supaya storan kilat, pengawal dan rangkaian dapat menyesuaikan diri dengan corak I/O yang dipacu GPU . SCADA pula menawarkan laluan praktikal untuk mengurangkan peranan CPU sebagai titik sempit—bukan sahaja dalam pemindahan data, tetapi juga dalam mengawal permintaan storan .
Buat masa ini, cabaran utama ialah pelaksanaan. Selagi kod, lesen dan laluan migrasi cuFile belum tersedia secara terbuka, organisasi tidak boleh menganggap pengumuman ini sebagai pengganti segera untuk pemasangan GPUDirect Storage sedia ada . Namun, jika ekosistem Storage-Next dan xio-sig berkembang seperti yang dirancang, akses storan yang lebih terbuka, pantas dan selamat boleh menjadi lapisan penting untuk generasi aplikasi AI seterusnya.