Nvidia chce udostępnić jako open source API cuFile oraz cały pionowy stos oprogramowania pamięci masowej, który za nim stoi. Dzięki cuFile nie tylko procesor, lecz także GPU może bezpośrednio odczytywać dane z magazynu i zapisywać je w nim . Technologia jest kluczowym elementem platformy GPUDirect Storage (GDS) .
Kod ma być rozwijany w serwisie GitHub pod szyldem xio-sig (Accelerated IO Special Interest Group). Wśród pierwszych opiekunów projektu znalazły się Google, Intel, Nvidia i Meta . Celem jest stworzenie otwartego, interoperacyjnego interfejsu zamiast rozwiązania zależnego wyłącznie od jednego dostawcy .
Jest jednak ważne zastrzeżenie. Analiza opublikowana krótko po ogłoszeniu wskazywała, że 4 sierpnia 2026 r. nie było jeszcze publicznego kodu, licencji, informacji o obsługiwanych jądrach ani ścieżki migracji dla istniejących wdrożeń GPUDirect Storage . Dla administratorów i architektów pamięci masowej oznacza to, że cuFile należy na razie traktować jako ogłoszony kierunek, a nie gotowy do powszechnego wdrożenia produkt.
Storage-Next to formalna inicjatywa skupiająca ponad 40 dostawców pamięci masowej i pamięci flash, w tym DDN, KIOXIA i Micron. W projekcie uczestniczą także producenci kontrolerów, firmy zajmujące się chłodzeniem oraz organizacje tworzące standardy .
Założenie jest proste: rozwój pamięci masowej dla obciążeń GPU nie powinien zależeć od zamkniętego rozwiązania jednego producenta. Uczestnicy chcą uzgodnić sposób działania magazynów sterowanych przez GPU i przekuć te ustalenia w otwarte, interoperacyjne standardy .
SCADA, czyli Scaled, Accelerated Data Access, to produktowa wersja wcześniejszych badań Nvidii nad BaM (Big Accelerator Memory), zaprezentowanych podczas ASPLOS 2023 . Framework pozwala masowo równoległym układom GPU samodzielnie inicjować i obsługiwać operacje wejścia-wyjścia.
W praktyce każde z setek tysięcy wątków GPU może niezależnie zażądać danych z lokalnej pamięci NVMe albo zdalnego magazynu. SCADA wykorzystuje również pamięć podręczną po stronie GPU i łączy wiele drobnych, rozproszonych odczytów w wydajniejsze operacje .
W tradycyjnym modelu procesor pośredniczy w każdym transferze. GPU musi czekać, aż CPU przygotuje operację, co wiąże się z narzutem uruchamiania jąder oraz synchronizacji między CPU i GPU, liczonym w mikrosekundach .
cuFile usuwa procesor z ścieżki danych: transfer DMA może trafić bezpośrednio do pamięci GPU . SCADA idzie o krok dalej i usuwa CPU także ze ścieżki sterowania. To wątki GPU inicjują odczyty, grupują małe żądania i korzystają z lokalnego cache’u .
W badaniach będących podstawą SCADA obciążenia analityczne działały na tym samym sprzęcie 5,3 raza szybciej niż przy dostępie inicjowanym przez CPU. W przypadku obciążeń grafowych uzyskano natomiast nawet 21,7 raza niższy koszt sprzętu w porównaniu z przechowywaniem danych w pamięci hosta . Są to wyniki badań BaM, a nie gwarantowane parametry każdego wdrożenia SCADA.
Dzisiejsze GPU mogą przetwarzać dane szybciej, niż większość systemów pamięci masowej jest w stanie je dostarczać. Ta różnica staje się jednym z głównych ograniczeń trenowania i uruchamiania modeli AI .
Według Nvidii cuFile może zapewnić bezpieczny dostęp do danych z opóźnieniami rzędu mikrosekund, wykorzystując setki tysięcy wątków GPU i pamięć o wysokiej przepustowości . Taki bezpośredni kanał między pamięcią masową a GPU ma znaczenie m.in. dla:
Storage-Next ma sprawić, że rozwój nie ograniczy się do jednego stosu Nvidii. Ponad 40 firm ma pracować nad standardami, które pozwolą pamięci flash, kontrolerom i sieciom nadążyć za sposobem pracy nowoczesnych GPU .
Bez odpowiednich zabezpieczeń bezpośredni dostęp GPU do pamięci masowej mógłby umożliwić jednej aplikacji odczytanie lub uszkodzenie danych należących do innego procesu . Dlatego SCADA rozdziela poziomy uprawnień.
Kod aplikacji odpowiedzialny za wydajność działa poza zaufaną bazą obliczeniową i bez uprzywilejowanego dostępu. Komponent uprzywilejowany konfiguruje podczas uruchamiania chronione połączenie między konkretną aplikacją a wyłącznie zatwierdzonym przez nią zasobem pamięci masowej. Mechanizm wykorzystuje standardowe zabezpieczenia systemu Linux .
Nvidia przekonuje również, że otwarte cuFile może pomóc systemom cyberbezpieczeństwa reagować szybciej, ponieważ udostępni kontekst bezpieczeństwa, dane i pamięć masową z szybkością wymaganą przez narzędzia AI. Inicjatywa ma wspierać także Open Secure AI Alliance . Pełny stos sprzętowy, obejmujący procesory Nvidia Vera BlueField-4 STX, korzysta ponadto ze zunifikowanego stosu bezpieczeństwa NVIDIA DOCA, który ma stale egzekwować polityki w ścieżce danych AI .
FMS 2026 pokazało szerszą strategię Nvidii: firma chce zmniejszyć architektoniczną przepaść między szybkością obliczeń GPU a przepustowością pamięci masowej. cuFile ma otworzyć kluczowy element stosu i ułatwić interoperacyjność . Storage-Next ma skoordynować działania producentów dysków flash, kontrolerów i sieci . SCADA natomiast proponuje konkretny sposób na usunięcie CPU zarówno z przepływu danych, jak i z zarządzania operacjami wejścia-wyjścia .
Na razie największą niewiadomą pozostaje tempo realizacji zapowiedzi open source. Jeśli Nvidia i pozostali opiekunowie udostępnią kod, licencję oraz jasną ścieżkę wdrożenia, cuFile może stać się ważnym elementem bardziej otwartej infrastruktury dla AI. Do tego czasu Storage-Next i SCADA są przede wszystkim sygnałem kierunku, w którym rozwija się pamięć masowa dla obciążeń GPU.