cuFile 開源 API — Nvidia 宣布將 cuFile API 及其底層完整的垂直儲存軟體堆疊開源,這套技術允許 GPU(而非僅限 CPU)直接對儲存裝置進行讀寫 。cuFile 是 GPUDirect Storage(GDS)平台的核心元件 。程式碼將託管於 GitHub 上新成立的 xio-sig(加速 IO 特殊興趣小組)組織,由 Google、Intel、Nvidia 與 Meta 擔任初始維護者 。此舉代表 cuFile 將從 Nvidia 獨佔的封閉介面,轉變為由社群共同驅動的開放標準 。
不過,在宣布後不久,一篇分析文章便指出,截至 2026 年 8 月 4 日,外界尚未看到任何公開的程式碼、授權條款,或是為既有 GPUDirect Storage 用戶提供的遷移路徑;這意味著儲存架構師應將此視為一個已宣布的發展方向,而非一個已經出貨的產品 。
Storage-Next 產業聯盟 — 這是一個正式的產業聯盟,成員涵蓋 超過 40 家 儲存與快閃記憶體供應商,包括 DDN、KIOXIA、Micron,以及控制器製造商、散熱技術廠商和各標準制定組織 。其目標是針對 GPU 主導的儲存行為建立共識,並將這些技術進展轉化為可互通、開放的產業標準 。
SCADA 框架(可擴展加速資料存取) — 這是 Nvidia 將早期在 ASPLOS 2023 發表的 BaM(大型加速器記憶體)研究成果產品化的成果 。SCADA 是一套執行時期環境,它允許大規模平行運算的 GPU 自行發起並管理儲存 I/O 操作——也就是說,數十萬個 GPU 執行緒中的每一個,都可以獨立地向儲存系統請求資料,並利用 GPU 端的快取機制以及直接 NVMe 或遠端儲存存取能力 。
GPU 飢餓(GPU 因等待資料而閒置)
在傳統架構中,每次儲存傳輸都需要 CPU 介入設定,這迫使 GPU 必須等待——每次操作都會帶來微秒級的內核啟動與 CPU-GPU 同步開銷 。cuFile 徹底將 CPU 排除在 資料路徑 之外(透過 DMA 直接寫入 GPU 記憶體)。SCADA 更進一步,連 控制路徑 上的 CPU 都移除——GPU 上的執行緒可以自主發起讀取請求,將零散的小型請求批次處理,並從 GPU 端的快取中提供服務 。在相同硬體條件下,其基礎 BaM 研究的結果顯示,資料分析工作負載的執行速度比 CPU 發起的存取方式快 5.3 倍;而在圖形處理工作負載中,與將資料儲存在主記憶體相比,硬體成本更可降低高達 21.7 倍 。
AI 儲存瓶頸
目前 GPU 的資料處理速度,已遠超過多數儲存系統的供給能力——這個差距正是 AI 訓練與推理的核心瓶頸 。cuFile 能透過數十萬個 GPU 執行緒與高頻寬記憶體,實現微秒級的安全儲存資料存取 。這在深度儲存層與 GPU 記憶體之間建立了一條低延遲的「高速公路」,對於需要大規模、快速平行資料擷取的檢索增強生成(RAG)、混合專家模型(MoE)以及自主 AI 代理工作流程而言至關重要 。Storage-Next 聯盟則確保這不會是單一廠商的解決方案:超過 40 家供應商共同合作制定互通標準,讓整個儲存生態系都能追上 GPU 的速度 。
網路安全挑戰
直接讓 GPU 存取儲存裝置,若未加防護,可能導致一個應用程式讀取或破壞另一個應用程式的資料 。Nvidia 的 SCADA 設計採用了分層權限機制:負責效能的應用程式程式碼在非特權模式下運作,被排除在可信運算基礎(TCB)之外;而一個特權元件則負責在設定階段,為每個應用程式配置僅能存取其授權儲存空間的受保護通道,並沿用標準 Linux 安全機制 。Nvidia 將 cuFile 定位為 AI 驅動網路安全的基石:「快速且安全地存取資料與儲存,是驅動預防與偵測型網路安全措施的基礎要素。讓 cuFile 開放可用,將有助於以 AI 防禦所需的速度,安全地存取安全上下文、資料與儲存」 。此舉也支援了最新的 Open Secure AI Alliance 。整體硬體堆疊(Nvidia Vera BlueField-4 STX 處理器)則採用統一的 NVIDIA DOCA 安全堆疊,在 AI 資料路徑中實現持續的政策強制執行 。
這三項在 FMS 2026 上發布的消息,代表了 Nvidia 迄今為止最全面的一次出擊,目標是解決 GPU 運算速度與儲存傳輸速度之間從根本上的架構不匹配。透過開源 cuFile,Nvidia 押注社群驅動的開發模式將加速技術的採用與互通性 。Storage-Next 聯盟則提供了必要的產業協調,確保快閃儲存、控制器與網路傳輸都能跟上 GPU 主導的 I/O 模式 。而 SCADA 框架,建立在已經過驗證的 BaM 研究基礎之上,提供了一條具體的道路,能將 CPU 這個瓶頸同時從資料路徑與控制路徑中徹底移除 。