cuFile 開源 API:NVIDIA 將 cuFile API 同埋佢底下嘅成個垂直儲存軟件棧開源,呢套嘢可以畀 GPU(唔只係 CPU)直接讀寫儲存裝置 。cuFile 本身係 GPUDirect Storage(GDS)嘅核心組件 。碼源會放喺 GitHub 上面新開嘅 xio-sig(Accelerated IO Special Interest Group)組織底下,由 Google、Intel、NVIDIA 同 Meta 做初始維護者 。呢個做法等於將 cuFile 由 NVIDIA 獨家嘅私有介面變成開放、由社群驅動嘅標準 。
不過,有分析喺公布之後即刻潑咗盤冷水:截至 2026 年 8 月 4 號,仲未見到有任何公開嘅碼源、授權條款或者畀現有 GPUDirect Storage 用戶嘅升級路徑,所以儲存系統設計師應該將呢個動作視為一個公布嘅發展方向,而唔係一個已經出得街嘅產品 。
Storage-Next 業界聯盟:呢個係一個正式嘅聯盟,有成 超過 40 間 儲存同快閃記憶體廠商加入,包括 DDN、KIOXIA 同 Micron,仲有控制器製造商、散熱專家同標準制定機構 。目標係協調業界對 GPU 驅動儲存應該點樣運作嘅共識,然後將呢啲進展變成互通、開放嘅業界標準 。
SCADA 框架(Scaled, Accelerated Data Access):呢個係 NVIDIA 舊時喺 ASPLOS 2023 發表嘅 BaM(Big Accelerator Memory)研究嘅商品化版本 。SCADA 係一個運行時環境,可以畀大量平行嘅 GPU 自行發起同管理儲存 I/O 操作——即係 GPU 上面幾十萬個執行緒,每個都可以獨立向儲存系統要求數據,仲有 GPU 端快取同直接 NVMe 或遠端儲存存取能力 。
GPU 等數據等到「餓死」
傳統嘅做法係靠 CPU 做中介嚟處理 I/O,即係 CPU 要為每一次儲存傳輸做設定,GPU 就要等 CPU 做完晒先郁到——每一次操作都帶有微秒級別嘅核心啟動同 CPU-GPU 同步開銷 。cuFile 嘅做法係將 CPU 完全踢出 數據路徑(直接 DMA 入 GPU 記憶體)。SCADA 更進一步,連 控制路徑 都唔使 CPU 插手——GPU 上面嘅執行緒自己發起讀取、將細碎嘅讀取請求合併處理、仲可以喺 GPU 端快取直接 serve 數據 。喺同一硬件底下,BaM 研究顯示做數據分析工作負載可以快 5.3 倍,而圖形運算工作負載嘅硬件成本甚至可以低 21.7 倍(比起將數據放喺主記憶體嘅做法)。
AI 儲存樽頸
家陣 GPU 嘅運算速度快過大部分儲存系統可以餵數據嘅速度——呢個差距正正係 AI 訓練同推理嘅核心樽頸 。cuFile 可以利用幾十萬個 GPU 執行緒同高頻寬記憶體,做到微秒級別嘅安全數據存取 。呢個就係一條由深度儲存直通 GPU 記憶體嘅低延遲「超級公路」,對於 retrieval-augmented generation(RAG)、mixture-of-experts 模型、同 agentic AI 呢類需要大量、快速平行數據拉取嘅工作嚟講尤其關鍵 。Storage-Next 聯盟就確保呢個唔會係得一間廠商嘅方案:超過 40 間廠商一齊協作制定互通標準,令成個儲存生態圈都追得上 GPU 嘅速度 。
網絡安全挑戰
如果 GPU 直接存取儲存而冇保護,一個應用程式隨時可以讀取或者破壞另一個應用程式嘅數據 。NVIDIA 嘅 SCADA 設計就將權限分級:高效能嘅應用程式碼會喺冇特權嘅情況下執行,而一個有特權嘅組件就會喺設定時,為每個應用程式設定好只可以存取獲批准嘅儲存空間,用嘅係標準 Linux 安全機制 。
NVIDIA 將 cuFile 定位為 AI 驅動網絡安全嘅基礎:「快速安全嘅數據同儲存存取係推動預防性同偵測性網絡安全措施嘅基石。將 cuFile 開放出嚟,可以幫助安全環境、數據同儲存以 AI 驅動防禦所需要嘅速度被存取」。呢個動作亦都支援緊新成立嘅 Open Secure AI Alliance 。成個硬件棧(NVIDIA Vera BlueField-4 STX 處理器)會用統一嘅 NVIDIA DOCA 安全棧,喺 AI 數據路徑上持續執行政策 。
呢三個喺 FMS 2026 嘅公布,係 NVIDIA 至今最全面嘅一次嘗試,去解決 GPU 運算速度同儲存交付速度之間嘅根本架構錯配。通過開源 cuFile,NVIDIA 賭嘅係社群驅動嘅開發可以加快採用同互通性 。Storage-Next 聯盟就提供咗業界協調,確保快閃儲存、控制器同網絡都可以跟得上 GPU 驅動嘅 I/O 模式 。而 SCADA,建基於已經有實證嘅 BaM 研究,提供咗一條具體嘅路徑去消除 CPU 喺數據路徑同控制路徑上嘅樽頸 。