cuFile 开源 API — Nvidia 将 cuFile API 及其底层的全套垂直存储软件栈开源,该技术允许 GPU(而非仅限 CPU)直接读写存储设备 。cuFile 是 GPUDirect Storage (GDS) 的核心组件 。代码将托管在 GitHub 上一个名为 xio-sig(加速 I/O 特别兴趣小组)的新组织下,Google、Intel、Nvidia 和 Meta 将作为初始维护方 。此举使 cuFile 从一个 Nvidia 专用接口转变为开放、由社区驱动的标准 。
但在大会后不久发布的一篇分析文章指出,截至 2026 年 8 月 4 日,尚未有任何公开的代码、许可证或为现有 GPUDirect Storage 用户提供迁移路径,因此存储架构师应将其视为一个已宣布的规划方向,而非一个已交付的正式产品 。
Storage-Next 行业计划 — 一个由超过 40 家存储和闪存厂商 组成的正式联盟,包括 DDN、KIOXIA、美光等,还有控制器制造商、散热解决方案提供商以及标准机构 。其目标是统一对 GPU 驱动下存储系统行为方式的认知,并将这些进步转化为可互操作、开放的行业标准 。
SCADA 框架 — 这是 Nvidia 此前在 ASPLOS 2023 上发布的 BaM(Big Accelerator Memory)研究的商业化产物 。SCADA 是一个运行时框架,它允许大规模并行的 GPU 独立发起和管理自己的存储 I/O 操作——GPU 上数十万个线程中的每一个都可以独立地从存储系统请求数据,并利用 GPU 侧缓存和直接的 NVMe 或远程存储访问 。
传统的由 CPU 中介的 I/O 迫使 GPU 在 CPU 设置每一次存储传输时都要等待——每次操作都会带来微秒级的内核启动和 CPU-GPU 同步开销 。cuFile 完全消除了 CPU 在 数据路径 中的参与(DMA 直接进入 GPU 内存)。SCADA 则更进一步,将 CPU 从 控制路径 中也移除——GPU 上的线程可以自行发起读取请求,合并大量分散的小请求,并从 GPU 缓存中提供服务 。在相同硬件条件下,作为其基础的 BaM 研究运行数据分析工作负载的速度比 CPU 发起访问快 5.3 倍,而图工作负载与将数据存储在主机内存中相比,硬件成本降低了高达 21.7 倍 。
GPU 处理数据的速度已经快于大多数存储系统提供数据的速度——这一差距是 AI 训练和推理的核心瓶颈 。cuFile 利用数十万 GPU 线程和高带宽内存,实现了微秒级的存储安全数据访问 。这在深度存储和 GPU 内存之间建立了一条低延迟的“高速公路”,对于需要大规模、快速并行数据拉取的检索增强生成、混合专家模型和智能代理 AI 工作流至关重要 。Storage-Next 计划确保这并非单一厂商的解决方案:40 多家厂商合作制定可互操作的标准,使整个存储生态系统能够跟上 GPU 的速度 。
如果缺乏保护,直接的 GPU 到存储访问可能让一个应用程序读取或破坏另一个应用程序的数据 。Nvidia 的 SCADA 设计分离了权限级别:性能关键的应用代码以非特权模式在可信计算基之外运行,而一个特权组件在设置阶段配置每个应用仅能访问其被批准存储资源的保护访问路径,并使用标准的 Linux 安全机制 。Nvidia 将 cuFile 定位为 AI 驱动型网络安全的基础:“快速、安全地访问数据和存储是赋能预防性和检测性网络安全措施的基石。开放 cuFile 将有助于以 AI 防御所需的速度提供安全上下文、数据和存储” 。这也同时支持了新的 开放安全 AI 联盟 。整个硬件栈(Nvidia Vera BlueField-4 STX 处理器)使用统一的 NVIDIA DOCA 安全栈在 AI 数据路径中进行持续的策略执行 。
FMS 2026 上的这三大公告,代表了 Nvidia 迄今为止为解决 GPU 计算速度与存储交付速度之间根本性架构不匹配问题所做出的最全面努力。通过开源 cuFile,Nvidia 寄希望于社区驱动的发展来加速采用和互操作性 。Storage-Next 联盟提供了必要的行业协作,以确保闪存、控制器和网络都能跟上 GPU 驱动的 I/O 模式 。而 SCADA 建立在经过验证的 BaM 研究基础上,提供了一条在数据路径和控制路径中同时消除 CPU 瓶颈的具体路径 。