API cuFile mã nguồn mở — Nvidia đang mở mã nguồn các API cuFile và toàn bộ ngăn xếp phần mềm lưu trữ bên dưới chúng, cho phép GPU (không chỉ CPU) đọc và ghi trực tiếp vào bộ lưu trữ . cuFile là một thành phần cốt lõi của GPUDirect Storage (GDS) . Mã nguồn được lưu trữ trên GitHub dưới tổ chức mới xio-sig (Accelerated IO Special Interest Group), với Google, Intel, Nvidia và Meta là những nhà duy trì đầu tiên . Điều này biến cuFile thành một tiêu chuẩn mở, do cộng đồng thúc đẩy, thay vì là giao diện độc quyền của riêng Nvidia .
Một phân tích hoài nghi được công bố ngay sau thông báo chỉ ra rằng, tính đến ngày 4 tháng 8 năm 2026, vẫn chưa có mã công khai, giấy phép hay lộ trình di chuyển cho các hệ thống GPUDirect Storage hiện tại, nghĩa là các kiến trúc sư lưu trữ nên coi động thái này là một định hướng đã được công bố chứ chưa phải sản phẩm đã hoàn thiện .
Sáng kiến ngành Storage-Next — Một liên minh chính thức gồm hơn 40 nhà cung cấp lưu trữ và flash bao gồm DDN, KIOXIA và Micron, cùng các nhà sản xuất bộ điều khiển, chuyên gia làm mát và các tổ chức tiêu chuẩn . Mục tiêu là thống nhất cách thức hoạt động của bộ lưu trữ điều khiển bởi GPU và biến những tiến bộ đó thành các tiêu chuẩn ngành mở, có khả năng tương tác .
Framework SCADA (Scaled, Accelerated Data Access) — Đây là phiên bản thương mại hóa của nghiên cứu BaM (Big Accelerator Memory) trước đây của Nvidia từ ASPLOS 2023 . SCADA là một runtime cho phép GPU song song hàng loạt tự khởi tạo và quản lý các hoạt động I/O lưu trữ của riêng chúng — mỗi một trong số hàng trăm nghìn luồng GPU có thể độc lập yêu cầu dữ liệu từ bộ lưu trữ, với bộ nhớ đệm phía GPU và truy cập NVMe trực tiếp hoặc lưu trữ từ xa .
GPU bị 'bỏ đói' (GPU nhàn rỗi vì chờ dữ liệu)
I/O qua máy chủ truyền thống buộc GPU phải chờ trong khi CPU thiết lập mọi lần truyền tải lưu trữ — mỗi thao tác đều mang độ trễ micro giây của kernel-launch và đồng bộ CPU-GPU . cuFile loại bỏ hoàn toàn CPU khỏi đường dẫn dữ liệu (DMA trực tiếp vào bộ nhớ GPU) . SCADA tiến xa hơn bằng cách loại bỏ CPU khỏi cả đường dẫn điều khiển — các luồng trên GPU tự khởi tạo lượt đọc của riêng chúng, gộp các yêu cầu nhỏ lẻ và phục vụ chúng từ bộ nhớ đệm phía GPU . Trên cùng một phần cứng, nghiên cứu BaM nền tảng đã chạy khối lượng công việc phân tích dữ liệu nhanh hơn 5,3 lần so với truy cập do CPU khởi tạo và khối lượng công việc đồ thị với chi phí phần cứng thấp hơn tới 21,7 lần so với lưu trữ dữ liệu trong bộ nhớ máy chủ .
Tắc nghẽn lưu trữ AI
GPU giờ đây có thể xử lý dữ liệu nhanh hơn hầu hết các hệ thống lưu trữ có thể cung cấp — khoảng trống đó là nút thắt cốt lõi cho việc huấn luyện và suy luận AI . cuFile cho phép truy cập dữ liệu an toàn ở cấp độ micro giây từ bộ lưu trữ bằng cách sử dụng hàng trăm nghìn luồng GPU và bộ nhớ băng thông cao . Điều này tạo ra một 'đường cao tốc' độ trễ thấp giữa bộ lưu trữ sâu và bộ nhớ GPU, rất quan trọng cho các quy trình RAG (retrieval-augmented generation), mô hình mixture-of-experts và quy trình AI tác nhân cần truy xuất dữ liệu song song khối lượng lớn và nhanh chóng . Sáng kiến Storage-Next đảm bảo đây không phải là giải pháp của một nhà cung cấp duy nhất: hơn 40 nhà cung cấp hợp tác về các tiêu chuẩn tương tác để toàn bộ hệ sinh thái lưu trữ có thể theo kịp tốc độ GPU .
Thách thức về an ninh mạng
Truy cập trực tiếp từ GPU vào lưu trữ, nếu không được bảo vệ, có thể cho phép một ứng dụng đọc hoặc làm hỏng dữ liệu của ứng dụng khác . Thiết kế SCADA của Nvidia phân tách các cấp độ đặc quyền: mã ứng dụng quan trọng về hiệu suất chạy không có đặc quyền bên ngoài vùng tính toán tin cậy, trong khi một thành phần có đặc quyền cấu hình quyền truy cập được bảo vệ giữa mỗi ứng dụng và chỉ bộ lưu trữ được phê duyệt của nó trong quá trình thiết lập, sử dụng các cơ chế bảo mật Linux tiêu chuẩn . Nvidia coi cuFile là nền tảng cho an ninh mạng hỗ trợ AI: 'truy cập nhanh chóng, an toàn vào dữ liệu và bộ lưu trữ là yếu tố nền tảng để cung cấp năng lượng cho các biện pháp an ninh mạng phòng ngừa và phát hiện. Việc cung cấp cuFile một cách cởi mở sẽ giúp bối cảnh bảo mật, dữ liệu và bộ lưu trữ có thể truy cập được với tốc độ mà các biện pháp phòng thủ hỗ trợ AI yêu cầu' . Điều này cũng hỗ trợ Open Secure AI Alliance mới . Toàn bộ ngăn xếp phần cứng (bộ xử lý Nvidia Vera BlueField-4 STX) sử dụng ngăn xếp bảo mật NVIDIA DOCA thống nhất để thực thi chính sách liên tục trên đường dẫn dữ liệu AI .
Ba thông báo từ FMS 2026 này đại diện cho nỗ lực toàn diện nhất của Nvidia cho đến nay nhằm giải quyết sự không tương thích về kiến trúc cơ bản giữa tốc độ tính toán GPU và khả năng cung cấp lưu trữ. Bằng cách mở mã nguồn cuFile, Nvidia đặt cược rằng sự phát triển do cộng đồng thúc đẩy sẽ đẩy nhanh việc áp dụng và khả năng tương tác . Liên minh Storage-Next cung cấp sự phối hợp ngành cần thiết để đảm bảo rằng bộ nhớ flash, bộ điều khiển và mạng đều có thể theo kịp các mẫu I/O do GPU điều khiển . Và SCADA, được xây dựng dựa trên nghiên cứu BaM đã được kiểm chứng, đưa ra một con đường cụ thể để loại bỏ CPU như một nút thắt cổ chai trên cả đường dẫn dữ liệu và đường dẫn điều khiển .