เป้าหมายร่วมกันคือแก้ปัญหาสำคัญของระบบ AI ในปัจจุบัน: GPU ต้องว่างรอข้อมูล สตอเรจส่งข้อมูลไม่ทันความเร็วการประมวลผล และการเปิดให้ GPU เข้าถึงข้อมูลโดยตรงต้องมาพร้อมระบบรักษาความปลอดภัยที่รัดกุม
Nvidia เตรียมเปิดซอร์ส API ของ cuFile รวมถึงซอฟต์แวร์สแตกสำหรับสตอเรจที่อยู่เบื้องหลัง ทำให้ GPU สามารถอ่านและเขียนข้อมูลกับสตอเรจได้โดยตรง ไม่จำเป็นต้องให้ CPU เป็นผู้ดำเนินการทุกขั้นตอน
cuFile เป็นองค์ประกอบสำคัญของ GPUDirect Storage (GDS) ซึ่งออกแบบมาเพื่อส่งข้อมูลจากสตอเรจเข้าสู่หน่วยความจำของ GPU โดยตรง โค้ดดังกล่าวจะอยู่ภายใต้องค์กร xio-sig หรือ Accelerated IO Special Interest Group บน GitHub โดยมี Google, Intel, Nvidia และ Meta เป็นผู้ดูแลชุดแรก
การเปิดซอร์สครั้งนี้จึงมีนัยสำคัญต่อการทำให้การเชื่อมต่อระหว่าง GPU กับสตอเรจเป็นมาตรฐานที่เปิดกว้างและทำงานร่วมกันได้ แทนที่จะเป็นอินเทอร์เฟซที่ผูกอยู่กับ Nvidia เพียงรายเดียว
อย่างไรก็ตาม ผู้วิเคราะห์ที่ติดตามการประกาศระบุว่า ณ วันที่ 4 สิงหาคม 2026 ยังไม่พบโค้ดสาธารณะ ใบอนุญาต ตารางเคอร์เนลที่รองรับ หรือแนวทางย้ายระบบสำหรับการใช้งาน GPUDirect Storage ที่มีอยู่ ดังนั้นฝ่ายออกแบบสตอเรจควรมองเรื่องนี้เป็นทิศทางที่ประกาศแล้ว มากกว่าจะถือว่าเป็นผลิตภัณฑ์ที่พร้อมใช้งานทั่วไป
Nvidia เปิดตัว Storage-Next อย่างเป็นทางการ ซึ่งเป็นความร่วมมือของผู้ผลิตสตอเรจและแฟลชมากกว่า 40 ราย เช่น DDN, KIOXIA และ Micron รวมถึงผู้ผลิตคอนโทรลเลอร์ ผู้เชี่ยวชาญด้านระบบระบายความร้อน และองค์กรกำหนดมาตรฐาน
โครงการนี้ต้องการสร้างความเข้าใจร่วมกันว่า สตอเรจที่ขับเคลื่อนด้วย GPU ควรทำงานอย่างไร พร้อมผลักดันความก้าวหน้าดังกล่าวให้กลายเป็นมาตรฐานเปิดที่อุปกรณ์จากหลายบริษัทสามารถทำงานร่วมกันได้
SCADA เป็นเวอร์ชันที่พัฒนาเป็นผลิตภัณฑ์จากงานวิจัย BaM หรือ Big Accelerator Memory ซึ่ง Nvidia นำเสนอในงาน ASPLOS 2023
เฟรมเวิร์กนี้ทำให้ GPU ที่มีการประมวลผลแบบขนานจำนวนมหาศาลสามารถเริ่มต้นและจัดการคำสั่งรับส่งข้อมูลกับสตอเรจได้เอง เธรด GPU นับแสนเธรดสามารถร้องขอข้อมูลจากสตอเรจได้อย่างอิสระ พร้อมใช้แคชบนฝั่ง GPU และเข้าถึง NVMe หรือสตอเรจระยะไกลได้โดยตรง
ในระบบ I/O แบบเดิม CPU จะเป็นผู้เตรียมการรับส่งข้อมูลแต่ละรายการ ทำให้ GPU ต้องรอ และทุกคำขอยังมีต้นทุนจากการเรียกใช้เคอร์เนลและการประสานงานระหว่าง CPU กับ GPU ในระดับไมโครวินาที
cuFile ตัด CPU ออกจาก เส้นทางข้อมูล โดยใช้ DMA ส่งข้อมูลเข้า GPU โดยตรง ส่วน SCADA ก้าวไปอีกขั้นด้วยการตัด CPU ออกจาก เส้นทางควบคุม ด้วย เพราะเธรดบน GPU สามารถเริ่มคำขออ่านข้อมูล รวมคำขอขนาดเล็กที่กระจัดกระจาย และดึงข้อมูลจากแคชบน GPU ได้เอง
ในงานวิจัย BaM ซึ่งใช้ฮาร์ดแวร์เดียวกัน การเข้าถึงข้อมูลที่เริ่มต้นโดย GPU ทำให้เวิร์กโหลดวิเคราะห์ข้อมูลเร็วขึ้น 5.3 เท่า เมื่อเทียบกับการเข้าถึงที่เริ่มโดย CPU ขณะที่งานกราฟมีต้นทุนฮาร์ดแวร์ต่ำลงสูงสุด 21.7 เท่า เมื่อเทียบกับการเก็บข้อมูลไว้ในหน่วยความจำของโฮสต์
ปัจจุบัน GPU สามารถประมวลผลข้อมูลได้เร็วกว่าที่ระบบสตอเรจส่วนใหญ่จะป้อนข้อมูลให้ทัน ช่องว่างนี้กลายเป็นคอขวดสำคัญของการฝึกและการอนุมานโมเดล AI
cuFile ช่วยให้ GPU หลายแสนเธรดใช้หน่วยความจำแบนด์วิดท์สูงเพื่อเข้าถึงข้อมูลจากสตอเรจอย่างปลอดภัยในระดับไมโครวินาที แนวคิดนี้เปรียบได้กับการสร้างทางด่วนที่มีความหน่วงต่ำระหว่างสตอเรจชั้นลึกกับหน่วยความจำของ GPU ซึ่งมีประโยชน์กับระบบอย่าง RAG หรือการสร้างคำตอบจากข้อมูลที่ค้นคืนมา โมเดล mixture-of-experts และเวิร์กโฟลว์ AI แบบเอเจนต์ที่ต้องดึงข้อมูลจำนวนมากพร้อมกันอย่างรวดเร็ว
ด้าน Storage-Next มีบทบาทช่วยไม่ให้โซลูชันนี้กลายเป็นเทคโนโลยีของผู้ขายรายเดียว เพราะผู้ผลิตมากกว่า 40 รายจะร่วมกันผลักดันมาตรฐานที่ทำงานร่วมกันได้ เพื่อให้แฟลช คอนโทรลเลอร์ เครือข่าย และอุปกรณ์อื่น ๆ ในระบบสตอเรจพัฒนาให้ทันความเร็วของ GPU
การเปิดทางให้ GPU เข้าถึงสตอเรจโดยตรง หากไม่มีการควบคุมที่เหมาะสม อาจทำให้แอปพลิเคชันหนึ่งอ่านหรือแก้ไขข้อมูลของอีกแอปพลิเคชันได้
แนวทางของ SCADA จึงแยกระดับสิทธิ์ออกจากกัน โค้ดของแอปพลิเคชันที่ต้องการประสิทธิภาพสูงจะทำงานนอก trusted compute base โดยไม่มีสิทธิ์ระดับสูง ขณะที่ส่วนประกอบที่มีสิทธิ์จะทำหน้าที่ตั้งค่าการเข้าถึงแบบป้องกันไว้ล่วงหน้า ให้แต่ละแอปพลิเคชันเข้าถึงได้เฉพาะสตอเรจที่ได้รับอนุญาต โดยอาศัยกลไกความปลอดภัยมาตรฐานของ Linux
Nvidia มองว่า cuFile ยังเป็นพื้นฐานของระบบความปลอดภัยไซเบอร์ที่ใช้ AI เพราะการเข้าถึงข้อมูลและสตอเรจที่รวดเร็วและปลอดภัยจะช่วยให้ระบบป้องกันและตรวจจับภัยคุกคามทำงานได้ทันความเร็วของ AI การเปิด cuFile ให้ชุมชนมีส่วนร่วมจึงช่วยให้บริบทด้านความปลอดภัย ข้อมูล และสตอเรจพร้อมใช้งานในระดับความเร็วที่ระบบป้องกันภัยคุกคามต้องการ แนวทางนี้ยังสนับสนุน Open Secure AI Alliance ด้วย
สำหรับฮาร์ดแวร์ Nvidia ระบุว่าสแตกที่ใช้โปรเซสเซอร์ Nvidia Vera BlueField-4 STX จะใช้สแตกความปลอดภัยแบบรวมศูนย์ NVIDIA DOCA เพื่อบังคับใช้นโยบายอย่างต่อเนื่องตลอดเส้นทางข้อมูลของระบบ AI
การประกาศทั้งสามเรื่องสะท้อนความพยายามครั้งใหญ่ของ Nvidia ในการแก้ความไม่สอดคล้องระหว่างความเร็วของ GPU กับความเร็วในการส่งข้อมูลจากสตอเรจ
การเปิดซอร์ส cuFile คือการเดิมพันว่าการพัฒนาโดยชุมชนจะช่วยเร่งการนำไปใช้และทำให้อุปกรณ์ต่างผู้ผลิตทำงานร่วมกันได้ง่ายขึ้น Storage-Next ทำหน้าที่ประสานผู้ผลิตแฟลช คอนโทรลเลอร์ ระบบระบายความร้อน และเครือข่าย ให้ร่วมกันเตรียมสตอเรจสำหรับรูปแบบ I/O ที่ขับเคลื่อนโดย GPU ขณะที่ SCADA ซึ่งต่อยอดจากงานวิจัย BaM เสนอแนวทางที่เป็นรูปธรรมในการลดบทบาทของ CPU ทั้งในเส้นทางข้อมูลและเส้นทางควบคุม
หากการเปิดซอร์สและการทำมาตรฐานเดินหน้าได้ตามเป้าหมาย ผลลัพธ์ที่ Nvidia ต้องการคือระบบ AI ที่ใช้ GPU ได้เต็มประสิทธิภาพมากขึ้น ไม่ต้องเสียเวลารอข้อมูล และยังคงรักษาการควบคุมสิทธิ์การเข้าถึงข้อมูลไว้ได้