המטרה המשותפת היא להתמודד עם שלוש בעיות מרכזיות בתשתיות בינה מלאכותית: מעבדי GPU שממתינים לנתונים, מערכות אחסון שאינן עומדות בקצב העיבוד, והצורך לאבטח גישה ישירה של מעבדים גרפיים למידע.
cuFile הוא ממשק תוכנה שמאפשר ל-GPU — ולא רק ל-CPU — לקרוא נתונים מהאחסון ולכתוב אליו ישירות. הוא רכיב מרכזי בפלטפורמת GPUDirect Storage של Nvidia.
הקוד והסטאק התוכנתי שמאחוריו אמורים להתפתח תחת ארגון xio-sig ב-GitHub, קבוצת עניין מיוחדת לקלט/פלט מואץ. בין המנהלים הראשונים נמנות Google, Intel, Nvidia ו-Meta. בכך מבקשת Nvidia להפוך את cuFile מממשק המזוהה עם ספק יחיד לתשתית פתוחה, שתוכל לתמוך בפתרונות של יצרנים שונים.
עם זאת, חשוב להבחין בין הכרזה לבין זמינות מעשית: ניתוח שפורסם לאחר ההכרזה ציין כי נכון ל-4 באוגוסט 2026 לא היו עדיין לציבור קוד זמין באופן כללי, רישיון, מטריצת תמיכה לגרסאות ליבה או מסלול הגירה לפריסות GPUDirect Storage קיימות. לכן ארכיטקטים של אחסון צריכים לראות במהלך כיוון שהוכרז, ולא מוצר פתוח ומוכן לפריסה.
Storage-Next היא יוזמה תעשייתית רשמית שבה משתתפים יותר מ-40 יצרני אחסון וזיכרונות פלאש, בהם DDN, KIOXIA ו-Micron. לצד יצרני האחסון משתתפים גם יצרני בקרים, מומחי קירור, ספקי תזמור וגופי תקינה.
היעד הוא להסכים על האופן שבו אחסון המופעל בידי GPUs צריך לעבוד, ולאחר מכן להפוך את החידושים לתקנים פתוחים ותואמים זה לזה. מבחינת Nvidia, זו דרך למנוע מצב שבו כל יצרן בונה פתרון סגור משלו, שאינו מתקשר היטב עם שאר רכיבי התשתית.
SCADA היא הגרסה המוצרית של מחקר BaM — Big Accelerator Memory שהציגה Nvidia ב-ASPLOS 2023. מדובר בסביבת ריצה שמאפשרת ל-GPU ליזום ולנהל בעצמו פעולות קלט/פלט מול האחסון.
במקום שכל בקשת נתונים תעבור דרך המעבד המרכזי, כל אחד ממאות אלפי התהליכונים המקביליים של ה-GPU יכול לבקש נתונים באופן עצמאי. המסגרת כוללת גם מטמון בצד ה-GPU וגישה ישירה לאחסון NVMe מקומי או מרוחק.
במודל המסורתי, ה-CPU מכין כל העברת נתונים ומתווך בין התוכנה, האחסון וה-GPU. התהליך מוסיף השהיות של מיקרו-שניות בגלל הפעלת ליבות ותיאום בין המעבד המרכזי למעבד הגרפי.
cuFile מוציאה את ה-CPU מנתיב הנתונים: העברת הנתונים מתבצעת ישירות באמצעות DMA אל זיכרון ה-GPU. SCADA הולכת צעד נוסף ומוציאה את ה-CPU גם מנתיב הבקרה — התהליכונים על ה-GPU יוזמים קריאות בעצמם, מאחדים בקשות קטנות ומפוזרות ויכולים לשרת אותן ממטמון מקומי.
במחקר BaM שעליו מבוססת SCADA, באותה חומרה, עומסי ניתוח נתונים רצו עד פי 5.3 מהר יותר מגישה שיזם ה-CPU. בעומסי גרפים הודגם גם חיסכון של עד פי 21.7 בעלות החומרה לעומת אחסון הנתונים בזיכרון המארח.
ה-GPUs המודרניים מסוגלים לעבד מידע בקצב גבוה יותר מזה שמערכות אחסון רבות מסוגלות לספק. הפער הזה הופך לצוואר בקבוק באימון ובהרצת מודלי AI.
לפי Nvidia, cuFile מאפשרת גישה מאובטחת לנתונים ברמת השהיה של מיקרו-שניות, תוך שימוש במאות אלפי תהליכונים ובזיכרון בעל רוחב פס גבוה. בפועל, מדובר בניסיון ליצור נתיב מהיר יותר בין שכבות האחסון העמוקות לבין זיכרון ה-GPU.
הדבר עשוי להיות חשוב במיוחד ליישומים שמבצעים שליפות מקביליות רבות, כמו מערכות RAG — יצירת תשובות המבוססות על מאגרי מידע חיצוניים — מודלי תערובת מומחים וזרימות עבודה של סוכני AI.
Storage-Next נועדה לוודא שהפתרון לא יישאר תלוי בספק אחד: יותר מ-40 חברות אמורות לעבוד על תקנים תואמים, כך שגם התקני פלאש, בקרים, קישוריות ורכיבי קירור יוכלו לעמוד בקצב של קלט/פלט שמנוהל בידי GPU.
גישה ישירה של GPU לאחסון יכולה לשפר ביצועים, אך ללא בידוד מתאים היא עלולה לאפשר ליישום אחד לקרוא נתונים של יישום אחר או לשבש אותם.
העיצוב של SCADA מפריד בין רמות הרשאה. קוד היישום שמבצע את העבודה עתירת-הביצועים פועל ללא הרשאות מיוחדות ומחוץ לבסיס המחשוב המהימן. רכיב בעל הרשאות מוגברות מגדיר בזמן האתחול את הגישה המוגנת בין כל יישום לבין האחסון שאושר לו בלבד, תוך שימוש במנגנוני האבטחה המקובלים של Linux.
Nvidia מציגה את cuFile גם כתשתית לאבטחת סייבר המופעלת בידי AI: גישה מהירה ומאובטחת לנתונים ולהקשר האבטחה מאפשרת למערכות הגנה מונעות ומזהות לפעול בקצב הנדרש. המהלך משתלב גם בתמיכה ב-Open Secure AI Alliance.
בסטאק החומרה המלא, הכולל את מעבדי Nvidia Vera BlueField-4 STX, החברה משתמשת בסטאק האבטחה המאוחד NVIDIA DOCA לאכיפה רציפה של מדיניות לאורך נתיב הנתונים של מערכות ה-AI.
שלושת המהלכים מסמנים ניסיון רחב של Nvidia לטפל בחוסר ההתאמה בין קצב החישוב של GPUs לבין קצב אספקת הנתונים. פתיחת cuFile נועדה לעודד פיתוח קהילתי ותאימות בין יצרנים. Storage-Next אמורה לספק את התיאום התעשייתי הדרוש כדי שגם האחסון, הבקרים והרשתות יתקדמו יחד. SCADA מציעה את הנתיב המעשי להסרת ה-CPU הן מנתיב הנתונים והן מנתיב הבקרה, על בסיס מחקר BaM.
בשלב זה, חלק מההבטחה עדיין תלוי ביישום בפועל: זמינות הקוד, תנאי הרישוי, התמיכה במערכות קיימות והיכולת של עשרות החברות להסכים על תקנים משותפים. אם המהלך יבשיל, הוא עשוי לשנות את נקודת המפגש בין GPU, אחסון ואבטחה — לא באמצעות האצת רכיב יחיד, אלא באמצעות בנייה מחדש של כל נתיב הגישה לנתונים.