El objetivo es atacar un problema cada vez más visible en los centros de datos de inteligencia artificial: las GPU pueden procesar información a un ritmo mayor del que muchos sistemas de almacenamiento son capaces de suministrarla. Cuando eso ocurre, los aceleradores permanecen a la espera de datos, mientras la CPU y la infraestructura de entrada y salida se convierten en el cuello de botella.
Nvidia anunció que abrirá el código de las API de cuFile y de toda la pila vertical de software que las sustenta. Estas herramientas permiten que las GPU, y no solo las CPU, lean y escriban datos directamente en sistemas de almacenamiento . cuFile es un componente central de GPUDirect Storage (GDS) .
El proyecto se alojará en GitHub bajo la nueva organización xio-sig, siglas de Accelerated IO Special Interest Group. Google, Intel, Nvidia y Meta figuran como sus mantenedores iniciales . La intención es transformar la interfaz en una base abierta y orientada a la interoperabilidad, en lugar de mantenerla como una tecnología controlada exclusivamente por Nvidia .
No obstante, el anuncio no equivale necesariamente a una versión lista para desplegar. Un análisis publicado poco después señaló que, al 4 de agosto de 2026, todavía no había código público, licencia, matriz de compatibilidad ni ruta de migración para las implementaciones existentes de GPUDirect Storage . Para los equipos de almacenamiento, por tanto, cuFile debe considerarse de momento una dirección anunciada, no un lanzamiento plenamente disponible.
Storage-Next es una iniciativa sectorial formada por más de 40 proveedores de almacenamiento y memoria flash, entre ellos DDN, KIOXIA y Micron. También participan fabricantes de controladores, especialistas en refrigeración y organismos de estándares .
La meta es acordar cómo debe funcionar el almacenamiento impulsado por GPU y convertir esos avances en estándares abiertos e interoperables . La coordinación es relevante porque acelerar solo un componente no resolvería el problema: las unidades flash, los controladores, las redes, la refrigeración y las capas de orquestación deben responder al mismo patrón de cargas de trabajo.
SCADA —Scaled, Accelerated Data Access— es la versión convertida en producto de la investigación BaM (Big Accelerator Memory) presentada por Nvidia en ASPLOS 2023 . Se trata de un entorno de ejecución que permite a GPU masivamente paralelas iniciar y gestionar sus propias operaciones de entrada y salida.
En lugar de depender de una petición centralizada de la CPU, cada uno de los cientos de miles de hilos de la GPU puede solicitar datos al almacenamiento. SCADA también puede agrupar lecturas pequeñas y dispersas, utilizar una caché en la GPU y acceder directamente a almacenamiento NVMe local o remoto .
En el modelo tradicional, la CPU prepara cada transferencia y coordina la comunicación con la GPU. Ese proceso añade microsegundos de latencia por los lanzamientos de kernels y la sincronización entre CPU y GPU .
cuFile elimina la CPU de la ruta de datos: mediante acceso directo a memoria, los datos pueden llegar directamente a la memoria de la GPU . SCADA va un paso más allá y también reduce la dependencia de la CPU en la ruta de control, ya que los propios hilos de la GPU pueden iniciar lecturas, combinar solicitudes y reutilizar datos almacenados en su caché .
En la investigación BaM, con el mismo hardware, las cargas de analítica de datos fueron hasta 5,3 veces más rápidas que con acceso iniciado por la CPU. En cargas de grafos, el trabajo también mostró hasta 21,7 veces menos coste de hardware frente a almacenar los datos en la memoria del sistema . Esos resultados corresponden a la investigación subyacente, no necesariamente a un rendimiento garantizado de SCADA en cualquier entorno.
Los modelos de entrenamiento e inferencia, especialmente los sistemas de generación aumentada mediante recuperación (RAG), los modelos de mezcla de expertos y los flujos de trabajo de IA agéntica, necesitan extraer grandes cantidades de datos en paralelo y con baja latencia .
Nvidia afirma que cuFile puede ofrecer acceso seguro a los datos en el orden de los microsegundos, aprovechando cientos de miles de hilos de GPU y memoria de gran ancho de banda . La idea es crear una conexión más directa entre el almacenamiento profundo y la memoria de la GPU, reduciendo los rodeos que pueden frenar a los aceleradores.
Storage-Next busca que ese avance no dependa de un único proveedor. Con más de 40 empresas trabajando en normas compatibles, la iniciativa pretende que las distintas piezas del ecosistema puedan seguir el ritmo de las GPU .
Dar a una GPU acceso directo al almacenamiento también introduce riesgos. Si no existieran controles adecuados, una aplicación podría leer o modificar los datos de otra .
El diseño de SCADA separa los niveles de privilegio. El código de la aplicación, que necesita rendimiento, se ejecuta sin privilegios y fuera de la base de computación confiable. Durante la configuración, un componente privilegiado establece un acceso protegido entre cada aplicación y únicamente el almacenamiento que tiene autorizado, utilizando mecanismos de seguridad estándar de Linux .
Nvidia también presenta cuFile como una pieza para la ciberseguridad impulsada por IA: las defensas preventivas y de detección necesitan acceder rápidamente tanto al contexto de seguridad como a los datos y al almacenamiento . La arquitectura se relaciona además con la Open Secure AI Alliance . En la pila de hardware mencionada por Nvidia, los procesadores Vera BlueField-4 STX utilizan la plataforma unificada NVIDIA DOCA para aplicar políticas de seguridad de forma continua en la ruta de datos de IA .
Las tres iniciativas apuntan a una misma brecha arquitectónica: la capacidad de cálculo de las GPU ha avanzado más rápido que la capacidad de entregarles datos. cuFile aborda el movimiento de la información; SCADA intenta dar a la GPU mayor control sobre las solicitudes; y Storage-Next busca que fabricantes y estándares evolucionen de forma coordinada.
La apertura de cuFile podría acelerar la interoperabilidad y permitir que la comunidad participe en su desarrollo . Pero el impacto práctico dependerá de cuándo aparezcan el código, la licencia y una vía clara para adoptar la tecnología en sistemas existentes . Por ahora, Nvidia ha definido una hoja de ruta ambiciosa para que el almacenamiento deje de ser el freno de la IA, aunque su ejecución todavía será tan importante como el anuncio.