A proposta é atacar um problema cada vez mais comum em sistemas de inteligência artificial: GPUs extremamente rápidas ficam paradas esperando dados, enquanto o armazenamento e os processadores centrais tentam acompanhar o ritmo.
A Nvidia anunciou que vai disponibilizar como código aberto as APIs do cuFile e toda a pilha vertical de software de armazenamento que as sustenta. A tecnologia permite que GPUs, e não apenas CPUs, leiam e gravem dados diretamente no armazenamento .
O cuFile é um componente central do GPUDirect Storage (GDS), plataforma da Nvidia para reduzir a intermediação da CPU nas transferências entre armazenamento e memória da GPU . O projeto será associado à organização xio-sig, sigla em inglês para Grupo de Interesse Especial em E/S Acelerada, no GitHub. Google, Intel, Nvidia e Meta foram indicadas como mantenedoras iniciais .
Na prática, a mudança pretende transformar o cuFile em uma interface aberta e desenvolvida pela comunidade, em vez de mantê-la como uma tecnologia exclusiva da Nvidia .
Há, porém, uma ressalva importante para equipes de infraestrutura: uma análise publicada em 4 de agosto de 2026 afirmou que ainda não estavam disponíveis publicamente o código, a licença, a matriz de kernels compatíveis ou um caminho de migração para instalações existentes do GPUDirect Storage . Por isso, o anúncio deve ser tratado como uma direção estratégica até que os componentes possam ser efetivamente baixados e adotados.
O Storage-Next foi apresentado como um consórcio com mais de 40 fornecedores de armazenamento e memória flash, entre eles DDN, KIOXIA e Micron. A iniciativa também envolve fabricantes de controladores, empresas de resfriamento e órgãos de padronização .
O objetivo é alinhar o setor sobre o funcionamento do armazenamento orientado por GPUs e transformar esses avanços em padrões abertos e interoperáveis . A coordenação é relevante porque uma solução de um único fornecedor não resolve, sozinha, o descompasso entre a velocidade das GPUs, dos SSDs, dos controladores e das redes .
O SCADA é a versão transformada em produto da pesquisa BaM, ou Big Accelerator Memory, apresentada pela Nvidia na conferência ASPLOS 2023 . Trata-se de um ambiente de execução que permite às GPUs, altamente paralelas, iniciar e administrar suas próprias operações de entrada e saída.
Com o SCADA, cada uma das centenas de milhares de threads da GPU pode solicitar dados ao armazenamento de forma independente. O sistema também oferece cache na própria GPU e acesso direto a unidades NVMe ou a armazenamento remoto .
No modelo tradicional, a CPU precisa preparar cada transferência de armazenamento. Esse processo acrescenta atrasos de microssegundos relacionados ao lançamento de kernels e à sincronização entre CPU e GPU .
O cuFile retira a CPU do caminho dos dados: usando acesso direto à memória, os dados podem ser transferidos diretamente para a memória da GPU . O SCADA avança mais um passo e também reduz a dependência da CPU no caminho de controle. As próprias threads da GPU iniciam as leituras, agrupam pequenas solicitações dispersas e podem recorrer a um cache local .
Na pesquisa BaM que serviu de base para o SCADA, cargas de análise de dados foram executadas 5,3 vezes mais rápido do que com acesso iniciado pela CPU. Em cargas de trabalho com grafos, o estudo apontou custo de hardware até 21,7 vezes menor em comparação com o armazenamento de dados na memória do sistema .
Em aplicações modernas de IA, a GPU pode processar dados mais rapidamente do que a maioria dos sistemas de armazenamento consegue entregá-los. Esse descompasso se tornou um dos gargalos do treinamento e da inferência .
Segundo a Nvidia, o cuFile permite acesso seguro aos dados em escala de microssegundos, aproveitando centenas de milhares de threads da GPU e memória de alta largura de banda . O resultado esperado é uma ligação de baixa latência entre camadas profundas de armazenamento e a memória da GPU.
Esse tipo de acesso é especialmente relevante para aplicações que precisam buscar muitos dados em paralelo, como sistemas de geração aumentada por recuperação — conhecidos como RAG —, modelos de mistura de especialistas e fluxos de trabalho de IA agêntica .
O Storage-Next tenta garantir que essa evolução não dependa de um único fabricante. Ao reunir mais de 40 participantes, a iniciativa busca criar padrões que permitam a diferentes componentes do ecossistema acompanhar os padrões de acesso gerados pelas GPUs .
Dar à GPU acesso direto ao armazenamento também cria riscos. Sem controles adequados, uma aplicação poderia ler ou alterar dados pertencentes a outra .
O desenho do SCADA separa os níveis de privilégio. O código da aplicação, voltado ao desempenho, roda sem privilégios e fora da base computacional confiável. Já um componente privilegiado configura, durante a inicialização, o acesso protegido entre cada aplicação e apenas o armazenamento autorizado para ela, usando mecanismos de segurança padrão do Linux .
A Nvidia também afirma que o cuFile pode servir de base para ferramentas de segurança alimentadas por IA. Na visão da empresa, o acesso rápido e protegido a dados e armazenamento permite que mecanismos preventivos e de detecção trabalhem na velocidade exigida por essas aplicações . A arquitetura é apresentada ainda como compatível com a Open Secure AI Alliance .
No conjunto de hardware citado pela Nvidia, os processadores Vera BlueField-4 STX usam a pilha unificada de segurança NVIDIA DOCA para aplicar políticas continuamente no caminho de dados da IA .
Os três anúncios representam uma tentativa abrangente de corrigir o descompasso entre a capacidade de processamento das GPUs e a velocidade de entrega do armazenamento. O cuFile aberto pode estimular a interoperabilidade e a participação da comunidade; o Storage-Next cria um fórum para alinhar fabricantes; e o SCADA oferece um caminho para tirar a CPU tanto do caminho dos dados quanto do controle das operações .
O impacto imediato, contudo, dependerá da publicação efetiva do código, da licença e das instruções de adoção. Até que esses elementos estejam disponíveis, administradores e arquitetos de armazenamento terão uma promessa técnica relevante — mas ainda não uma substituição pronta para as implantações atuais do GPUDirect Storage .