O GB300 NVL72 é descrito como o "novo cavalo de batalha para inferência/treinamento", com uma narrativa explícita de custo por token, refletindo a virada do setor para a operacionalização de modelos de IA em escala para aplicações em tempo real . De acordo com a página de produto da NVIDIA, ele oferece 1,5x mais FLOPS Tensor Core FP4 densos e 2x mais desempenho de atenção em comparação com as GPUs NVIDIA Blackwell
.
Redes de alta largura de banda são um pilar fundamental da implantação. Os sistemas NVIDIA GB300 NVL72 são interconectados usando a rede Ethernet NVIDIA Spectrum-X, uma malha Ethernet sem perdas e de alto rendimento, projetada para eliminar gargalos em cargas de trabalho de IA com múltiplos nós .
A implantação conta com interconexões de 400 GbE e 800 GbE, transceptores ópticos, switches Ethernet NVIDIA Spectrum-X e SuperNICs . Sem essa malha, escalar a inferência para a capacidade empresarial criaria latência e gargalos de largura de banda incapacitantes. A Arquitetura de Referência Empresarial da NVIDIA para a Fábrica de IA NVL72 confirma que essa arquitetura de rede de plano duplo foi projetada para alimentar data centers empresariais para treinamento e inferência de IA em escala massiva, permitindo aplicações em tempo real e modelos com trilhões de parâmetros
.
Embora a infraestrutura suporte tanto treinamento quanto inferência , o anúncio enfatiza um foco empresarial crescente na inferência de IA (implantação em produção) juntamente com o treinamento. Vários sinais apontam para essa mudança:
A implicação é clara: as empresas superaram a fase de experimentação e agora buscam infraestrutura otimizada para implantar modelos de IA em escala em ambientes de produção.
Além da parceria com a Vultr, a HPE destacou várias iniciativas relacionadas:
A escolha da Vultr pela HPE e NVIDIA sinaliza um importante ponto de inflexão. Como o maior hyperscaler privado, a Vultr está apostando que os clientes empresariais precisam de uma infraestrutura que possa lidar tanto com treinamento quanto com inferência em tempo real em escala de nuvem. Ao combinar a computação GPU em escala de rack da NVIDIA com a arquitetura de fábrica, resfriamento líquido e serviços da HPE, a Vultr está se posicionando para atender à próxima onda de cargas de trabalho de IA empresarial — do treinamento de modelos à inferência de produção em modelos com trilhões de parâmetros.