Il GB300 NVL72 viene descritto come il "nuovo cavallo di battaglia per inferenza/training", con un chiaro focus sul costo per token, segno della svolta del settore verso l'operatività dei modelli AI su larga scala per applicazioni in tempo reale . Secondo la scheda prodotto NVIDIA, offre 1,5x più FLOPS FP4 densi e 2x le prestazioni di attenzione rispetto alle GPU NVIDIA Blackwell
.
Il networking ad alta larghezza di banda è un pilastro fondamentale dell'implementazione. I sistemi NVIDIA GB300 NVL72 sono interconnessi tramite NVIDIA Spectrum-X Ethernet networking, una struttura Ethernet lossless e ad alto rendimento progettata per eliminare i colli di bottiglia nei carichi di lavoro AI multi-nodo .
L'implementazione prevede interconnessioni 400GbE e 800GbE, ricetrasmettitori ottici, switch Ethernet NVIDIA Spectrum-X e SuperNIC . Senza questa struttura, scalare l'inferenza fino a volumi enterprise creerebbe ritardi e colli di bottiglia insostenibili. L'architettura di riferimento NVIDIA Enterprise per l'NVL72 AI Factory conferma che questa architettura di rete a doppio piano è progettata per alimentare data center enterprise per training e inferenza AI su scala massiccia, abilitando applicazioni in tempo reale e modelli da mille miliardi di parametri
.
Sebbene l'infrastruttura supporti sia training che inferenza , l'annuncio sottolinea la crescente attenzione delle aziende verso l'inferenza AI (implementazione in produzione) insieme al training. Diversi segnali indicano questo cambiamento:
Il messaggio è chiaro: le aziende hanno superato la fase di sperimentazione e ora cercano infrastrutture ottimizzate per distribuire modelli AI su larga scala in ambienti di produzione.
Oltre alla partnership con Vultr, HPE ha evidenziato diverse iniziative correlate:
La scelta di Vultr a favore di HPE e NVIDIA segna un punto di svolta importante. In quanto più grande hyperscaler privato, Vultr scommette che le aziende abbiano bisogno di un'infrastruttura in grado di gestire sia il training che l'inferenza in tempo reale su scala cloud. Combinando il calcolo rack-scale di NVIDIA con l'architettura factory di HPE, il raffreddamento a liquido e i servizi, Vultr si posiziona per servire la prossima ondata di carichi di lavoro AI enterprise, dal training dei modelli all'inferenza di produzione su modelli da mille miliardi di parametri.