GB300 NVL72 beskrives som den nye «inferens-/treningsarbeidshesten» med en tydelig kostnad-per-token-profil . Dette reflekterer bransjens dreining mot å sette KI-modeller i produksjon for sanntidsapplikasjoner. Ifølge NVIDIAs produktspesifikasjoner gir systemet 1,5 ganger flere FP4 Tensor Core-FLOPS og dobbelt så høy oppmerksomhetsytelse sammenlignet med NVIDIA Blackwell-GPU-er
.
Høyhastighetsnettverk er en helt sentral del av utbyggingen. NVIDIA GB300 NVL72-systemene kobles sammen via NVIDIA Spectrum-X Ethernet-nettverk – et tapsfritt, høyhastighets Ethernet-fabric som fjerner flaskehalser i KI-arbeidsbelastninger med flere noder .
Utbyggingen omfatter 400GbE- og 800GbE-forbindelser, optiske sendere/mottakere, NVIDIA Spectrum-X Ethernet-svitsjer og SuperNIC-er . Uten dette fabricet ville skalering av inferens til bedriftsgjennomstrømning skapt lammende latens- og båndbreddeproblemer. NVIDIA Enterprise Reference Architecture for NVL72 AI Factory bekrefter at nettverksarkitekturen med to plan er designet for å drive bedriftsdatasentre for KI-trening og inferens i stor skala, noe som muliggjør sanntidsapplikasjoner og modeller med billioner av parametere
.
Selv om infrastrukturen støtter både trening og inferens , understreker kunngjøringen en voksende bedriftsfokus på KI-inferens (produksjonsdistribusjon) ved siden av trening. Flere signaler peker på dette skiftet:
Implikasjonen er klar: Bedriftene har beveget seg forbi eksperimentfasen og søker nå infrastruktur optimalisert for å sette KI-modeller i produksjon i stor skala.
Utover Vultr-partnerskapet fremhevet HPE flere relaterte initiativ:
Vultrs valg av HPE og NVIDIA signaliserer et vendepunkt. Som den største privateide hyperskalereren satser Vultr på at bedrifter trenger infrastruktur som kan håndtere både trening og sanntidsinferens i skystørrelse. Ved å kombinere NVIDIAs rack-skala-GPU-beregning med HPEs fabrikkarkitektur, væskekjøling og tjenester, posisjonerer Vultr seg for å betjene den neste bølgen av bedrifts-KI-arbeidsbelastninger – fra modelltrening til produksjonsinferens på modeller med billioner av parametere.