GB300 NVL72 digambarkan sebagai "kuda beban inferensi/pelatihan baru" dengan narasi biaya per token (cost-per-token) yang eksplisit, mencerminkan pergeseran industri menuju pengoperasian model AI dalam skala besar untuk aplikasi real-time . Menurut halaman produk NVIDIA, sistem ini memberikan 1,5x lebih banyak FP4 Tensor Core FLOPS dan 2x performa perhatian (attention) yang lebih tinggi dibandingkan GPU NVIDIA Blackwell
.
Jaringan berkecepatan tinggi adalah pilar fundamental dari penerapan ini. Sistem NVIDIA GB300 NVL72 saling terhubung menggunakan NVIDIA Spectrum-X Ethernet networking, sebuah kain Ethernet lossless dan high-throughput yang dirancang untuk menghilangkan kemacetan dalam beban kerja AI multi-node .
Penerapannya mencakup interkoneksi 400GbE dan 800GbE, transceiver optik, switch Ethernet NVIDIA Spectrum-X, dan SuperNIC . Tanpa kain ini, penskalaan inferensi hingga throughput tingkat enterprise akan menimbulkan latensi dan kemacetan bandwidth yang melumpuhkan. Arsitektur Referensi Perusahaan NVIDIA untuk AI Factory NVL72 mengonfirmasi bahwa arsitektur jaringan dual-plane ini dirancang untuk memberi daya pada pusat data perusahaan untuk pelatihan dan inferensi AI dalam skala besar, memungkinkan aplikasi real-time dan model dengan triliunan parameter
.
Meskipun infrastruktur ini mendukung pelatihan dan inferensi , pengumuman ini menekankan fokus enterprise yang semakin besar pada inferensi AI (penerapan produksi) di samping pelatihan. Beberapa sinyal menunjukkan pergeseran ini:
Implikasinya jelas: perusahaan telah melewati fase eksperimen dan sekarang mencari infrastruktur yang dioptimalkan untuk menerapkan model AI dalam skala besar di lingkungan produksi.
Di luar kemitraan dengan Vultr, HPE menyoroti beberapa inisiatif terkait:
Pilihan Vultr terhadap HPE dan NVIDIA menandai titik infleksi yang signifikan. Sebagai hyperscaler swasta terbesar, Vultr bertaruh bahwa pelanggan enterprise membutuhkan infrastruktur yang dapat menangani pelatihan dan inferensi real-time dalam skala cloud. Dengan menggabungkan komputasi GPU rack-scale NVIDIA dengan arsitektur pabrik, pendinginan cair, dan layanan HPE, Vultr memposisikan dirinya untuk melayani gelombang berikutnya dari beban kerja AI enterprise—dari pelatihan model hingga inferensi produksi pada model dengan triliunan parameter.