NVIDIA mendakwa Vera Rubin NVL72 mencapai sehingga 30× lebih tinggi daya pemprosesan AI beragen bagi setiap megawatt serta kos token sehingga 35× lebih rendah berbanding GB300 NVL72 dalam ujian DeepSeek V4 Pro menggun... Perbandingan langsung Vera Rubin ialah dengan GB300 NVL72.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next-generation Vera Rubin NVL72 platform’s efficiency for agentic AI workloads—including its claimed inf. Article summary: NVIDIA’s headline claim is that Vera Rubin NVL72 can deliver up to 30× higher agentic-inference throughput per megawatt than GB300 NVL72 and reduce cost per token by up to 35×, based on its stated SemiAnalysis AgentX res. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
NVIDIA cuba mengubah cara prestasi infrastruktur AI diukur — bukan sekadar berdasarkan kelajuan menjawab satu soalan, tetapi berdasarkan kemampuan mengendalikan ejen AI yang berulang kali menjana token, memanggil alat, menjalankan kod dan membina konteks baharu.
Dalam data yang diterbitkan NVIDIA, Vera Rubin NVL72 mencatatkan sehingga 30× lebih tinggi daya pemprosesan bagi setiap megawatt berbanding GB300 NVL72. Syarikat itu turut mendakwa kos token boleh dikurangkan sehingga 35× dalam ujian menggunakan model DeepSeek V4 Pro pada beban kerja AgentX oleh SemiAnalysis.
Namun, angka ini perlu dibaca dengan berhati-hati. Bukti yang tersedia tidak memberikan angka kos dolar khusus bagi setiap sejuta token untuk Vera Rubin, dan belum membuktikan pengesahan bebas melalui perbandingan satu-ke-satu yang seragam.
Perbandingan utama NVIDIA adalah seperti berikut:
AgentX direka untuk menguji inferens pengekodan berasaskan ejen, bukannya sesi soal jawab ringkas. Ia memainkan semula sesi pengekodan bergaya produksi yang merangkumi pertumbuhan konteks, panggilan alat dan penciptaan subejen. 6
Perbezaan ini penting. Ejen AI mungkin menghasilkan jawapan, memeriksa hasilnya, memanggil alat luaran, menjalankan kod, mencipta tugasan lain dan meneruskan penaakulan menggunakan konteks yang semakin besar. Setiap langkah menambah permintaan terhadap token, memori, rangkaian, CPU dan tenaga — bukan hanya GPU.
Angka 30× itu membandingkan Vera Rubin NVL72 dengan GB300 NVL72, bukan dengan Hopper. Dalam bahan berkaitan AgentX yang diterbitkan secara berasingan, NVIDIA berkata GB300 NVL72 menawarkan sehingga 15× lebih tinggi daya pemprosesan bagi setiap megawatt berbanding sistem H200 berasaskan seni bina Hopper untuk DeepSeek V4 Pro.
Angka tersebut memberikan gambaran tentang peningkatan antara generasi, tetapi kedua-duanya tidak boleh didarabkan untuk menghasilkan dakwaan 450×. Ia ialah dua perbandingan berasingan yang menggunakan angka maksimum “sehingga”, manakala bahan tersedia tidak menyediakan satu jadual ujian yang menyamakan keadaan Vera Rubin, GB300 dan Hopper.
Had yang sama terpakai pada kos. Bukti menyokong dakwaan NVIDIA mengenai pengurangan maksimum 35× berbanding GB300, tetapi tidak memberikan harga dolar Vera Rubin bagi setiap sejuta token atau angka kos khusus Vera Rubin berbanding Hopper.
NVL72 ialah sistem berskala rak yang menggabungkan 72 GPU Rubin dan 36 CPU Vera, bersama ConnectX-9 SuperNIC serta BlueField-4 DPU. NVIDIA menggunakan NVLink 6 sebagai fabrik sambungan untuk penskalaan dalam sistem, manakala Quantum-X800 InfiniBand dan Spectrum-X Ethernet menyokong penskalaan antara sistem. 23
Reka bentuk ini memperlakukan keseluruhan rak sebagai satu sistem pengkomputeran yang saling bersepadu, bukannya sekumpulan pelayan pemecut yang berdiri sendiri. Pendekatan itu amat relevan untuk beban kerja beragen kerana prestasi bergantung pada kelancaran penyelarasan antara pemprosesan GPU, tugasan CPU, rangkaian dan storan.
Vera ialah CPU 88 teras yang menggunakan teras Olympus rekaan NVIDIA, teknologi Spatial Multithreading dan memori LPDDR5X. Ia menawarkan sehingga 1.2 TB/s jalur lebar memori. NVIDIA mendakwa Vera membolehkan tugasan diselesaikan sehingga 1.8× lebih pantas berbanding CPU x86 merentasi beban kerja seperti AI beragen, pembelajaran pengukuhan dan pemprosesan data. 15
CPU ini bukan sekadar bertindak sebagai hos kepada sistem operasi biasa. Vera direka untuk mengendalikan kerja di sekeliling proses inferens model, termasuk:
Dengan mempercepatkan tugas-tugas ini, NVIDIA mahu GPU kekal tertumpu pada inferens. Pada masa sama, kesesakan pada bahagian lain dalam kitaran kerja ejen dapat dikurangkan. 159
BlueField-4 ialah komponen pemprosesan infrastruktur khusus NVIDIA. DPU ini menggabungkan CPU Grace 64 teras, memori LPDDR5X dan rangkaian ConnectX-9, dengan sambungan sehingga 800 Gb/s. 1
NVIDIA berkata BlueField-4 memindahkan fungsi seperti kawalan, keselamatan, pemindahan data dan orkestrasi daripada CPU hos serta GPU. Dalam pendekatan ini, DPU berfungsi sebagai lapisan infrastruktur yang membantu menyediakan operasi terpencil, selamat dan konsisten di seluruh kilang AI berskala besar. 1
Inilah asas kepada konsep “Scale-In” NVIDIA: kecekapan tidak bergantung pada cip GPU semata-mata. Ia turut ditentukan oleh sejauh mana rak boleh mengurus komunikasi, storan, penjadualan dan keselamatan tanpa menggunakan kapasiti pemecut untuk tugasan tersebut.
DSX MaxLPS ialah perisian dalam pendekatan kilang AI NVIDIA DSX, bukannya GPU atau CPU Vera Rubin yang berasingan. NVIDIA menerangkannya sebagai satu suite untuk memaksimumkan prestasi token bagi setiap megawatt dalam had kuasa tertentu. Pendekatan itu menggabungkan penyejukan cecair dan pengoptimuman dalam rak supaya operator boleh menjalankan lebih banyak GPU hampir dengan titik operasi paling cekap tenaga.
Ini menjadikan DSX MaxLPS berkaitan dengan dakwaan kecekapan 30×. Metrik yang diiklankan diukur pada peringkat kilang AI, iaitu tahap yang turut dipengaruhi oleh penyejukan, susunan rak dan perisian infrastruktur. Bukti tersedia tidak menunjukkan dengan tepat berapa banyak peningkatan itu datang daripada silikon, susunan perisian, konfigurasi ujian atau gabungan ketiga-tiganya.
NVIDIA dan SpaceXAI berkata SpaceXAI merancang menggunakan CPU Vera untuk generasi seterusnya beban kerja AI beragen, selain mengembangkan infrastruktur di sebalik Grok menggunakan Vera Rubin. 45
Kedua-dua syarikat itu turut menyatakan rancangan untuk mengubah suai sistem Vera Rubin NVL72 yang dioptimumkan supaya boleh ditempatkan di orbit bagi satelit AI Starmind generasi pertama. 4
Kenyataan ini merujuk kepada rancangan penggunaan. Ia bukan bukti bahawa sistem berasaskan NVL72 telah dilancarkan ke orbit atau mula beroperasi.
Kepentingan Vera Rubin NVL72 terletak pada usaha NVIDIA mengukur infrastruktur berdasarkan cara ejen AI benar-benar berfungsi: melalui sesi berulang yang panjang, konteks besar, panggilan alat, pelaksanaan kod dan subejen.
Untuk beban kerja tersebut, NVIDIA melaporkan sehingga 30× lebih tinggi daya pemprosesan bagi setiap megawatt serta kos token sehingga 35× lebih rendah berbanding GB300 NVL72.
Bagi pembeli dan pasukan infrastruktur, persoalan utama bukanlah sama ada gandaan itu kedengaran besar. Yang lebih penting ialah sama ada keputusan tersebut kekal apabila diuji dengan model, sasaran kependaman, panjang konteks, tahap serentak, bajet kuasa dan anggaran jumlah kos milik mereka sendiri.
Bukti yang dibekalkan mengesahkan dakwaan NVIDIA serta menerangkan seni bina di belakangnya, tetapi belum memberikan keputusan muktamad yang disahkan secara bebas.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA mendakwa Vera Rubin NVL72 mencapai sehingga 30× lebih tinggi daya pemprosesan AI beragen bagi setiap megawatt serta kos token sehingga 35× lebih rendah berbanding GB300 NVL72 dalam ujian DeepSeek V4 Pro menggun...
NVIDIA mendakwa Vera Rubin NVL72 mencapai sehingga 30× lebih tinggi daya pemprosesan AI beragen bagi setiap megawatt serta kos token sehingga 35× lebih rendah berbanding GB300 NVL72 dalam ujian DeepSeek V4 Pro menggun... Perbandingan langsung Vera Rubin ialah dengan GB300 NVL72. NVIDIA secara berasingan mendakwa GB300 menawarkan sehingga 15× lebih tinggi daya pemprosesan bagi setiap megawatt berbanding sistem Hopper untuk beban kerja...
Platform ini menggabungkan 72 GPU Rubin dengan 36 CPU Vera, manakala DPU BlueField 4 mengendalikan tugas infrastruktur seperti rangkaian, keselamatan, orkestrasi dan pemindahan data.