NVIDIA稱 Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載下,對比 GB300 NVL72,每兆瓦 Agentic AI 推理吞吐量最多高30倍,Token成本最多低35倍。[36][37] 30倍比較對象是 GB300 NVL72,而不是 Hopper;NVIDIA另稱 GB300 NVL72 在相關 DeepSeek V4 Pro 測試中,每兆瓦吞吐量最多是 H200 Hopper 系統的15倍。[36] NVL72把72張 Rubin GPU、36粒 Vera CPU、ConnectX 9 SuperNIC及 BlueField 4 DPU...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next-generation Vera Rubin NVL72 platform’s efficiency for agentic AI workloads—including its claimed inf. Article summary: NVIDIA’s headline claim is that Vera Rubin NVL72 can deliver up to 30× higher agentic-inference throughput per megawatt than GB300 NVL72 and reduce cost per token by up to 35×, based on its stated SemiAnalysis AgentX res. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
NVIDIA最近公布 Vera Rubin NVL72 的首輪 Agentic AI 測試數據,聲稱系統在 SemiAnalysis 的 AgentX 工作負載上,以 DeepSeek V4 Pro 運行時,對比 GB300 NVL72,每兆瓦吞吐量最多高30倍,Token成本最多低35倍。
不過,呢個「30倍」要睇清楚先。現有資料反映的是 NVIDIA 公布的結果,未足以視為獨立、完全同條件的業界驗證;資料亦沒有提供 Vera Rubin 每一百萬個 Token 的實際美元成本。因此,數字很吸引,但未宜直接當成所有模型、延遲要求或部署環境都能複製的結果。
Agentic AI 並非問一條問題、等模型答完就收工。實際工作流程可能包括:
SemiAnalysis AgentX 以回放生產環境風格的智能體編程會話,測試系統處理這類上下文增長、工具呼叫及子 Agent 生成的能力。6 這種工作負載會同時考驗 GPU、CPU、記憶體、網絡、儲存及電力,而不只是單一加速器的峰值速度。
NVIDIA在相關結果中表示,Vera Rubin NVL72以每位使用者約160 tokens/s 的互動目標運行時,對比 GB300 NVL72,每兆瓦 AI factory 吞吐量最多提升30倍。6 換句話說,在相同能源預算下,理論上可以支援更多 Agent 推理工作;但實際效益仍會受模型、上下文長度、並發量及軟件配置影響。
Vera Rubin 的30倍數字,直接比較的是 GB300 NVL72,並非 Hopper。NVIDIA的資料另指出,GB300 NVL72在 DeepSeek V4 Pro 相關 AgentX 測試中,每兆瓦吞吐量最多是 H200 Hopper 系統的15倍。
呢兩組都是「最多」的獨立比較,不能簡單相乘變成 Vera Rubin 比 Hopper 高450倍。現有資料沒有提供一張在完全相同條件下,同時展示 Vera Rubin、GB300及 Hopper 的統一測試表,因此也不能由此推導出一個確定的跨兩代總倍數。
成本方面亦一樣:資料支持 NVIDIA 所稱 Vera Rubin 對比 GB300 的 Token成本最多降低35倍,但沒有提供 Vera Rubin 每一百萬個 Token 的實際美元價格,亦未有一個具體的 Vera Rubin 對 Hopper 成本數字。
Vera Rubin NVL72 是一個機櫃級 AI 系統,整合:
NVIDIA將個機櫃視為一個緊密整合的運算系統,而不是幾部各自獨立的 GPU 伺服器。23 對需要頻繁交換資料、呼叫工具及執行子任務的 Agent 工作來說,這種設計旨在減少 GPU 等候 CPU、網絡或儲存的時間。
Vera 是一粒 88核 CPU,採用 NVIDIA 自家設計的 Olympus 核心、Spatial Multithreading 技術及 LPDDR5X 記憶體,最高提供 1.2TB/s 記憶體頻寬。NVIDIA稱,Vera在 Agentic AI、強化學習及資料處理等工作上,任務完成速度最多比 x86 CPU 快1.8倍。15
它的定位不只是傳統主機 CPU,而是專門處理推理流程周邊的 CPU 工作,包括工具使用、程式碼執行、沙盒、資料處理、分析、編排、模擬及強化學習。159
NVIDIA的思路是,當 Vera負責這些工作,GPU便可以更集中處理推理,減少整個 Agent loop 入面「GPU夠快,但其他部分跟唔上」的瓶頸。
BlueField-4 是 NVIDIA用來處理基礎設施工作的 DPU。它結合64核 Grace CPU、LPDDR5X記憶體及 ConnectX-9 網絡,連接速度最高達800Gb/s。1
NVIDIA表示,BlueField-4可以將控制、安全、資料搬運及編排等功能,從主機 CPU 和 GPU 分流出去,讓整個 AI factory 以更隔離、安全及可預測的方式運作。1
這就是 NVIDIA 所稱的「Scale-In」概念:提升 AI 效率不只是換一粒更快的 GPU,亦取決於機櫃如何處理網絡通訊、儲存、排程及安全,避免加速器被迫分擔這些工作。
DSX MaxLPS 並不是另一款 Vera Rubin GPU 或 CPU,而是 NVIDIA DSX AI factory 方案內的軟件套件。NVIDIA稱,它的目標是在固定電力預算下,盡量提高每兆瓦可產生的 Token 數量;方案結合液冷及機櫃內優化,讓營運商可以安排更多 GPU 在較高能源效益的運作點工作。
因此,30倍指標應該放在整個 AI factory 層面理解:冷卻方式、機櫃配置、網絡、基建軟件及晶片本身,都可能影響每單位電力的 Token 產量。現有資料沒有拆解已公布增幅有多少來自晶片、軟件、測試設定,或者三者的組合。
NVIDIA及 SpaceXAI 表示,SpaceXAI計劃部署 Vera CPU,支援下一代 Agentic AI 工作負載,並以 Vera Rubin 擴展 Grok 背後的 AI 基建。45
兩家公司亦表示,計劃將一套經優化的 Vera Rubin NVL72 系統延伸至太空,用於第一代 Starmind AI 衛星。4
要留意,以上是部署計劃,並不代表搭載 NVL72 的軌道系統已經發射或投入服務。
Vera Rubin NVL72 的重點,在於 NVIDIA嘗試用更接近真實 Agent 運作方式的指標,去衡量 AI 基建:長時間、多輪次、上下文不斷增長,期間還要呼叫工具、執行程式碼及分派子 Agent。在這類工作負載上,NVIDIA聲稱 Vera Rubin 對比 GB300 NVL72,每兆瓦吞吐量最多高30倍,Token成本最多低35倍。
但對雲端服務商、企業及基建團隊來說,真正要問的不是倍數夠唔夠誇張,而是結果能否在自己的模型、延遲目標、上下文長度、並發量、電力上限及總成本假設下重現。現有證據確立了 NVIDIA 的公布聲稱及其硬件架構,但仍未足以作出最終的獨立性能定論。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
NVIDIA稱 Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載下,對比 GB300 NVL72,每兆瓦 Agentic AI 推理吞吐量最多高30倍,Token成本最多低35倍。[36][37]
NVIDIA稱 Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載下,對比 GB300 NVL72,每兆瓦 Agentic AI 推理吞吐量最多高30倍,Token成本最多低35倍。[36][37] 30倍比較對象是 GB300 NVL72,而不是 Hopper;NVIDIA另稱 GB300 NVL72 在相關 DeepSeek V4 Pro 測試中,每兆瓦吞吐量最多是 H200 Hopper 系統的15倍。[36]
NVL72把72張 Rubin GPU、36粒 Vera CPU、ConnectX 9 SuperNIC及 BlueField 4 DPU 組成一個機櫃級系統,並由 DPU 分擔網絡、安全、編排及資料搬運等基建工作。[2][3]