NVIDIA 表示,Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載上,相較 GB300 NVL72 可實現最高 30 倍的每兆瓦 Agentic AI 推理吞吐量,Token 成本最高降低 35 倍。[36][37] 這項 30 倍比較的對象是 GB300 NVL72;NVIDIA 另稱 GB300 NVL72 在 DeepSeek V4 Pro 類型工作負載上,每兆瓦吞吐量最高可達 Hopper H200 系統的 15 倍,但兩組數據不能直接相乘。 NVL72 將 72 顆 Rubin GPU、36 顆 Vera CPU、ConnectX 9 Sup...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next-generation Vera Rubin NVL72 platform’s efficiency for agentic AI workloads—including its claimed inf. Article summary: NVIDIA’s headline claim is that Vera Rubin NVL72 can deliver up to 30× higher agentic-inference throughput per megawatt than GB300 NVL72 and reduce cost per token by up to 35×, based on its stated SemiAnalysis AgentX res. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
NVIDIA 正把 Vera Rubin NVL72 定位為專為 Agentic AI 打造的機櫃級基礎設施平台。與只回答一次問題的傳統推理不同,AI Agent 往往會反覆產生 Token、呼叫工具、執行程式碼、建立子任務,並在不斷膨脹的上下文中繼續推理。
NVIDIA 公布的測試結果顯示,Vera Rubin NVL72 在 DeepSeek V4 Pro 上執行 SemiAnalysis 的 AgentX 工作負載時,相較 GB300 NVL72,最高可帶來 30 倍的每兆瓦吞吐量,並讓 Token 成本最高降低 35 倍。
不過,這些數字應該視為 NVIDIA 公布的效能主張,而不是已由獨立機構完成的同條件、逐項驗證結果。現有資料也沒有提供 Vera Rubin 每百萬 Token 的具體美元成本,因此「降低 35 倍」不能直接換算成一個已確認的價格。
AgentX 並非單純讓模型回答一個短問題,而是回放帶有生產環境特徵的 Agent 程式碼工作階段,其中包含上下文增長、工具呼叫與子 Agent 生成。6
在這類工作負載中,Agent 可能會依序完成以下動作:
這代表系統要處理的,不只是模型最初輸出的幾段文字。隨著上下文、工具互動和並行任務增加,記憶體、網路、CPU、儲存與電力的壓力也會同步上升。對 Agentic AI 而言,整個「Agent 循環」的效率,往往比單次回覆速度更能決定實際成本。
Vera Rubin NVL72 的直接比較對象是 GB300 NVL72,不是 Hopper。NVIDIA 另在與 AgentX 相關的資料中表示,在 DeepSeek V4 Pro 上,GB300 NVL72 的每兆瓦吞吐量最高可達 H200 Hopper 系統的 15 倍。
這兩組數據可以用來理解 NVIDIA 所描述的世代演進,但不能據此宣稱 Vera Rubin 相較 Hopper 有 450 倍提升。原因在於:
成本數字也有同樣限制。現有證據支持 NVIDIA 所稱 Vera Rubin 相較 GB300 的 Token 成本最高降低 35 倍,但沒有提供 Vera Rubin 對 Hopper 的特定成本比較,也沒有披露一個可獨立核對的 Vera Rubin 每百萬 Token 美元價格。
NVIDIA Vera Rubin NVL72 將 72 顆 Rubin GPU 與 36 顆 Vera CPU 整合在機櫃級系統中,並搭配 ConnectX-9 SuperNIC 與 BlueField-4 DPU。23
在連接架構上,NVIDIA 將 NVLink 6 描述為用於機櫃內「向上擴展」(scale-up)的高速互連;Quantum-X800 InfiniBand 與 Spectrum-X Ethernet 則負責跨系統「向外擴展」(scale-out)的網路連接。3
這種設計不是把多台獨立的加速伺服器簡單堆在一起,而是把整個機櫃視為一個緊密整合的運算系統。對 Agent 工作而言,這有助於在 GPU 執行推理的同時,協調 CPU 端的程式碼執行、網路通訊、資料處理與儲存活動。
Vera 是一款 88 核心 CPU,採用 NVIDIA 設計的 Olympus 核心、Spatial Multithreading 技術與 LPDDR5X 記憶體,最高提供 1.2 TB/s 記憶體頻寬。NVIDIA 表示,Vera 在 Agentic AI、強化學習與資料處理等工作負載上的任務完成速度,最高可達 x86 CPU 的 1.8 倍。15
它的角色不只是執行一般主機作業系統,而是負責推理流程周邊大量的 CPU 密集工作,包括:
NVIDIA 的設計思路是,讓 Vera 處理這些模型外部工作,盡量讓 GPU 專注於推理本身,從而減少 Agent 循環中 GPU 等待 CPU、網路或資料的情況。159
BlueField-4 是 NVIDIA 專門用於基礎設施處理的 DPU。它採用雙晶片封裝,整合 64 核心 Grace CPU、LPDDR5X 記憶體與 ConnectX-9 網路,連線能力最高達 800 Gb/s。1
NVIDIA 表示,BlueField-4 可把控制、安全、資料搬移與編排等基礎設施工作,從主機 CPU 和 GPU 移至 DPU 執行。這使 DPU 成為 AI 工廠中的基礎設施層,協助大規模系統維持隔離、安全與可預測的運作。1
這也是 NVIDIA 所謂「Scale-In」概念的核心:AI 基礎設施的效率不只取決於 GPU 晶片本身,也取決於機櫃如何處理通訊、儲存、排程與安全工作。如果這些工作需要大量佔用 GPU 資源,帳面上的加速器效能就未必能轉化為同等的實際 Token 產出。
DSX MaxLPS 是 NVIDIA DSX AI 工廠方案中的軟體套件,不是另一款 Vera Rubin GPU 或 CPU。NVIDIA 將它描述為一組在固定功耗預算下,最大化每兆瓦 Token 效能的技術,結合液冷與機櫃內最佳化,讓營運商能讓更多 GPU 接近能源效率較佳的運作點。
因此,DSX MaxLPS 與 30 倍效率主張有關:相關指標是在 AI 工廠層級衡量,而不是只看單顆 GPU。液冷、機櫃配置、網路、基礎設施軟體與功耗管理,都可能影響每單位電力能產生多少 Token。
但現有資料沒有拆解這項提升中,有多少來自 Rubin 硬體、Vera CPU、軟體堆疊、測試設定或它們的組合。換句話說,30 倍是整體系統在特定工作負載下的最高宣稱,不應直接理解為 GPU 晶片本身在所有情境都快 30 倍。
NVIDIA 與 SpaceXAI 表示,SpaceXAI 計畫部署 Vera CPU,以支援下一代 Agentic AI 工作負載,並以 Vera Rubin 擴充 Grok 背後的 AI 基礎設施。45
雙方也提到,計畫將經過最佳化的 Vera Rubin NVL72 系統延伸至軌道,支援第一代 Starmind AI 衛星。4
目前這些仍是部署計畫,不能解讀為搭載 NVL72 的軌道系統已經發射或投入服務。4
Vera Rubin NVL72 的重點,在於 NVIDIA 嘗試用更接近 Agent 實際運作方式的指標,重新衡量 AI 基礎設施:不只看單次回答速度,而是看系統能否在長時間、多輪互動、工具呼叫、程式碼執行與子 Agent 協作下,持續產出更多有效 Token。
在 NVIDIA 公布的 AgentX 結果中,Vera Rubin NVL72 相較 GB300 NVL72,最高可實現 30 倍每兆瓦 Agentic AI 吞吐量,以及最高 35 倍 Token 成本降幅。
但對雲端服務商、企業 IT 團隊與 AI 基礎設施採購者來說,關鍵不只是倍數看起來有多驚人,而是這些結果能否在自己的模型、延遲目標、上下文長度、併發量、功耗預算與總持有成本條件下重現。
目前公開證據足以說明 NVIDIA 的主張與 Vera Rubin 的系統設計,但還不足以提供獨立、全面的最終判定。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
NVIDIA 表示,Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載上,相較 GB300 NVL72 可實現最高 30 倍的每兆瓦 Agentic AI 推理吞吐量,Token 成本最高降低 35 倍。[36][37]
NVIDIA 表示,Vera Rubin NVL72 在 DeepSeek V4 Pro 及 SemiAnalysis AgentX 工作負載上,相較 GB300 NVL72 可實現最高 30 倍的每兆瓦 Agentic AI 推理吞吐量,Token 成本最高降低 35 倍。[36][37] 這項 30 倍比較的對象是 GB300 NVL72;NVIDIA 另稱 GB300 NVL72 在 DeepSeek V4 Pro 類型工作負載上,每兆瓦吞吐量最高可達 Hopper H200 系統的 15 倍,但兩組數據不能直接相乘。
NVL72 將 72 顆 Rubin GPU、36 顆 Vera CPU、ConnectX 9 SuperNIC 與 BlueField 4 DPU 整合在單一機櫃級平台中,由 CPU 和 DPU 分擔工具呼叫、程式碼執行、網路、安全與編排等工作。