Vera Rubin NVL72 將 72 顆 Rubin GPU、36 顆 Vera CPU、ConnectX 9 SuperNIC、BlueField 4 DPU 與 NVLink 6 整合在單一液冷機架中。 NVIDIA 表示,在 SemiAnalysis AgentX 與 DeepSeek V4 Pro 工作負載測試中,Vera Rubin NVL72 相較 GB300 NVL72,代理式 AI 每兆瓦吞吐量最高提升 30 倍,Token 成本最高降低 35 倍。[8][9] Vera CPU 採用 88 個 Olympus 核心、176 個 Spatial Multithreading 執行緒,搭配最高 1.2 TB...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce about its next generation Vera Rubin NVL72 platform, Vera CPU, Scale In networking, and partnerships, including the. Article summary: Nvidia’s announcement positions Vera Rubin as a rack scale, full stack “AI factory,” not merely a faster GPU generation: it combines custom GPUs, CPUs, scale up and scale out networking, DPUs, and power management softwa. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
NVIDIA 這次對 Vera Rubin 的定位,並不是「換上一代更快的 GPU」這麼簡單,而是把處理器、機架內互連、跨機架網路、資料處理器、儲存與電力管理軟體,整合成一座可大規模部署的「AI 工廠」。
這個方向瞄準的是代理式 AI(agentic AI):模型不只回答一次問題,還會反覆推理、呼叫工具、執行程式、擷取資料,並由多個子代理協同完成任務。因此,真正的瓶頸不一定只是 GPU FLOPS,也可能出現在 CPU 排程、記憶體頻寬、資料搬移、網路延遲、散熱與供電能力。
Vera Rubin NVL72 是一個液冷機架級平台,整合以下元件:
NVL72 的設計目標,是讓 72 顆 GPU 像一台緊密耦合的單一大型電腦般運作,而不是多張彼此分離的加速卡。NVIDIA 表示,NVLink 6 可提供每顆 GPU 3.6 TB/s 的雙向 GPU 對 GPU 頻寬,整個 72-GPU 機架的 GPU 頻寬則達 260 TB/s。3
機架之外,Quantum-X800 InfiniBand 或 Spectrum-X Ethernet 可把多個 NVL72 機架連接成更大的叢集;ConnectX-9 與 BlueField-4 則負責網路、儲存、安全性及其他資料路徑工作。36
NVIDIA 公布的焦點數字是:Vera Rubin NVL72 在代理式 AI 工作負載上的每兆瓦吞吐量,相較 GB300 NVL72 最高提升 30 倍;在同一項比較中,Token 成本最高降低 35 倍。89
這裡的「每兆瓦吞吐量」可理解為:在相同電力預算下,AI 工廠能完成多少代理式 AI 工作。對資料中心業者而言,這比單看峰值算力更接近實際經濟效益,因為供電、冷卻與機房容量往往比採購到多少加速器更容易成為部署限制。
NVIDIA 也曾就 Rubin 整體平台宣稱,推論 Token 成本相較 Blackwell 最多可降低 10 倍。11 不過,這些數字必須放回特定模型、上下文長度、互動速度目標、軟體設定與資料中心條件中理解,不能直接視為所有服務都能取得的固定價格。
這次測量採用 SemiAnalysis 的 AgentX 工作負載,內容是回放生產環境風格的代理式程式設計工作階段,並以 DeepSeek V4 Pro 作為模型。89
與一次性聊天不同,AgentX 會保留實際工作流程中的長上下文成長、工具呼叫與子代理生成。代理可能需要執行程式、讀取檔案、進行資料處理、再次呼叫模型,接著根據結果修正方案。這類工作負載會同時放大以下因素的重要性:
因此,AgentX 測到的並非單純的 GPU 峰值運算能力,而是整個 AI 工廠完成互動式代理任務的效率。8
需要留意的是,30 倍與 35 倍是 NVIDIA 援引的廠商測試與比較結果,現有資料並未提供獨立、同儕審查的驗證。8 提供的資料也不足以支持一個具備相同條件、可直接與 Hopper 比較的主要來源倍數,更沒有公布可驗證的「每 100 萬 Token 多少美元」精確價格。
代理式工作流程通常比一次性聊天消耗更多 Token,原因在於它包含反覆推理、工具使用與多輪互動;但實際 Token 用量會隨模型、任務、上下文及代理設計而改變。因此,不能把特定測試中的成本降幅,直接當成普遍適用的服務單價。
Vera 是 NVIDIA 自行設計、相容 Armv9.2 指令集的 CPU。它採用 88 個 Olympus 核心,並透過 Spatial Multithreading 支援 176 個執行緒,定位是處理推論周邊大量且高並行的 CPU 工作。210
這些工作包括:
代理式 AI 的模型推論仍由 GPU 主導,但模型周圍的控制流程可能產生大量 CPU 工作。如果 CPU 無法及時完成資料整理、工具執行或任務編排,GPU 便可能因等待資料而閒置。Vera 的目標,就是降低這類「GPU 很快、整個工作流程卻不夠快」的落差。
Vera 搭配 SOCAMM2 LPDDR5X 記憶體,最高提供 1.2 TB/s 的整體記憶體頻寬,平均每核心最高可達 14 GB/s。78 第二代 Scalable Coherency Fabric(SCF)則將 88 個核心、共享 L3 快取、記憶體子系統與 I/O 連成一致的資料路徑,提供最高 3.4 TB/s 的 bisection bandwidth,並配備 164 MB 統一 L3 快取。
相較 Grace,NVIDIA 表示 Vera 的記憶體頻寬提升 2.4 倍、記憶體容量提升 3 倍,CPU 與 GPU 之間的 NVLink-C2C 頻寬則提升至 2 倍。1 在 Vera Rubin NVL72 中,NVLink-C2C 可提供 1.8 TB/s 的一致性頻寬,讓 CPU 與 GPU 更有效率地共享資料。
NVIDIA 所說的 Scale-In,通常可理解為機架內的 Scale-Up:把多顆 GPU 組成一個低延遲、高頻寬的運算域。Vera Rubin NVL72 的核心就是透過 NVLink 6,讓 72 顆 GPU 以更接近單一系統的方式協同工作。
整體網路架構可分成三層:
換句話說,Scale-In 並不是取代 Scale-Out,而是處理不同距離與不同層級的通訊問題:NVLink 讓單一機架內的 GPU 緊密合作,InfiniBand 或 Ethernet 則把多個機架串成更大的系統。
NVIDIA 也把 DSX 定位為涵蓋晶片、系統、軟體、設施與合作夥伴技術的端到端 AI 工廠設計。當中的 DSX MaxLPS 軟體,目標不是單純讓硬體在瞬間使用最高功率,而是最大化每兆瓦可產生的 Token 吞吐量,進而降低每個 Token 的成本。1215
這種思路對大型資料中心尤其重要。若供電與冷卻容量有限,單純追求峰值效能可能導致部分工作負載互相爭用能源與散熱資源。MaxLPS 的價值,在於協助系統於不同工作階段與元件之間分配功率,使整座 AI 工廠在固定能源預算下完成更多有效工作。182021
NVIDIA 表示,SpaceXAI 將部署 Vera CPU,以處理下一代代理式 AI 工作負載,並採用 Vera Rubin 擴充 Grok 背後的 AI 基礎設施,朝吉瓦級運算容量發展。10
雙方也計畫把這套架構延伸至規劃中的 Starmind 軌道運算計畫:第一代 Starmind AI 衛星將以經過優化的 Vera Rubin NVL72 系統作為運算載荷。1012
這仍是規劃中的部署,不代表目前已經存在可運作的軌道 AI 資料中心。太空環境還需要處理供電、散熱、頻寬、可靠性與硬體整合等問題,因此實際部署能力仍有待後續進展確認。
若 NVIDIA 的工作負載數字最終能在客戶部署中重現,Vera Rubin 的主要價值就不只是「模型跑得更快」,而是在受限的每一兆瓦電力下,完成更多有用的代理任務。這可能同時降低每個生成 Token 所對應的電力、冷卻、網路與資本支出。
更具戰略意義的是,NVIDIA 正把競爭範圍從 GPU 擴展到整套 AI 基礎設施:
這種「硬體加軟體加資料中心」的整合,可能讓 NVIDIA 更能與其他 GPU 供應商及傳統 CPU 廠商競爭;但另一面是,客戶也會更深地依賴 NVIDIA 的架構、互連與軟體生態系。Vera Rubin 的真正影響,最終仍取決於產品能否按計畫交付、第三方測試是否支持這些效率宣稱,以及客戶是否願意接受更完整的 NVIDIA 堆疊。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Vera Rubin NVL72 將 72 顆 Rubin GPU、36 顆 Vera CPU、ConnectX 9 SuperNIC、BlueField 4 DPU 與 NVLink 6 整合在單一液冷機架中。
Vera Rubin NVL72 將 72 顆 Rubin GPU、36 顆 Vera CPU、ConnectX 9 SuperNIC、BlueField 4 DPU 與 NVLink 6 整合在單一液冷機架中。 NVIDIA 表示,在 SemiAnalysis AgentX 與 DeepSeek V4 Pro 工作負載測試中,Vera Rubin NVL72 相較 GB300 NVL72,代理式 AI 每兆瓦吞吐量最高提升 30 倍,Token 成本最高降低 35 倍。[8][9]
Vera CPU 採用 88 個 Olympus 核心、176 個 Spatial Multithreading 執行緒,搭配最高 1.2 TB/s 的 LPDDR5X 記憶體頻寬。[2][7][8]