NVIDIA 喺 MLPerf Training v6.0 實現「全壘打」,贏晒全部七項基準測試,包括最快訓練時間同最高每加速器效能,仲係唯一一個提交晒所有測試嘅平台 [3]。 MLCommons 今次引入咗兩個全新嘅混合專家模型(MoE)預訓練基準:DeepSeek V3(總參數 6,710 億,每個 token 啟動 370 億)同埋體積較細嘅 GPT OSS 20B [3][10]。
研究答案

Create a landscape editorial hero image for this Studio Global article: What are the key highlights from the MLPerf Training v6.0 results, including Nvidia's performance across all benchmarks on its Blackwell pla. Article summary: ## MLPerf Training v6.0 Key Highlights. Topic tags: general, documentation, news, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Home » News » NVIDIA Sets MLPerf Inference v6.0 Records with Blackwell Ultra Platform. # NVIDIA Sets MLPerf Inference v6.0 Records with Blackwell Ultra Platform. NVIDIA has publish" source context "NVIDIA Sets MLPerf Inference v6.0 Records with Blackwell Ultra Platform - StorageReview.com" Reference image 2: visual subject "# MLPerf Inference v6.0 Results Explained: GPU Performance Rankings for AI Workloads (2026). MLPerf Inference v6.0 results dropped April 1, 2026, and
NVIDIA 喺今次 MLPerf Training v6.0 真係威到盡,唔單止贏晒全部基準測試,仲要係唯一一個提交晒所有七項測試嘅平台,無論係最快訓練時間定係每加速器效能都拎晒第一 。
今次測試嘅一大亮點,就係 MLCommons 新加咗兩個混合專家模型(MoE)嘅預訓練基準測試 。一個係參數量達到 6,710 億(671B)、每個 token 會啟動 370 億(37B)參數嘅 DeepSeek-V3,另一個就係規模較細嘅 GPT-OSS-20B。
NVIDIA 係唯一一個夠膽(同有能力)喺呢兩個新 Benchmark 都提交到結果嘅平台 。佢哋嘅秘密武器就係 GB300 NVL72 系統,配合客製化嘅 NVIDIA 軟件堆疊、CUDA graphs 同進階嘅 MoE 路由技術,先可以將呢類極具挑戰性嘅 MoE 架構訓練得咁高效。
要處理好似 DeepSeek-V3 咁複雜嘅模型,本身嘅技術含量已經好高。佢內部採用咗多頭潛伏注意力(MLA)、將專家網絡精細分割成 160 個路由專家、仲有多 token 預測同輔助損失自由負載平衡等技術,對硬件同軟件嘅協同要求極高 。
要講今次最震撼眼球嘅結果,一定係雲端服務商 CoreWeave 嘅表現。佢哋用咗足足 8,192 張 NVIDIA GB300 NVL72 GPU,呢個已經係今輪測試入面最大規模嘅 GB300 叢集,喺現時客戶都用得返嘅 CoreWeave Cloud 生產環境基礎設施上,只係用咗 2.02 分鐘就完成咗 DeepSeek-V3 671B 模型嘅訓練 。
呢個唔單止係基準測試入面最快嘅 DeepSeek-V3 訓練成績,更加係一個全堆疊最佳化嘅成果,包括咗網絡、編排同儲存層面嘅極致調整 。
今次結果清楚見到新一代 GB300 NVL72(Blackwell Ultra) 平台嘅實力。對比返上一代嘅 GB200 NVL72,GB300 喺推理測試入面,每個 token 嘅處理速度最高可以去到 2.77 倍 。而喺今次嘅訓練測試入面,佢嘅訓練吞吐量亦都明顯大幅提升。
點解可以有咁大進步?主要係因為 Blackwell Ultra 晶片有更大嘅記憶體同功耗預算,令到模型資料嘅本地性(locality)更高,處理得更快 。
NVIDIA 嘅軟件棧功勞都好大。佢哋嘅工程師喺一模一樣嘅硬件上,透過軟件創新(例如全迭代 CUDA graphs 同 CuTe DSL 融合),只係用咗三個月時間,就將 DeepSeek-V3 嘅訓練吞吐量再提升咗 1.3 倍,呢啲就係軟硬件協同設計嘅威力 。
今次 MLPerf Training v6.0 總共有 24 間機構提交咗結果,涉及 95 個唔同嘅系統,用到 13 種唔同嘅硬件加速器,規模同多元性都係前所未有 。
MLPerf Training 嘅聯席主席 Shriya Rishab 都特別提到,今輪測試嘅技術光譜好闊,涵蓋咗多種 FP4 精度方案(包括 AMD 嘅 MXFP4)同唔同嘅軟件框架 。
其中 AMD Instinct MI355X 用 MXFP4 嘅表現亦都好有睇頭,喺 Llama 2-70B 模型微調同 Llama 3.1-8B 預訓練呢兩個項目入面,佢同 NVIDIA B200 平台嘅效能差距,分別只係拉近到 5% 同 6% 以內,開始有得競爭 。
要將規模擴展到幾千張 GPU,網絡技術係關鍵。NVIDIA 嘅合作夥伴今次將規模擴展到 8,192 張 Blackwell GPU,背後全靠 Spectrum-X 乙太網絡嘅自適應路由(Adaptive Routing)同擁塞控制(Congestion Control)技術,先至可以應付到 MoE 模型嗰種突發性極強嘅 all-to-all 通訊模式,令到網絡頻寬可以維持喺接近理論值嘅水平 。
NVLink 交換器領域(NVLink-switch domains)同向外擴展網絡架構(scale-out fabric)嘅結合,帶嚟嘅就係全線破紀錄嘅成績。其他值得留意嘅成績包括:
NVIDIA 今次嘅表現,可以話係再次印證咗佢哋喺 AI 訓練領域嘅領導地位,特別係喺處理大規模、極複雜嘅混合專家模型時,由硬件到軟件再到網絡嘅全棧式優勢,短期內真係好難有其他平台可以撼動。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
NVIDIA 喺 MLPerf Training v6.0 實現「全壘打」,贏晒全部七項基準測試,包括最快訓練時間同最高每加速器效能,仲係唯一一個提交晒所有測試嘅平台 [3]。
NVIDIA 喺 MLPerf Training v6.0 實現「全壘打」,贏晒全部七項基準測試,包括最快訓練時間同最高每加速器效能,仲係唯一一個提交晒所有測試嘅平台 [3]。 MLCommons 今次引入咗兩個全新嘅混合專家模型(MoE)預訓練基準:DeepSeek V3(總參數 6,710 億,每個 token 啟動 370 億)同埋體積較細嘅 GPT OSS 20B [3][10]。
NVIDIA 係唯一一個喺兩個新基準都提交咗結果嘅平台,佢哋用 GB300 NVL72 系統配合客製化軟件堆疊、CUDA graphs 同進階 MoE 路由技術嚟達到最佳化 [3]。