在本輪 MLPerf 中,CoreWeave 使用了高達 8,192 顆 NVIDIA GB300 NVL72 GPU,這是該輪提交中規模最大的 GB300 叢集,運行在與客戶相同的生產雲端基礎架構上 。
NVIDIA 的合作夥伴將 Blackwell GPU 規模推至 8,192 顆,並導入 Spectrum-X 乙太網路,透過自適應路由與壅塞控制來應對 MoE 模型突發的 all-to-all 通訊模式 。
| 基準測試 | 訓練時間 |
|---|---|
| Llama 3.1 8B 預訓練 | 5.2 分鐘 |
| Llama 2 70B 微調 (LoRA) | 0.40 分鐘 |
| FLUX.1 圖像生成 | 12.5 分鐘 |
| DLRM-DCNv2 推薦系統 | 0.71 分鐘 |
| RetinaNet 物件偵測 | 1.4 分鐘 |
| 圖神經網路 (R-GAT) | 0.84 分鐘 |
本輪亦展現了持續擴大的技術多樣性。值得關注的是:
MLPerf Training v6.0 不僅見證了 NVIDIA Blackwell 平台在規模與單加速器效能上的雙重統治,更透過 DeepSeek-V3 等 MoE 基準,將產業關注焦點推向大規模稀疏模型的實際訓練效率。
從硬體的記憶體容量躍升,到軟體堆疊在數月內帶來的 1.3 倍吞吐增益,再到 Spectrum-X 乙太網路對 MoE 通訊模式的適配,這一系列成果反映出 AI 訓練已進入一個由系統級設計驅動、持續快速疊代的新階段。