Voor het eerst introduceert MLCommons twee grootschalige benchmarks die gebruikmaken van MoE-architecturen. Dit is een directe reactie op de industrietrend waarbij modellen zoals DeepSeek-V3 en GPT-OSS steeds meer experts gebruiken om efficiënter te schalen zonder alle parameters tegelijk te activeren.
De GPT-OSS-20B benchmark biedt een kleiner MoE-model dat nog steeds complexe routing- en communicatiepatronen vereist. Voor organisaties die niet direct naar 671B-parameters schalen, levert dit een realistischer startpunt op .
NVIDIA was het enige platform dat resultaten indiende voor zowel de DeepSeek-V3 als de GPT-OSS-20B workload. Dit onderstreept de volledigheid van het NVIDIA-ecosysteem, waarbij de GB300 NVL72-systemen via CUDA graphs, geavanceerde MoE-routing en aangepaste softwarestacks werden geoptimaliseerd om deze complexe architecturen aan te kunnen .
Het absolute hoogtepunt van deze MLPerf-ronde komt van cloudprovider CoreWeave, dat DeepSeek-V3 671B trainde in 2,02 minuten – een tijd die voorheen ondenkbaar was voor een model van deze omvang.
"Running on the same CoreWeave Cloud infrastructure available to customers today, CoreWeave delivered the fastest DeepSeek-V3 671B training performance in the benchmark," aldus het bedrijf in de officiële aankondiging
.
Dit resultaat benadrukt hoe grensverleggende AI-trainingen niet langer het exclusieve domein zijn van gespecialiseerde labs, maar beschikbaar komen op publieke cloudinfrastructuur.
De introductie van de NVIDIA GB300 NVL72, ook wel Blackwell Ultra genoemd, markeert een substantiële generatiesprong. Waar de GB200 al indrukwekkend was, tilt de GB300 de prestaties naar een nog hoger niveau – zowel bij training als bij inferentie.
Deze hardware-vooruitgang vertaalt zich direct naar betere prijs-prestatieverhoudingen: de kosten per token dalen gestaag, wat essentieel is voor massale AI-adoptie. NVIDIA’s cumulatieve MLPerf-overwinningen (training én inferentie) staan nu op 291 sinds 2018 – 9x meer dan alle andere deelnemers bij elkaar .
De MLPerf Training v6.0 ronde was de meest diverse tot nu toe:
AMD liet zien dat het de achterstand snel inloopt. Het Instinct MI355X-platform met MXFP4 leverde concurrerende prestaties tegenover het NVIDIA B200-platform met NVFP4 :
Hoewel NVIDIA de absolute leider blijft, is deze competitieve druk een positief signaal voor de industrie: het stimuleert innovatie en kan leiden tot lagere kosten voor eindgebruikers.
De MLPerf Training v6.0 resultaten illustreren drie fundamentele trends:
Voor Nederlandse bedrijven en kennisinstellingen die met AI werken, is de boodschap duidelijk: de drempel om grootschalige modellen te trainen wordt steeds lager, terwijl cloudproviders zoals CoreWeave deze capaciteit als dienst beschikbaar stellen. Het is niet langer de vraag óf je een 671B-parameter model kúnt trainen, maar wat je ermee wilt bereiken.
"Despite its excellent performance, DeepSeek-V3 requires only 2.788M H800 GPU hours for its full training," merkten de ontwikkelaars op in hun technische rapport – een cijfer dat de enorme efficiëntie van moderne trainingspipelines onderstreept
.
De volgende MLPerf-ronde zal ongetwijfeld weer nieuwe records brengen. Voor nu is één ding zeker: NVIDIA's Blackwell-platform heeft de lat hoger gelegd dan ooit.