Architektura DeepSeek-V3 jest wyjątkowo zaawansowana. Oprócz MoE wykorzystuje Multi-head Latent Attention (MLA), precyzyjną segmentację ekspertów (160 trasowanych ekspertów) i przewidywanie wielu tokenów na raz, co czyni ją jednym z najbardziej wymagających testów dla sprzętu AI .
Największe wrażenie zrobił wynik dostawcy chmury obliczeniowej CoreWeave. Firma, korzystając z produkcyjnej infrastruktury dostępnej dla swoich klientów, wytrenowała model DeepSeek-V3 671B w zaledwie 2,02 minuty .
Był to nie tylko najszybszy czas dla tego modelu w całym teście, ale także pokaz możliwości ogromnego klastra. CoreWeave użyło 8192 układów GPU NVIDIA GB300 NVL72, co było największą konfiguracją zgłoszoną w tej rundzie . Kluczem do sukcesu była optymalizacja całego stosu technologicznego – od sieci, przez orkiestrację, po warstwę pamięci masowej.
Porównanie nowej platformy GB300 NVL72 z poprzednią generacją GB200 NVL72 pokazuje, jak duży jest postęp technologiczny:
Przewaga ta wynika z większych zasobów pamięci i budżetu energetycznego, ale to tylko połowa sukcesu. Druga połowa to oprogramowanie. Inżynierowie NVIDII osiągnęli 1,3-krotny wzrost przepustowości treningu DeepSeek-V3 w ciągu zaledwie trzech miesięcy na identycznym sprzęcie, wykorzystując zaawansowane techniki, takie jak pełnoiteracyjne grafy CUDA i fuzje oparte na CuTe DSL . Pokazuje to, jak bardzo optymalizacja stosu programowego (CUDA) wpływa na końcowy wynik.
Choć NVIDIA zdominowała wyniki, runda MLPerf Training 6.0 była rekordowa pod względem różnorodności:
Ta techniczna różnorodność, którą doceniła współprzewodnicząca MLPerf Training, Shriya Rishab, pokazuje, że rynek AI staje się coraz bardziej zaawansowany i konkurencyjny .
Osiągnięcie rekordowych czasów na tak dużą skalę nie byłoby możliwe bez innowacji w łączności. Partnerzy NVIDII skalowali swoje klastry do 8192 układów Blackwell, wykorzystując technologię Spectrum-X Ethernet.
Jest to kluczowe dla modeli MoE, które wymagają intensywnej, "wybuchowej" komunikacji wszystkich ze wszystkimi. Funkcje takie jak Adaptive Routing i Congestion Control pozwoliły utrzymać przepustowość sieci bliską teoretycznemu maksimum .
Dzięki połączeniu domen NVLink-switch i sieci scale-out, platforma NVIDII ustanowiła rekordowe czasy we wszystkich kategoriach, od dużych modeli językowych po generowanie obrazów:
Te wyniki to nie tylko suche liczby – to dowód na to, że kompleksowa integracja sprzętu i oprogramowania, od pojedynczego GPU po całe centrum danych, jest dziś kluczem do wygrywania wyścigu o coraz potężniejsze modele AI.