Настоящую сенсацию произвел облачный AI-провайдер CoreWeave, установивший рекорд скорости на самом тяжелом задании. Команда обучила DeepSeek-V3 671B всего за 2.02 минуты. Это стало возможным благодаря развертыванию кластера из 8 192 GPU NVIDIA GB300 NVL72 (2 048 узлов) — крупнейшей конфигурации нового поколения, заявленной в этом раунде .
Важно подчеркнуть, что обучение проходило не в лабораторных условиях, а на стандартной производственной облачной платформе CoreWeave, доступной клиентам. Такой результат был достигнут за счет комплексной инженерной работы: от тонкой настройки сетевого взаимодействия и системы оркестрации до высокопроизводительных уровней хранения данных .
Новое поколение ускорителей Blackwell Ultra обеспечило значимый отрыв от предшественников. По данным NVIDIA, в задачах инференса система GB300 NVL72 выдает до 2.77 раз больше токенов в секунду, чем GB200 NVL72 . Что касается обучения, то при одинаковом масштабе кластера прирост производительности достигает 1.6x
.
Ключ к такому скачку — не только «железо», но и софт. За три месяца работы над оптимизациями для DeepSeek-V3 инженеры NVIDIA увеличили пропускную способность обучения на идентичном оборудовании в 1.3 раза, внедрив полные итерационные CUDA-графы и продвинутые техники слияния операций .
Раунд MLPerf Training v6.0 продемонстрировал не только мощь одного вендора, но и расширение рынка ускорителей ИИ. В тестах приняли участие 24 организации, представившие 95 различных систем на 13 типах аппаратных ускорителей .
Особого внимания заслуживают результаты компании AMD. Ее ускорители Instinct MI355X с новым форматом вычислений MXFP4 показали конкурентную производительность в сравнении с NVIDIA B200: отставание составило около 5% в задаче точной настройки Llama 2-70B и 6% в предобучении Llama 3.1-8B .
Для работы с «взрывным» сетевым трафиком, характерным для MoE-моделей (all-to-all communication), партнеры NVIDIA масштабировали кластеры до тысяч ускорителей, используя фабрику Spectrum-X Ethernet. Технологии адаптивной маршрутизации и контроля перегрузок позволили удержать пропускную способность сети на уровне, близком к теоретическому пределу .
В итоге абсолютные рекорды были зафиксированы по всем категориям. Для наглядности приведем лучшее время обучения NVIDIA на других ключевых задачах раунда :
Итоги MLPerf Training v6.0 закрепляют тренд на индустриализацию обучения сверхбольших и разреженных моделей, где на первый план выходит не только пиковая производительность чипа, но и синергия аппаратных платформ, инженерных оптимизаций и масштабируемой сетевой инфраструктуры.