Chaque GPU Rubin embarque 288 Go de mémoire HBM4 avec une bande passante de 22 To/s . Pour donner un ordre de grandeur, le rack complet Vera Rubin NVL72 (qui contient 72 GPU) met à disposition 75 To de mémoire rapide et une bande passante HBM4 totale de 1,6 Po/s .
En termes de puissance brute, un seul rack NVL72 délivre 3,6 Exaflops en inférence NVFP4 et 2,5 Exaflops pour l'entraînement (toujours en NVFP4) .
Le principal saut technologique réside dans le passage de la mémoire HBM3e (utilisée par l'architecture Blackwell) à la HBM4 sur Rubin. Ce changement permet aux GPU de bénéficier d'une bande passante mémoire d'environ 22 To/s, soit un gain de 5 à 6 fois par rapport au précédent modèle phare B200, qui culminait à environ 4 To/s .
Au niveau du rack, NVIDIA annonce des performances d'inférence multipliées par 5 et un coût par jeton (token) divisé par 10 par rapport à Blackwell . Supermicro aligne ses objectifs, visant un débit par watt jusqu'à dix fois supérieur et un coût par jeton réduit d'un facteur 10 .
Supermicro propose deux déclinaisons adaptées à différents besoins :
Avec de telles densités de calcul, la gestion thermique devient un enjeu critique. Les plans DCBBS intègrent une pile de refroidissement liquide direct, baptisée DLC-2, conçue pour une capture de chaleur quasi totale, un meilleur rendement énergétique et une réduction du bruit. Les composants incluent :
Ces monolithes de calcul exigent une alimentation à la hauteur. Supermicro a prévu :
L'infrastructure électrique a été pensée pour s'adapter aussi bien aux déploiements mono-tenant que multi-tenant, dans une large enveloppe de puissance .
Au-delà du matériel, les plans DCBBS incarnent une véritable philosophie d'accompagnement. Supermicro propose un modèle de service complet qui couvre l'intégralité du cycle de vie d'un datacenter IA :
Cette approche modulaire et pré-validée élimine le besoin de construire des infrastructures sur mesure pour chaque projet, ce qui réduit considérablement le temps de mise en service et les risques d'intégration . Les premiers engagements clients sont ouverts dès à présent, pour des déploiements prévus au second semestre 2026, en phase avec la disponibilité générale de la plateforme NVIDIA Vera Rubin .