Microsoft divise délibérément son infrastructure d'IA de nouvelle génération entre AMD Helios et Nvidia Vera Rubin afin de réduire les risques liés à la chaîne d'approvisionnement et d'éviter une dépendance excessive à un seul fournisseur . Cette approche fait écho à la stratégie "agnostique" de l'entreprise en matière de modèles d'IA au sein d'Azure et de Copilot . Le PDG Satya Nadella a confirmé : « Nous serons parmi les premiers fournisseurs de cloud à déployer une infrastructure d'IA à l'échelle du rack de nouvelle génération basée sur AMD Helios et Nvidia Vera Rubin », ce qui donne à Microsoft un levier de négociation et une flexibilité opérationnelle si l'un des fournisseurs est confronté à des contraintes d'allocation . Cette stratégie est largement décrite dans l'industrie comme "un pari sur les deux tableaux" en matière d'approvisionnement en infrastructure IA .
Ni AMD ni Microsoft n'ont divulgué les prix exacts, mais les estimations des analystes du Futurum Group fournissent une comparaison claire :
Cela rend Helios environ 40% plus cher sur une base rack par rack . Cette prime reflète la capacité mémoire plus élevée d'Helios, son architecture ouverte et le portefeuille intégré CPU-GPU-réseau d'AMD .
AMD affirme que le coût initial plus élevé d'Helios est justifié par une efficacité de performance supérieure. Selon les données de laboratoire d'AMD, Helios offre :
La PDG d'AMD, Lisa Su, a présenté ces chiffres lors de l'événement Advancing AI 2026, déclarant qu'Helios offre « 15% ou plus de performance que la concurrence sur les plus gros modèles, 50% de capacité HBM en plus et jusqu'à 30% de tokens en plus par dollar » .
Cependant, les analystes précisent qu'il s'agit d'estimations de pré-production. Le Futurum Group a noté que « l'avantage de performance de 15% et les affirmations de 30% de tokens en plus par dollar d'AMD restent des calculs de fournisseur face à un concurrent qui n'a pas encore été expédié ; ils seront testés en production dans un délai de deux trimestres » .
AMD Helios est un système rack refroidi par liquide, conçu sur mesure, qui représente l'offre matérielle IA la plus complète d'AMD à ce jour :
| Composant | Spécification |
|---|---|
| GPU | 72x AMD Instinct MI455X |
| Architecture GPU | CDNA 5 (hybride chiplet 2nm/3nm chez TSMC) |
| Transistors par GPU | 320 milliards |
| CPU | 18x AMD EPYC 6e génération "Venice" (un par plateau de calcul, jusqu'à 256 cœurs par CPU) |
| Réseau | AMD Pensando "Vulcano" 800 AI NIC (Ethernet 800 Gbps, jusqu'à 2,4 Tbps de bande passante scale-out par GPU) |
| Interconnexion scale-up | UALink (Ultra Accelerator Link tunnelisé sur Ethernet) |
| Interconnexion scale-out | Alignée sur l'Ultra Ethernet Consortium (UEC) |
| Mémoire HBM4 totale | 31 To par rack |
| Mémoire par GPU | 432 Go (12 stacks de HBM4 à 36 Go chacune) |
| Bande passante mémoire par GPU | 19,6 To/s |
| Bande passante mémoire agrégée | 1,7 Po/s par rack |
| Performance FP4 | 2,9 exaFLOPS par rack |
| Performance FP8 | 1,4 exaFLOPS par rack |
| Bande passante scale-up | 260 To/s |
| Bande passante scale-out | 43 To/s |
| Facteur de forme | 18 plateaux de calcul refroidis par liquide (4 GPU chacun) + 6 plateaux de commutation, conforme OCP Open Rack Wide |
| Performance par GPU | 40 PFLOPS FP4, 20 PFLOPS FP8 |
Chaque plateau de calcul contient quatre GPU MI455X associés à un seul CPU EPYC Venice et au réseau Pensando, le tout étant connecté via le protocole UALink pour permettre aux 72 GPU de fonctionner comme une seule unité de calcul .
AMD a obtenu les premiers clients Helios confirmés suivants :
Une absence notable : Anthropic n'a pas été publiquement nommé comme client précoce d'Helios dans aucune des annonces majeures en date de juillet 2026 .
La décision de Microsoft de déployer à la fois AMD Helios et Nvidia Vera Rubin signale que le marché du matériel IA est entré dans une nouvelle phase. Plutôt qu'une dépendance à un seul fournisseur, les hyperscalers investissent dans la diversité des plateformes pour sécuriser l'approvisionnement, améliorer leur levier de négociation et accéder à des caractéristiques de performance différenciées .
AMD Helios, avec ses 31 To massifs de mémoire HBM4 et son interconnexion ouverte basée sur Ethernet, est particulièrement bien adapté aux charges de travail d'inférence à grande échelle, où la capacité et la bande passante mémoire déterminent directement le débit et le coût par token . Les expéditions étant attendues dans la seconde moitié de 2026, le véritable test aura lieu lorsque les benchmarks de production seront publiés et que les affirmations concurrentielles pourront être vérifiées à grande échelle .