La scelta si aggiunge all'adozione dei rack Nvidia Vera Rubin NVL72 e delinea una strategia a doppio fornitore: usare entrambe le piattaforme per aumentare la capacità di calcolo, ridurre la dipendenza dalla catena di approvvigionamento di un singolo produttore e mantenere maggiore flessibilità nelle trattative .
La logica è simile all'approccio «model-agnostic» già adottato da Microsoft in Azure e Copilot: non legarsi a un'unica piattaforma quando il mercato è ancora in rapida evoluzione . Distribuire gli investimenti tra AMD e Nvidia può limitare il rischio di ritardi o vincoli nelle assegnazioni e offrire a Microsoft più margine operativo se uno dei due produttori dovesse incontrare problemi di disponibilità .
Satya Nadella ha dichiarato che Microsoft sarà tra i primi fornitori cloud a implementare infrastrutture AI rack-scale di nuova generazione basate sia su AMD Helios sia su Nvidia Vera Rubin . In altre parole, Azure preferisce tenere aperte entrambe le strade invece di trasformare l'intera flotta AI in una scommessa su un solo ecosistema.
Né AMD né Microsoft hanno reso pubblici i prezzi effettivi dell'accordo o il numero di rack che Azure acquisterà. Le stime del Futurum Group indicano però una differenza significativa:
Il sistema AMD risulterebbe quindi circa il 40% più costoso a parità di rack . Il sovrapprezzo stimato viene associato alla maggiore capacità di memoria di Helios, alla sua architettura basata su standard aperti e all'integrazione in un'unica piattaforma di acceleratori, CPU e networking AMD .
AMD sostiene che il prezzo iniziale più alto possa essere compensato dall'efficienza nell'uso reale. Secondo i dati dei laboratori dell'azienda, Helios offrirebbe :
Lisa Su, amministratrice delegata di AMD, ha presentato Helios sostenendo che il rack garantisca almeno il 15% di prestazioni in più sui modelli più grandi, il 50% di memoria HBM aggiuntiva e fino al 30% in più di token per dollaro .
Il confronto, tuttavia, non è ancora definitivo. Il Futurum Group avverte che i numeri di AMD sono stime del produttore comparate con un concorrente non ancora distribuito su larga scala: il vantaggio dichiarato del 15% e quello del 30% sui token per dollaro dovranno essere verificati in produzione nei prossimi due trimestri .
Helios è un sistema rack-scale raffreddato a liquido: invece di assemblare singoli acceleratori in server tradizionali, concentra in un unico rack i principali elementi necessari per il calcolo AI, la memoria e la comunicazione tra nodi .
| Componente | Specifica |
|---|---|
| GPU | 72 AMD Instinct MI455X |
| Architettura GPU | CDNA 5, con chiplet ibridi prodotti con processi a 2 e 3 nm presso TSMC |
| Transistor per GPU | 320 miliardi |
| CPU | 18 AMD EPYC Venice di sesta generazione, una per ciascun cassetto di calcolo |
| Networking | NIC AI AMD Pensando Vulcano 800, con Ethernet a 800 Gbps e fino a 2,4 Tbps di scale-out per GPU |
| Interconnessione scale-up | UALink, incapsulato su Ethernet |
| Interconnessione scale-out | Allineata alle specifiche dell'Ultra Ethernet Consortium |
| Memoria HBM4 totale | Fino a 31 TB per rack |
| Memoria per GPU | 432 GB, distribuiti su 12 stack HBM4 da 36 GB |
| Larghezza di banda per GPU | 19,6 TB/s |
| Larghezza di banda aggregata | Fino a circa 1,7 PB/s per rack |
| Prestazioni FP4 | 2,9 exaFLOPS per rack |
| Prestazioni FP8 | 1,4 exaFLOPS per rack |
| Banda scale-up | 260 TB/s |
| Banda scale-out | 43 TB/s |
| Formato | 18 cassetti di calcolo raffreddati a liquido, con 4 GPU ciascuno, più 6 cassetti switch; compatibile con OCP Open Rack Wide |
| Prestazioni per GPU | 40 PFLOPS FP4 e 20 PFLOPS FP8 |
Ogni cassetto di calcolo riunisce quattro MI455X, una CPU EPYC Venice e il networking Pensando. Il collegamento UALink consente alle 72 GPU di operare come un'unica risorsa di calcolo, un aspetto importante per i modelli di grandi dimensioni .
Oltre a Microsoft, AMD ha indicato tra i primi clienti di Helios Meta, OpenAI e Oracle . Anche Tata Consultancy Services è stata citata come cliente iniziale .
Anthropic, invece, non è stata nominata pubblicamente come cliente iniziale di Helios nei principali annunci disponibili a luglio 2026 . Il suo nome compare nella domanda di partenza, ma le fonti fornite non documentano un impegno confermato dell'azienda verso il sistema AMD.
La decisione di Microsoft mostra come la competizione tra AMD e Nvidia si stia spostando dal singolo chip all'intero rack: acceleratori, memoria, CPU, rete, raffreddamento e software devono funzionare insieme. Per i grandi operatori cloud, la diversificazione può significare più sicurezza nelle forniture, maggiore potere negoziale e la possibilità di scegliere l'architettura più adatta a ciascun carico .
Helios punta soprattutto sulla capacità di memoria e sulla connettività Ethernet aperta. I suoi 31 TB di HBM4 e l'elevata larghezza di banda sono pensati per l'inferenza su larga scala, dove la memoria disponibile e il flusso di dati possono incidere direttamente sulla velocità di risposta e sul costo di ogni token .
Le spedizioni sono attese nella seconda metà del 2026. Il vero banco di prova arriverà quando Helios e Vera Rubin saranno impiegati in produzione e saranno disponibili benchmark indipendenti: solo allora si potrà capire se il sovrapprezzo del sistema AMD si tradurrà davvero in un costo inferiore per l'inferenza.