Tegelijkertijd blijft Microsoft inzetten op Nvidia. Azure ondersteunt ook Nvidia’s Vera Rubin NVL72-racks, waarmee het cloudbedrijf bewust niet volledig afhankelijk wordt van één chipmaker .
De strategie moet vooral de leveringszekerheid vergroten en het risico van een afhankelijkheid van één leverancier beperken . Als AMD of Nvidia met productieproblemen of beperkte toewijzingen te maken krijgt, kan Microsoft capaciteit over het andere platform verdelen. De aanpak sluit aan bij Microsofts bredere, modelonafhankelijke strategie voor Azure en Copilot .
Microsoft-topman Satya Nadella zei dat Azure tot de eerste cloudproviders zal behoren die rack-scale-AI-infrastructuur van zowel AMD Helios als Nvidia Vera Rubin uitrollen . Dat geeft Microsoft bovendien meer onderhandelingsruimte en flexibiliteit bij de planning van zijn datacenters.
De exacte contractprijzen zijn niet bekendgemaakt door AMD of Microsoft. Schattingen van Futurum Group wijzen echter op een aanzienlijk verschil:
Op basis van die ramingen is Helios ongeveer 40 procent duurder dan Vera Rubin. De meerprijs wordt onder meer toegeschreven aan de grotere geheugencapaciteit, de open Ethernet-gebaseerde architectuur en AMD’s combinatie van gpu’s, cpu’s en netwerkcomponenten .
AMD stelt dat de hogere aanschafprijs kan worden terugverdiend door een betere efficiëntie bij AI-inferentie. Op basis van eigen laboratoriumtests claimt het bedrijf dat Helios :
AMD-topvrouw Lisa Su presenteerde deze cijfers tijdens het evenement Advancing AI 2026. Volgens haar levert Helios bij de grootste modellen minstens 15 procent meer prestaties, beschikt het over 50 procent meer HBM-geheugen en kan het tot 30 procent meer tokens per dollar verwerken .
Die vergelijking moet voorlopig wel met enige voorzichtigheid worden gelezen. Futurum Group noemt de cijfers leveranciersberekeningen tegenover een concurrent die nog niet is uitgeleverd. De claims moeten daarom in productieomgevingen en met onafhankelijke benchmarks worden getoetst .
Helios is AMD’s eerste volledig geïntegreerde rack-scale-AI-systeem. Het systeem is vloeistofgekoeld en combineert rekenkracht, geheugen, cpu’s en netwerkconnectiviteit in één rack .
| Onderdeel | Specificatie |
|---|---|
| Gpu’s | 72 AMD Instinct MI455X |
| Gpu-architectuur | CDNA 5, met een hybride chipletontwerp op 2nm- en 3nm-procestechnologie |
| Transistors per gpu | 320 miljard |
| Cpu’s | 18 AMD EPYC-processors van de zesde generatie, codenaam ‘Venice’ |
| Netwerk | AMD Pensando ‘Vulcano’ 800 AI-NIC’s, met 800 Gbps Ethernet |
| Interconnect binnen het rack | UALink, via Ethernet getunneld |
| Interconnect tussen racks | Afgestemd op de standaarden van het Ultra Ethernet Consortium |
| Totaal HBM4-geheugen | 31 TB per rack |
| Geheugen per gpu | 432 GB, verdeeld over twaalf HBM4-stacks van elk 36 GB |
| Geheugenbandbreedte per gpu | 19,6 TB/s |
| Gezamenlijke geheugenbandbreedte | Ongeveer 1,7 PB/s per rack |
| FP4-prestaties | 2,9 exaFLOPS per rack |
| FP8-prestaties | 1,4 exaFLOPS per rack |
| Scale-up-bandbreedte | 260 TB/s |
| Scale-out-bandbreedte | 43 TB/s |
| Bouwvorm | 18 vloeistofgekoelde compute-trays met elk vier gpu’s, plus zes switch-trays; conform OCP Open Rack Wide |
| Prestaties per gpu | 40 PFLOPS FP4 en 20 PFLOPS FP8 |
Elke compute-tray bevat vier MI455X-gpu’s, één EPYC Venice-cpu en Pensando-netwerkhardware. Via UALink worden de 72 gpu’s gekoppeld zodat ze als één grote rekenomgeving kunnen functioneren .
AMD heeft naast Microsoft meerdere vroege klanten voor Helios genoemd :
Anthropic is opvallend afwezig in de openbare aankondigingen. Tot juli 2026 is het bedrijf niet publiekelijk genoemd als vroege Helios-klant in de belangrijkste bekendmakingen .
De keuze van Microsoft laat zien dat de concurrentie in AI-hardware niet langer alleen om losse gpu’s draait. Cloudbedrijven kopen steeds vaker complete racks waarin rekenchips, geheugen, cpu’s, netwerkcomponenten en software als één platform samenwerken.
Voor grote inferentieworkloads kan vooral de geheugencapaciteit belangrijk zijn. Grotere modellen passen daardoor makkelijker binnen één systeem en hoeven minder vaak gegevens tussen verschillende racks te verplaatsen. Dat kan invloed hebben op de snelheid en op de kosten per gegenereerde token .
AMD Helios moet in de tweede helft van 2026 worden geleverd. De belangrijkste test volgt zodra de systemen daadwerkelijk op schaal draaien: dan kunnen onafhankelijke productiemetingen uitwijzen of AMD’s beloofde voorsprong van 15 procent in prestaties en tot 30 procent in tokens per dollar standhoudt .