Die These hinter diesem massiven Schritt ist einfach: Die KI-Revolution verlagert sich vom Training auf die Inferenz – also die Ausführung trainierter Modelle. Und die Arbeitslasten der Zukunft – autonome, mehrstufige „Agentic AI“-Systeme – benötigen weit mehr CPU-Rechenleistung, als die Branche bisher angenommen hat .
Agentic-AI-Workloads sollen bis 2030 rund zwei Drittel des 220-Milliarden-Dollar-Server-CPU-Marktes ausmachen . Diese Systeme orchestrieren komplexe Aufgaben autonom und verlassen sich stark auf CPUs für Datenverarbeitung und Koordination – ergänzt durch GPU-basierte Modellausführung .
Inferenz ist zum dominanten KI-Compute-Einsatzfall geworden. 2026 fließen erstmals rund 60 % der weltweiten KI-Rechenkapazität in Inferenz-Workloads und überholen damit das Training . Dieser Wandel begünstigt CPU-lastige Architekturen, da die Bereitstellung von Modellen in großem Maßstab eine Vielzahl von Host-CPUs, Inferenz-Servern und der umgebenden Infrastruktur erfordert .
AMD sieht den gesamten Hochleistungs- und adaptiven Computermarkt bis 2030 bei 2 Billionen Dollar, gegenüber 365 Milliarden Dollar im Jahr 2025 . Allein der Siliziummarkt für Rechenzentren soll die Billionen-Dollar-Marke überschreiten .
Am 23. Juli 2026 auf der „Advancing AI 2026“ vorgestellt, ist Helios AMDs erstes vollständig integriertes, flüssigkeitsgekühltes Rack-Scale-KI-System. Es kombiniert 72 Instinct MI455X-GPUs, EPYC Venice-CPUs und Pensando-Netzwerktechnik . Helios befindet sich in Serienproduktion, die ersten Partnerlieferungen beginnen Ende des dritten Quartals 2026 (September 2026), der Mengenhochlauf folgt im vierten Quartal .
Das Rack erreicht bis zu 2,9 Exaflops FP4-Inferenz-Durchsatz und 1,4 Exaflops FP8-Trainings-Durchsatz, bei einer Scale-Up-Interconnect-Bandbreite von 260 TB/s . Der Preis für ein voll bestücktes Helios-Rack wird auf rund 5,25 Millionen Dollar geschätzt .
Gefertigt im N2- (2-nm-) Verfahren von TSMC, bietet der Venice-Prozessor bis zu 256 Kerne pro Sockel – realisiert durch 32 Zen-6c-Kerne auf jedem von acht Chiplet-Dies . Der Produktionshochlauf bei TSMC in Taiwan begann im Mai 2026; eine zukünftige Fertigung ist auch im TSMC-Werk in Arizona geplant, jedoch nicht vor 2028 in größerem Umfang .
Venice wird derzeit an Kunden ausgeliefert (Sampling) und kommt sowohl in Helios-Racks als auch in eigenständigen Server-Bereitstellungen ab Ende 2026 und Anfang 2027 zum Einsatz . Die Variante EPYC 9006 SP7, optimiert für die Ausführung dichter KI-Agenten-Umgebungen, soll im vierten Quartal 2026 ausgeliefert werden .
AMD hat von den drei führenden KI-Unternehmen substanzielle Zusagen erhalten, die insgesamt rund 14 Gigawatt Rechenkapazität umfassen :
| Kunde | Umfang | Details |
|---|---|---|
| OpenAI | ~6 GW | Deal aus Oktober 2025. ~10 % von AMD-Aktien als Performance-Warrants. OpenAI plant, Helios ab Q4 2026 in Betrieb zu nehmen . |
| Meta | ~6 GW | Deal aus Februar 2026. Beinhaltet kundenspezifische MI450-Chips und eine gemeinsam über das Open Compute Project entwickelte Helios-Rack-Architektur. Meta validiert noch EPYC-Plattformen und testet Helios . |
| Anthropic | Bis zu 2 GW | Deal aus Juli 2026. AMD tätigt eine strategische Beteiligung in Höhe von bis zu 5 Milliarden Dollar. Die ersten MI450-GPU-Kapazitäten werden in der ersten Jahreshälfte 2027 erwartet . |
Weitere Kunden sind Microsoft (Einsatz von Helios-Racks in Azure-Rechenzentren) und Oracle (Aufbau eines 50.000-GPU-Helios-Superclusters) .
AMDs Software-Stack ROCm hat deutlich aufgeholt, liegt aber in Schlüsselbereichen noch hinter Nvidias CUDA zurück:
Was funktioniert:
Verbleibende Lücken:
Fazit: ROCm ist inzwischen produktionstauglich für Inferenz und preislich wettbewerbsfähig (Berichten zufolge 25–40 % günstiger pro Token als Nvidia bei Inferenz), aber CUDA hat weiterhin einen deutlichen Vorsprung bei Tools, Trainings-Workflows und der Breite der Framework-Unterstützung .
AMDs Q2-2026-Zahlen untermauern den strategischen Kurs eindrucksvoll:
| Kennzahl | Q2 2026 | Veränderung zum Vorjahr |
|---|---|---|
| Gesamtumsatz | 11,5 Mrd. $ | Rekordhoch |
| Rechenzentrumsumsatz | 6,7 Mrd. $ | Mehr als verdoppelt |
| Rechenzentrum am Gesamtumsatz | ~58 % | Von 42 % im Vorjahr |
| Server-CPU-Umsatzwachstum | >70 % | Getrieben durch Inferenz/Agentic AI |
Das Management betonte im Rahmen der Zahlenvorlage, dass „Inferenz und agentische KI den Bedarf an Server-CPU-Rechenleistung erhöhen“ – der strukturelle Treiber hinter der angehobenen TAM . AMD erwartet, dass die KI-Umsätze im Rechenzentrum bis 2027 „zig Milliarden Dollar“ erreichen, wobei allein der Server-CPU-Umsatz 2027 um mehr als 70 % wachsen soll .
Bruttomargen-Entwicklung: Da AMD zunehmend von reinen Chipverkäufen hin zu integrierten Rack-Scale-Systemen wie Helios wechselt, die GPUs, CPUs und Netzwerktechnik in einem Paket bündeln, könnten die gemischten Margen im Vergleich zu reinen Chipverkäufen unter Druck geraten. Der Markt beobachtet genau, ob AMD die Margenexpansion fortsetzen kann, während es sich – ähnlich wie Nvidia – immer mehr zum Systemanbieter wandelt.
TSMC-Lieferkettenkonzentration: AMD ist für seine High-End-Fertigung auf TSMC angewiesen – sowohl für die CPU (N2) als auch die GPU (N3/N4) . Venice wird bei TSMC in Taiwan hochgefahren. Eine Verlagerung in das TSMC-Werk in Arizona ist geplant, aber die Kapazitäten für die neuesten Fertigungsprozesse stehen dort noch nicht zur Verfügung . Geopolitische Spannungen um Taiwan und der Wettbewerb um TSMC-Wafer-Kapazitäten mit Apple, Nvidia und anderen bleiben ein materielles, kurzfristiges Risiko – insbesondere da AMD plant, Helios ab Ende 2026 im Gigawatt-Maßstab auszuliefern.
AMD verfolgt eine klare, ambitionierte Strategie, die auf einen Wendepunkt setzt: den Übergang von KI-Training zu KI-Inferenz, von isolierten Modellen zu autonomen KI-Agenten. Die Hardware-Roadmap (Helios und Venice) befindet sich in der Produktion, die Großkunden stehen mit beispiellosen Zusagen bereit, und die Finanzzahlen spiegeln den Wandel wider. Die entscheidenden offenen Fragen sind, ob ROCm den verbleibenden Rückstand zu CUDA schnell genug aufholen kann und ob Lieferkettenengpässe es AMD ermöglichen, den aggressiven Hochlaufplan einzuhalten.