Det er dog vigtigt ikke at læse rygtet som et farvel til Broadcom. Broadcom har fortsat et flerårigt samarbejde med Google om TPU-generationerne v8 til v11, indgået i marts 2026 . MediaTek står samtidig for I/O og koordinering af produktionen af den aktuelle Ironwood-generation
. AMD's mulige involvering ser derfor snarere ud til at være et projekt inden for v10-generationen end en fuld udskiftning af Broadcom. Broadcoms CoWoS-produktion til Ironwood er dog ifølge rapporter blevet nedjusteret med omkring 32.000 wafere
.
Google overvejer desuden angiveligt Samsung Foundry som produktionspartner for dele af TPU v10 for at sprede produktionen ud over TSMC . Selskabet har også været i fremskredne forhandlinger med Marvell om andre specialudviklede AI-chips
.
Forbeholdet er centralt: Der er ikke tale om en officiel annoncering. SemiAnalysis' oplysninger beskrives som markedsrygter, og AMD's rolle kan være begrænset til en bestemt variant, et eksperimentelt design eller en måde for Google at sprede sin leverandørrisiko på .
Forklaringen findes i den måde, AI-systemer er ved at ændre sig på. Klassisk inferens – hvor en model modtager en forespørgsel og genererer et svar – er i høj grad GPU-bundet. GPU'en udfører den tunge forward pass, hvorefter modellen leverer tokens.
AI-agenter arbejder anderledes. De skal ofte planlægge flere trin, kalde eksterne værktøjer, hente data fra API'er, køre kode i et sandkassemiljø og vurdere resultaterne, før de fortsætter. Den slags koordinering foregår primært på CPU'en .
En akademisk undersøgelse fandt, at værktøjsdominerede agentiske AI-arbejdsbelastninger kan være markant begrænset af CPU-behandlingen af værktøjskald, som stod for op til 88 procent af den samlede latenstid . En separat analyse anslog andelen til helt op til 90,6 procent
.
Det betyder ikke, at GPU'en er blevet overflødig. Den er stadig afgørende for selve modelberegningen. Men i et agentforløb kan GPU'en ende med at vente, mens CPU'en sender forespørgsler, fortolker svar og styrer næste skridt.
I træningsklynger har forholdet traditionelt ligget omkring én CPU for hver syv-otte GPU'er . Når infrastrukturen bruges til inferens, nærmer forholdet sig ifølge analyser én CPU for hver tre-fire GPU'er
. Intel oplyste i forbindelse med selskabets regnskab for første kvartal 2026, at nogle kunder allerede bruger fire CPU'er per GPU i agentiske installationer – svarende til et forhold på 1:1 i visse klynger
.
Morgan Stanley forventer, at denne udvikling kan udløse 32,5-60 milliarder dollar i ekstra vækst på CPU-markedet frem mod 2030 . AMD har selv fremhævet, at agentisk AI ikke er én samlet, GPU-centreret inferensopgave. Det er en heterogen arbejdsgang, hvor orkestrering, planlægning, værktøjskald og sandkassekørsel kræver mange CPU-kerner og høj trådparallelitet
.
Reinforcement learning – forstærkende læring – bygger på gentagne feedbacksløjfer. En model udfører en handling, miljøet simulerer konsekvensen, systemet beregner en belønning, og modellen opdateres.
Når denne proces bruges til agentiske modeller, skal CPU'en koordinere et stort antal sandkassekørsler, miljøsimuleringer, belønningsberegninger og politikopdateringer. Det passer dårligt til en ren matrix-accelerator, der primært er optimeret til tætte, ensartede beregninger.
Nvidias Vera-platform med et 88-kernet Olympus-design og Intels Xeon 6+ bliver begge beskrevet som løsninger, der er optimeret til tætte reinforcement-learning-sandkasseløkker . Branchen bevæger sig dermed i retning af en fælles erkendelse: Den næste generation af AI-acceleratorer bliver sandsynligvis ikke rene matrixmaskiner.
Hvis Google faktisk placerer AMD CPU-kerner direkte på TPU-pakken, kan det mindske behovet for, at data hele tiden skal over en separat PCIe-forbindelse mellem CPU og accelerator. Det kan reducere latenstiden i CPU-tunge agentforløb og samle sekvensen
værktøjskald → miljøtrin → opdatering af politik
på en tættere integreret platform.
Det er et eksempel på en bredere hardwaretrend: AI-systemer kan blive bygget som heterogene systemer på én pakke, hvor forskellige beregningstyper bruges på forskellige trin i arbejdsbelastningen. GPU'en håndterer den tunge modelinferens, mens CPU-kernerne tager sig af logik, koordinering, I/O og miljøinteraktion.
| Område | Hvad det kan betyde |
|---|---|
| Arkitektur | AI-ASIC'er bevæger sig fra rene matrix-acceleratorer mod hybride chiplets med CPU- og acceleratorfunktioner. |
| Arbejdsbelastninger | Agentisk AI og reinforcement learning har et andet beregningsmønster end tæt modeltræning: mere forgrening, flere værktøjskald og mere koordinering. |
| Forsyningskæde | Google spreder tilsyneladende sine TPU-samarbejder på Broadcom, MediaTek, Marvell og muligvis AMD for at få adgang til specialiseret teknologi og mindske afhængigheden af én leverandør. |
| Konkurrence | Et TPU-samarbejde vil give AMD en mulig indgang til specialudviklede AI-ASIC'er. Samtidig kan Nvidia møde arkitektonisk pres fra både GPU-konkurrenter og hybride ASIC-designs. |
Det mest interessante ved det mulige Google-AMD-samarbejde er ikke kun, hvem der leverer hvilke dele af chippen. Det er signalet om, at AI-infrastrukturens flaskehals er ved at flytte sig.
En traditionel AI-chip er bygget til at udføre enorme mængder ensartet matematik. En AI-agent skal derimod hele tiden skifte mellem at ræsonnere, kalde værktøjer, vente på svar, fortolke data og vælge næste handling. Reinforcement learning føjer endnu flere miljø- og feedbacksløjfer til.
Hvis SemiAnalysis' markedsrygter er korrekte, forsøger Google og AMD derfor ikke blot at gøre en TPU hurtigere. De forsøger at tilpasse selve chipdesignet til en AI-verden, hvor CPU'en igen spiller en langt større rolle.