Je však důležité zasadit zprávu do širšího kontextu. Broadcom zůstává dlouhodobým partnerem Googlu při spoluvývoji TPU; v březnu 2026 byla zveřejněna pětiletá dohoda pokrývající generace v8 až v11 . U současné generace Ironwood, označované jako TPU v7x, zajišťuje MediaTek například I/O a koordinaci výroby s TSMC
.
Zapojení AMD proto nemusí znamenat nahrazení Broadcomu. Může jít o konkrétní variantu TPU v10, experimentální konstrukci nebo způsob, jak rozšířit dodavatelský řetězec. Zprávy zároveň hovoří o tom, že Google zvažuje Samsung Foundry pro výrobu některých částí TPU v10, aby snížil závislost na TSMC . Samostatně se také objevily informace o pozdních jednáních s Marvellem ohledně dalších zakázkových AI čipů
.
Zásadní výhrada: Google ani AMD spolupráci nepotvrdily. Jde o tržní spekulace, nikoli o oficiální oznámení. Není proto jasné, jak velká by role AMD případně byla .
Klasické dávkové inference je typicky zaměřené na GPU. Do systému vstoupí dotaz, GPU provede průchod modelem a na výstupu se objeví odpověď .
Agentní AI funguje jinak. Agent si může rozdělit úkol na několik kroků, plánovat další postup, volat API, prohledávat web, pracovat s databází, spouštět kód nebo čekat na výsledek z externího nástroje. Tyto činnosti vyžadují plánování, větvení, komunikaci a zpracování dat — tedy úlohy, ve kterých hraje hlavní roli CPU .
Akademická studie zjistila, že u agentních úloh založených na používání nástrojů může zpracování nástrojů na CPU představovat až 88 procent celkové latence . Jiná analýza uvádí hodnotu až 90,6 procenta
. Neznamená to, že GPU přestává být důležité. Znamená to ale, že rychlost samotného generování tokenů už nemusí určovat rychlost celého systému.
V trénovacích clusterech bývá poměr přibližně jeden CPU na sedm až osm GPU. U inference se podle dostupných údajů posouvá zhruba k poměru 1:3 nebo 1:4 . U agentních nasazení se může dostat až k poměru 1:1; Intel uvedl, že někteří zákazníci už provozují čtyři CPU na jedno GPU
.
Tento posun má i výrazný ekonomický rozměr. Morgan Stanley odhaduje, že změna skladby AI infrastruktury může do roku 2030 vytvořit dodatečnou poptávku po CPU v hodnotě 32,5 až 60 miliard dolarů . AMD podobně popisuje agentní AI jako heterogenní pracovní postup, nikoli jako jedinou úlohu založenou na GPU. Orchestrace, plánování, volání nástrojů a sandboxové prostředí vyžadují vysokou hustotu jader a velké množství vláken
.
Učení posilováním, zejména při trénování agentních modelů, probíhá v opakovaných smyčkách. Model provede akci, sandbox nebo simulované prostředí vyhodnotí její výsledek, systém vypočítá odměnu a následně upraví strategii modelu.
V každém takovém cyklu se střídá výpočet na akcelerátoru s řízením prostředí, kontrolou podmínek a vyhodnocováním výsledků na CPU. Čistě maticový akcelerátor proto nemusí být ideální, pokud musí kvůli každému kroku komunikovat s odděleným procesorem přes pomalejší rozhraní.
Na podobný typ zátěže se podle oborových analýz zaměřují také procesory Nvidia Vera s 88jádrovým návrhem Olympus a Intel Xeon 6+, které mají podporovat rychlou orchestrace a těsně propojené sandboxové smyčky pro reinforcement learning .
Pokud by Google skutečně umístil CPU jádra přímo do pouzdra TPU, mohl by zkrátit cestu mezi obecnými výpočty a akcelerovaným inference. To by mohlo snížit latenci při opakovaném cyklu „volání nástroje → krok v prostředí → aktualizace strategie“.
Nešlo by jen o úsporu času při přenosu dat. Hybridní konstrukce by umožnila přizpůsobit jednotlivé části čipu různým fázím úlohy: TPU by se starala o výpočty modelu, zatímco CPU by řešilo rozhodovací logiku, plánování, práci s prostředím a další úlohy s větvením.
Takový návrh by představoval přechod od čistě maticového akcelerátoru k heterogennímu systému v jednom pouzdře. Budoucí AI čipy by se tak nemusely poměřovat pouze počtem operací za sekundu, ale také tím, jak rychle zvládnou celý pracovní postup.
| Oblast | Co se může změnit |
|---|---|
| Architektura | AI ASICy se mohou posunout od čistých maticových akcelerátorů k hybridním čipletům kombinujícím CPU a akcelerátor. |
| Typ zátěže | Agentní AI a reinforcement learning mají více větvení, volání nástrojů a orchestrace než klasické husté trénování. Potřebují proto CPU jádra, nejen více výkonu v maticových operacích. |
| Dodavatelský řetězec | Google rozšiřuje okruh partnerů kolem vlastního křemíku — od Broadcomu a MediaTeku přes Marvell až po potenciální spolupráci s AMD. |
| Tržní soutěž | AMD by získalo významný vstup do zakázkových AI ASICů. Nvidia by čelila tlaku nejen ze strany konkurenčních GPU, ale i ze strany hybridních akcelerátorů. |
Zpráva o TPU v10 s CPU jádry zatím není potvrzeným produktem. Přesto dobře ilustruje, kam se může AI infrastruktura ubírat. S tím, jak modely přestávají pouze odpovídat na jednotlivé dotazy a začínají samostatně plánovat a jednat, roste význam procesorů, paměti, propojení i samotné orchestrace.
Čip optimalizovaný pro jeden obrovský násobící výpočet nemusí být stejný jako čip, který musí tisíckrát za sekundu zpracovat volání nástroje, krok v simulaci a aktualizaci strategie. Pokud se spekulace SemiAnalysis potvrdí, Google a AMD možná právě takový hybridní návrh připravují.