Frozen v2 je účelový inferenční engine, nikoli univerzální tensorový procesor jako Googlovské Tensor Processing Units (TPU). TPU jsou programovatelné akcelerátory, které podporují širokou škálu AI modelů díky softwarové rekonfiguraci . Frozen v2 je pravý opak: specifická architektura Gemini – její vrstvy, operátory a datové toky – je vypálena do čipu již při výrobě. Je to v podstatě 'Gemini v jediném čipu'.
| Dimenze | Stávající TPU (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Filozofie návrhu | Univerzální AI akcelerátor; programovatelné maticové jednotky, flexibilní datový tok | Pevně daný ASIC; architektura Gemini je vlepena do křemíku, není programovatelná |
| Cílová efektivita | Dobrá pro trénink a inferenci napříč mnoha modely | 6–10× více tokenů na watt než nejnovější TPU při inferenci Gemini |
| Paměťový model | HBM + SRAM pro váhy modelů, které se dynamicky načítají | Váhy modelu a výpočetní cesty jsou přímo v mask ROM / křemíku |
| Flexibilita | Může spouštět jakýkoli model díky softwaru | Jeden model (Gemini) – žádné přepínání modelů za běhu |
Efektivita je hlavním tahákem: inženýři Googlu podle zpráv odhadují, že Frozen v2 by mohl dodávat 6 až 10krát více AI tokenů na jednotku spotřebované energie než nejnovější čipy TPU .
Podle zprávy The Information a navazujících článků je Frozen v2 cílen na nasazení již v roce 2028 . To znamená, že čip je stále roky od výroby a do služby vstoupí až poté, co bude nasazena a odladěna současná osmá generace TPU (Sunfish a Zebrafish).
Startup Taalas ukazuje, co tento kompromis v praxi znamená. V únoru 2026 Taalas představil čip HC1, který celý model Llama 3.1 8B – každý parametr – zakóduje přímo do tranzistorových obvodů pomocí mask ROM, a to bez externí HBM paměti pro ukládání vah .
Čísla jsou ohromující:
Druhá strana mince je stejně dramatická:
Zakladatel Taalas popsal architekturu jako spojení „mask ROM paměti" s SRAM pamětí, které ukládá jak model, tak provádí všechny výpočty KV cache přímo na čipu, čímž zcela eliminuje přesun dat do externí paměti . Frozen v2 bude používat stejný základní přístup.
AI výpočetní kapacita Googlu je tak napjatá, že firma začala přídělový systém i pro platící giganty. Motivace je zřejmá z několika údajů:
Odmítnutí Metě (březen 2026): Google v březnu 2026 sdělil Metě, že jí nemůže dodat veškerou výpočetní kapacitu Gemini, kterou chtěla koupit . Tento výpadek zpozdil některé interní AI projekty Mety a donutil ji nařídit svým inženýrům šetřit AI tokeny .
Objem nevyřízených objednávek: Backlog Google Cloud se téměř zdvojnásobil na 462 miliard dolarů v prvním čtvrtletí 2026, což představuje poptávku zhruba 23krát vyšší, než je jeho dostupná výpočetní kapacita . Generální ředitel Sundar Pichai na hovoru s analytiky potvrdil: „Jsme v nejbližší době omezeni výpočetní kapacitou... naše cloudové tržby by byly vyšší, kdybychom byli schopni uspokojit poptávku“ .
Širší tlak na kapacitu: Google dokonce pronajímá přibližně GPU od SpaceX za 920 milionů dolarů měsíčně, aby překlenul svůj výpočetní deficit . Amin Vahdat, viceprezident cloudu Googlu, v listopadu 2025 řekl, že firma by musela zdvojnásobovat AI kapacitu každých šest měsíců, aby uspokojila poptávku .
Tyto limity přímo motivují Frozen v2: pokud Google získá 6–10× více inferencí Gemini na watt, prakticky znásobí kapacitu bez potřeby nových datových center.
Frozen v2 je jen jedna součást mnohem širší hardwarové strategie:
1. Osmá generace TPU rozdělená na tréninkové a inferenční čipy. Na Cloud Next 2026 Google představil rodinu TPU osmé generace, poprvé rozdělenou na dvě účelové varianty :
2. Dlouhodobá dohoda s Broadcomem do roku 2031. Broadcom v SEC formuláři 8-K zveřejnil dlouhodobou smlouvu na vývoj a dodávku vlastních TPU pro budoucí generace Googlu, plus smlouvu o zajištění dodávek síťových komponent do roku 2031 . Samostatně společnost Anthropic podepsala dohodu na ~3,5 GW kapacity TPU Googlu, která bude k dispozici od roku 2027 .
3. Pronájem TPU zákazníkům včetně OpenAI. Podle zpráv Google stále více nabízí kapacitu TPU jako pronajímatelný produkt externím AI firmám, přičemž OpenAI je jmenována jako zákazník .
4. Projekt „Icefish" s MediaTekem. Kódové označení „Icefish" je spojováno s účastí MediaTeku na vlastním čipovém projektu Googlu nad rámec TPU 8i – možná jde o nízkoenergetický akcelerátor pro edge nebo inferenci .
5. Jednání s Intelem. Google údajně vedl s Intelem rozhovory o vlastních AI čipech, ale žádná formální dohoda nebyla oznámena .
6. Ironwood (sedmá generace TPU) je všeobecně dostupný. Ironwood byl zpřístupněn cloudovým zákazníkům v dubnu 2026 . Je postaven na 3nm procesu s dvoučipletovou architekturou a optimalizován pro MoE modely pohánějící ekosystém Gemini .
Zpráva The Information výslovně uvádí, že Frozen v2 je navržen tak, aby doplňoval, nikoli nahrazoval, plán TPU Googlu . Logika je jednoduchá:
Je to analogické tomu, jak hyperškálovači používají univerzální CPU pro většinu úloh a účelové ASIC pro specifické úlohy s vysokým objemem (např. překódování videa, síťové offloady). Frozen v2 je AI ekvivalent: účelový inferenční engine, který stojí vedle programovatelné flotily TPU.