Frozen v2 är en applikationsspecifik slutledningsmotor, inte en programmerbar tensorprocessor som Googles Tensor Processing Units (TPU:er). TPU:er programmerbara acceleratorer som via programvara kan stödja en bredd av AI-modeller . Frozen v2 är raka motsatsen: Geminis specifika arkitektur – dess lager, operatorer och dataflöde – bränns in i chippet vid tillverkningstillfället, vilket gör det till en engångs-"Gemini-i-ett-chip".
| Dimension | Befintliga TPU:er (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Designfilosofi | Generell AI-accelerator; programmerbara matrisenheter, flexibelt dataflöde | Dedikerad ASIC; Geminis arkitektur är inbäddad i kisel, inte omprogrammerbar i fält |
| Effektivitetsmål | Bra för träning och slutledning för många modeller | 6–10 gånger fler tokens per watt än Googles senaste TPU:er för Gemini-slutledning |
| Minnesmodell | HBM + SRAM för modellvikter som laddas dynamiskt | Modellvikter och beräkningsvägar inbäddade direkt i mask-ROM / hårdkopplad logik |
| Flexibilitet | Kan köra vilken modell som helst via omkonfigurering i programvara | En modell (Gemini) – inget byte av modell under körning |
Effektivitetsökningen är rubriken: Googles ingenjörer uppger att Frozen v2 skulle kunna leverera 6 till 10 gånger fler AI-tokens per enhet strömförbrukning än de senaste TPU-chippen .
Enligt The Information-rapporten och bekräftande täckning är Frozen v2 planerad för driftsättning tidigast 2028 . Detta innebär att chippet fortfarande är flera år från produktion och endast kommer att tas i bruk efter att den nuvarande åttonde generationens TPU-familj (Sunfish och Zebrafish) har driftsatts och mognat.
Startupen Taalas visar exakt vad denna avvägning innebär i praktiken. I februari 2026 presenterade Taalas sitt HC1-chip, som kodar hela Llama 3.1 8B-modellen – varje parameter – direkt i chippets transistorkretsar med hjälp av mask-ROM, utan externt HBM för viktlagring .
Siffrorna är fantastiska:
Nackdelen är lika dramatisk:
Taalas grundare beskrev arkitekturen som att man parar ihop en "mask-ROM-återkallelseväv" med en SRAM-återkallelseväv för att lagra både modellen och beräkna all KV-cache-aktioner på chippet, vilket helt eliminerar extern minnesförflyttning . Detta är samma grundläggande tillvägagångssätt som Frozen v2 skulle använda.
Googles AI-beräkningskapacitet är så ansträngd att företaget har börjat ransonera åtkomst även till betalande jättar. Flera datapunkter gör motivet tydligt:
Metas kapacitetsnek (mars 2026): Google meddelade Meta i mars 2026 att man inte kunde leverera all Gemini-beräkningskapacitet Meta ville köpa . Bristen försenade några av Metas interna AI-projekt och tvingade Meta att instruera sina ingenjörer att spara på AI-tokens .
Backlogsiffror: Googles molnorderstock nästan fördubblades till 462 miljarder dollar under första kvartalet 2026, vilket representerar efterfrågan som är ungefär 23 gånger den tillgängliga processorkapaciteten . Vd Sundar Pichai bekräftade på resultatkonferensen: "Vi är beräkningsbegränsade på kort sikt... våra molnintäkter skulle ha varit högre om vi hade kunnat möta den efterfrågan" .
Den bredare kapacitetsbristen: Google hyr till och med cirka 920 miljoner dollar per månad i Nvidia-GPU:er från SpaceX för att överbrygga sitt beräkningsgap . Googles moln-VP Amin Vahdat sa i november 2025 att företaget skulle behöva fördubbla AI-kapaciteten var sjätte månad för att möta efterfrågan .
Dessa begränsningar motiverar direkt Frozen v2: om Google kan få 6–10 gånger mer Gemini-slutledning per watt, multiplicerar det effektivt kapaciteten utan att behöva nya datacenter.
Frozen v2 är en del av en mycket bredare hårdvarustrategi:
1. Åttonde generationens TPU:er delas upp i tränings- och slutledningschip. På Cloud Next 2026 förhandsvisade Google den åttonde generationens TPU-familj, som för första gången delas upp i två specialiserade varianter :
2. Långsiktigt avtal med Broadcom till 2031. Broadcom lämnade in en SEC 8-K som avslöjar ett långsiktigt avtal om att utveckla och leverera anpassade TPU:er för Googles framtida generationer, plus ett leveranssäkerhetsavtal för nätverkskomponenter till 2031 . Separat skrev Anthropic ett avtal om cirka 3,5 GW av Googles TPU-kapacitet, som tas i drift från 2027 och framåt .
3. TPU-uthyrning till kunder inklusive OpenAI. Rapporter indikerar att Google i allt högre grad erbjuder TPU-kapacitet som en uthyrningsprodukt till externa AI-företag, med OpenAI nämnd som kund .
4. "Icefish"-projektet med MediaTek. Kodnamnet "Icefish" verkar vara kopplat till MediaTeks engagemang i ett Google-specifikt anpassat chipprojekt bortom TPU 8i – möjligen en lägreffekts edge- eller slutledningsaccelerator .
5. Diskussioner med Intel. Google har enligt uppgift haft diskussioner med Intel om anpassade AI-chipdesigner, men inget formellt avtal har tillkännages .
6. Ironwood (sjunde generationens TPU) allmänt tillgänglig. Ironwood gjordes allmänt tillgänglig för molnkunder i april 2026 . Byggd på en 3nm-process med en dual-chiplet-arkitektur, var den optimerad för MoE-modeller som driver Gemini-ekosystemet .
The Information-rapporten anger uttryckligen att Frozen v2 är utformad för att komplettera, inte ersätta, Googles TPU-roadmap . Logiken är enkel:
Detta är analogt med hur hyperscalers använder både generella CPU:er för de flesta arbetsbelastningar och dedikerade ASIC:ar för specifika högvolymsuppgifter (t.ex. videotranskodning, nätverksavlastning). Frozen v2 är AI-motsvarigheten: en specialbyggd slutledningsmotor som sitter bredvid den programmerbara TPU-flottan.