Frozen v2 er en applikasjonsspesifikk slutningsmotor, ikke en generell tensorprosessor som Googles Tensor Processing Units (TPUer). TPUer er programmerbare akseleratorer som støtter et bredt spekter av KI-modeller via programvareomkonfigurasjon . Frozen v2 er det motsatte: Geminis spesifikke arkitektur – lag, operasjoner og dataflyt – brennes inn i brikken under produksjon, noe som gjør den til en formålsbygget "Gemini-i-en-brikke".
| Dimensjon | Eksisterende TPUer (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Designfilosofi | Generell KI-akselerator; programmerbare matriseenheter, fleksibel dataflyt | Fastfunksjons ASIC; Geminis arkitektur er innebygd i silisium, ikke feltprogrammerbar |
| Effektivitetsmål | God for trening og slutning på tvers av mange modeller | 6–10x flere tokens per watt enn Googles nyeste TPUer på Gemini-slutning |
| Minnemodell | HBM + SRAM for modellvekter som lastes dynamisk | Modellvekter og databaner innebygd direkte i mask-ROM / fastkoblet logikk |
| Fleksibilitet | Kan kjøre hvilken som helst modell via programvareomkonfigurasjon | Én modell (Gemini) – ingen modellbytte under kjøring |
Effektivitetsgevinsten er overskriften: Google-ingeniører anslår at Frozen v2 kan levere 6 til 10 ganger flere KI-tokens per strømenhet enn de nyeste TPU-brikkene .
Ifølge The Information-rapporten og bekreftende dekning er Frozen v2 planlagt utrullet tidligst i 2028 . Dette betyr at brikken fortsatt er år unna produksjon og først vil tas i bruk etter at den nåværende åttende generasjonen TPUer (Sunfish og Zebrafish) er utplassert og modnet.
Oppstartsselskapet Taalas viser nøyaktig hva denne avveiningen betyr i praksis. I februar 2026 avduket Taalas HC1-brikken, som koder hele Llama 3.1 8B-modellen – hver eneste parameter – direkte inn i brikkens transistorkretser ved hjelp av mask-ROM, uten ekstern HBM for vektlagring .
Tallene er svimlende:
Ulempen er like dramatisk:
Taalas' grunnlegger beskrev arkitekturen som å kombinere et "mask-ROM-gjenkallingsstoff" med et SRAM-gjenkallingsstoff for å lagre både modellen og beregne alle KV-cache-operasjoner på brikken, og dermed eliminere ekstern minnebevegelse fullstendig . Dette er den samme grunnleggende tilnærmingen Frozen v2 vil bruke.
Googles KI-beregningskapasitet er så anstrengt at selskapet har begynt å rasjonere tilgangen selv for betalende giganter. Flere datapunkter gjør motivasjonen klar:
Meta-kapasitetsnektelsen (mars 2026): Google fortalte Meta i mars 2026 at de ikke kunne levere all Gemini-beregningskapasiteten Meta ønsket å kjøpe . Mangelen forsinket noen av Metas interne KI-prosjekter og tvang Meta til å instruere ingeniørene sine om å spare på KI-tokens .
Ordrebestallstall: Googles Cloud-ordrebok nesten doblet seg til 462 milliarder dollar i Q1 2026, noe som representerer en etterspørsel omtrent 23 ganger den tilgjengelige prosesseringskapasiteten . Adm.dir. Sundar Pichai bekreftet på resultatpresentasjonen: "Vi er beregningsbegrenset på kort sikt... cloud-inntektene våre ville vært høyere hvis vi kunne møtt den etterspørselen" .
Bredere kapasitetsklemme: Google leier til og med omtrent 920 millioner dollar per måned i Nvidia GPUer fra SpaceX for å bygge bro over beregningsgapet . Googles sky-VP Amin Vahdat sa i november 2025 at selskapet måtte doble KI-kapasiteten hver sjette måned for å møte etterspørselen .
Disse begrensningene motiverer direkte Frozen v2: hvis Google kan få 6–10 ganger mer Gemini-slutning per watt, multipliserer de effektivt kapasiteten uten å trenge nye datasentre.
Frozen v2 er én del av en mye bredere maskinvarestrategi:
1. Åttende generasjons TPUer delt inn i trenings- og slutningsbrikker. På Cloud Next 2026 forhåndsviste Google den åttende generasjonen TPU-familie, for første gang delt inn i to formålsbyggede varianter :
2. Broadcom-langsiktig avtale frem til 2031. Broadcom sendte inn et SEC 8-K-skjema som avslører en Langsiktig Avtale om å utvikle og levere tilpassede TPUer for Googles fremtidige generasjoner, pluss en Forsyningssikringsavtale for nettverkskomponenter frem til 2031 . Separat signerte Anthropic en avtale for omtrent 3,5 GW Google TPU-kapasitet, som kommer online fra 2027 og utover .
3. TPU-utleie til kunder inkludert OpenAI. Rapporter indikerer at Google i økende grad tilbyr TPU-kapasitet som et utleieprodukt til eksterne KI-selskaper, med OpenAI nevnt som kunde .
4. "Icefish"-prosjekt med MediaTek. Kodenavnet "Icefish" ser ut til å være knyttet til MediaTeks engasjement i et Google-spesifikt tilpasset brikkeprosjekt utover TPU 8i – muligens en lavereffekts kant- eller slutningsakselerator .
5. Diskusjoner med Intel. Google skal ha holdt diskusjoner med Intel om tilpassede KI-brikkedesign, selv om ingen formell avtale er kunngjort .
6. Ironwood (syvende generasjons TPU) generelt tilgjengelig. Ironwood ble gjort generelt tilgjengelig for skykunder i april 2026 . Bygget på en 3nm-prosess med en dobbel-brikkearkitektur, ble den optimalisert for MoE-modeller som driver Gemini-økosystemet .
The Information sin rapport sier eksplisitt at Frozen v2 er designet for å komplementere, ikke erstatte, Googles TPU-veikart . Logikken er grei:
Dette er analogt med hvordan hyperskalabedrifter bruker både generelle CPUer for de fleste arbeidsmengder og fastfunksjons-ASICer for spesifikke høyvolumoppgaver (f.eks. videotranskoding, nettverksavlastning). Frozen v2 er KI-ekvivalenten: en formålsbygget slutningsmotor som sitter sammen med den programmerbare TPU-flåten.