Frozen v2 er en specialbygget inferenmotor, ikke en generel tensorprocessor som Googles Tensor Processing Units (TPU'er). TPU'er er programmerbare acceleratorer, der via software kan understøtte et væld af AI-modeller . Frozen v2 er det modsatte: Geminis specifikke arkitektur - dens lag, operatorer og dataflow - brændes fast i chippen under fabrikationen. Det er en ren "Gemini-i-en-chip".
| Dimension | Eksisterende TPU'er (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Designfilosofi | General-purpose AI-accelerator; programmerbare matrixenheder, fleksibelt dataflow | Dedikeret ASIC; Geminis arkitektur er indlejret i silicium og kan ikke ændres efter fabrikation |
| Effektivitetsmål | God til både træning og inferens på tværs af mange modeller | 6-10x flere tokens per watt end Googles nyeste TPU'er på Gemini-inferens |
| Hukommelsesmodel | HBM + SRAM til modelvægte, der indlæses dynamisk | Modelvægte og beregningsstier indlejret direkte i mask-ROM / hardwired logik |
| Fleksibilitet | Kan køre enhver model via software | Én model (Gemini) - ingen mulighed for at skifte model under kørsel |
Effektivitetgevinsten er overskriften: Googles ingeniører forventer, at Frozen v2 kan levere 6 til 10 gange flere AI-tokens per forbrugt energienhed end de nyeste TPU-chips .
Ifølge The Information og bekræftende dækning er Frozen v2 planlagt til udrulning tidligst i 2028 . Det betyder, at chippen stadig er år fra produktion og først vil blive taget i brug, efter at den nuværende ottende generation af TPU-familien (Sunfish og Zebrafish) er blevet implementeret og modnet.
Startup-virksomheden Taalas viser præcis, hvad dette kompromis betyder i praksis. I februar 2026 afslørede Taalas deres HC1-chip, som koder hele Llama 3.1 8B-modellen - hver eneste parameter - direkte ind i chippens transistorkredsløb ved hjælp af mask-ROM, uden ekstern HBM til vægtlagring .
Tallene er svimlende:
Bagsiden er lige så dramatisk:
Taalas' grundlægger beskrev arkitekturen som en parring af et "mask-ROM recall fabric" med et "SRAM recall fabric" til at lagre både modellen og udføre alle KV-cache-beregninger på chippen, hvilket fuldstændig eliminerer ekstern hukommelsesflytning . Det er den samme grundlæggende tilgang, Frozen v2 vil anvende.
Googles AI-beregningskapacitet er så presset, at virksomheden er begyndt at rationalisere adgangen selv for betalende giganter. Flere datapunkter illustrerer motivationen tydeligt:
Meta-afvisningen (marts 2026): Google informerede Meta i marts 2026 om, at de ikke kunne levere al den Gemini-beregningskapacitet, Meta ønskede at købe . Denne begrænsning forsinkede flere af Metas interne AI-projekter og tvang Meta til at bede sine ingeniører om at spare på AI-tokens .
Ordrebogs-tal: Googles Cloud-ordrebog næsten fordobledes til 462 milliarder dollars i første kvartal af 2026, hvilket svarer til en efterspørgsel på cirka 23 gange den tilgængelige processorkapacitet . CEO Sundar Pichai bekræftede på et indtjeningskald: "Vi er beregningsmæssigt begrænsede på kort sigt... vores cloud-indtægter ville have været højere, hvis vi havde kunnet imødekomme den efterspørgsel" .
Bredere kapacitetspres: Google lejer endda Nvidia GPU'er for cirka 920 millioner dollars om måneden fra SpaceX for at bygge bro over sit eget beregningsmæssige gab . Googles cloud-VP Amin Vahdat sagde i november 2025, at virksomheden ville være nødt til at fordoble AI-kapaciteten hver sjette måned for at følge med efterspørgslen .
Disse begrænsninger motiverer direkte Frozen v2: Hvis Google kan få 6-10 gange mere Gemini-inferens per watt, kan det effektivt mangedoble kapaciteten uden at skulle bygge nye datacentre.
Frozen v2 er en del af en langt bredere hardwarestrategi:
1. Ottende generation af TPU'er opdelt i trænings- og inferenschips. På Cloud Next 2026 præsenterede Google den ottende generation af TPU-familien, for første gang opdelt i to specialbyggede varianter :
2. Broadcom langtidsaftale frem til 2031. Broadcom indgav en SEC 8-K, der afslørede en langsigtet aftale om at udvikle og levere specialfremstillede TPU'er til Googles fremtidige generationer, plus en forsyningssikringsaftale for netværkskomponenter frem til 2031 . Separat underskrev Anthropic en aftale om cirka 3,5 GW Google TPU-kapacitet, der kommer online fra 2027 og frem .
3. TPU-udlejning til kunder, herunder OpenAI. Rapporter indikerer, at Google i stigende grad tilbyder TPU-kapacitet som et lejeprodukt til eksterne AI-virksomheder, og OpenAI nævnes som kunde .
4. "Icefish"-projekt med MediaTek. Kodenavnet "Icefish" synes knyttet til MediaTeks involvering i et Google-specifikt specialchip-projekt ud over TPU 8i - muligvis en lavereffekts edge- eller inferensaccelerator .
5. Drøftelser med Intel. Google skal have holdt drøftelser med Intel om specialfremstillede AI-chipdesigns, dog uden at nogen formel aftale er blevet annonceret .
6. Ironwood (syvende generation TPU) generelt tilgængelig. Ironwood blev gjort generelt tilgængelig for cloud-kunder i april 2026 . Bygget på en 3nm-proces med en dual-chiplet-arkitektur, var den optimeret til MoE-modeller, der driver Gemini-økosystemet .
The Informations artikel understreger, at Frozen v2 er designet til at supplere, ikke erstatte, Googles TPU-køreplan . Logikken er ligetil:
Dette svarer til, hvordan hyperscalere bruger både generelle CPU'er til de fleste arbejdsbyrder og dedikerede ASIC'er til specifikke højvolumenopgaver (f.eks. videotranskodning, netværksaflastning). Frozen v2 er AI-ækvivalenten: en specialbygget inferenmotor, der sidder side om side med den programmerbare TPU-flåde.