| Vaste ASIC; Gemini's architectuur zit in silicium, niet herprogrammeerbaar |
| Efficiëntiedoel | Goed voor training en inferentie van vele modellen | 6–10x meer tokens per watt dan nieuwste TPU's op Gemini-inferentie |
| Geheugenmodel | HBM + SRAM voor modelgewichten die dynamisch worden geladen | Modelgewichten en rekenpaden direct in mask-ROM / vaste logica |
| Flexibiliteit | Kan elk model draaien via software-herconfiguratie | Eén model (Gemini) — geen runtime-modelwisseling |
De efficiëntiewinst is het belangrijkste nieuws: Google-ingenieurs schatten dat Frozen v2 6 tot 10 keer meer AI-tokens per eenheid stroomverbruik kan leveren dan de nieuwste TPU-chips .
Volgens The Information en bevestigende berichtgeving is Frozen v2 bedoeld voor uitrol vanaf 2028 . De chip is dus nog jaren van productie verwijderd en komt pas in dienst nadat de huidige achtste generatie TPU's (Sunfish en Zebrafish) is uitgerold en volwassen is geworden.
De startup Taalas laat precies zien wat deze afweging in de praktijk betekent. In februari 2026 onthulde Taalas de HC1-chip, die het volledige Llama 3.1 8B-model — elke parameter — rechtstreeks in de transistorcircuits van de chip codeert via mask-ROM, zonder externe HBM voor gewichtsopslag .
De cijfers zijn indrukwekkend:
Het nadeel is even dramatisch:
Taalas' oprichter beschreef de architectuur als een combinatie van een 'mask-ROM recall fabric' met een SRAM recall fabric om zowel het model als alle KV-cache-berekeningen op de chip op te slaan, waardoor extern geheugenverkeer volledig wordt geëlimineerd . Dit is dezelfde fundamentele aanpak die Frozen v2 zal gebruiken.
Google's AI-rekenkracht staat zo onder druk dat het bedrijf zelfs de toegang voor betalende giganten als Meta moet rantsoeneren. Verschillende markeringen maken de motivatie duidelijk:
De Meta-capaciteitsweigering (maart 2026): Google vertelde Meta in maart 2026 dat het niet alle Gemini-rekenkracht kon leveren die Meta wilde kopen . Het tekort vertraagde enkele interne AI-projecten van Meta en dwong Meta zijn ingenieurs opdracht te geven AI-tokens te besparen
.
Backlogcijfers: De orderbacklog van Google Cloud verdubbelde bijna tot 462 miljard dollar in Q1 2026, een vraag die ongeveer 23 keer de beschikbare verwerkingscapaciteit vertegenwoordigt . CEO Sundar Pichai bevestigde tijdens de earnings call: "We zitten op korte termijn krap in rekenkracht... onze cloudomzet zou hoger zijn geweest als we aan die vraag hadden kunnen voldoen"
.
Algemene capaciteitskrapte: Google huurt zelfs voor ongeveer 920 miljoen dollar per maand aan Nvidia GPU's van SpaceX om het gat te dichten . Amin Vahdat, Google's cloud VP, zei in november 2025 dat het bedrijf de AI-capaciteit elke zes maanden zou moeten verdubbelen om aan de vraag te voldoen
.
Deze beperkingen motiveren Frozen v2 direct: als Google 6–10x meer Gemini-inferentie per watt kan krijgen, vermenigvuldigt het de effectieve capaciteit zonder dat er nieuwe datacenters nodig zijn.
Frozen v2 is een onderdeel van een veel bredere hardwarestrategie:
1. Achtste generatie TPU's opgesplitst in training en inferentie. Op Cloud Next 2026 toonde Google de achtste generatie TPU-familie, voor het eerst opgesplitst in twee doelgerichte varianten :
2. Broadcom-langetermijnovereenkomst tot 2031. Broadcom diende een SEC 8-K in waarin een langetermijnovereenkomst voor de ontwikkeling en levering van aangepaste TPU's voor toekomstige generaties van Google werd openbaar gemaakt, plus een Supply Assurance Agreement voor netwerkcomponenten tot 2031 . Daarnaast tekende Anthropic een deal voor ongeveer 3,5 GW aan Google TPU-capaciteit, die vanaf 2027 online komt
.
3. TPU-verhuur aan klanten, waaronder OpenAI. Berichten geven aan dat Google steeds vaker TPU-capaciteit als huurproduct aan externe AI-bedrijven aanbiedt, waarbij OpenAI als klant wordt genoemd .
4. 'Icefish'-project met MediaTek. De codenaam 'Icefish' lijkt te verwijzen naar MediaTek's betrokkenheid bij een Google-specifiek aangepast chipproject naast TPU 8i — mogelijk een energiezuinige edge- of inferentieversneller .
5. Gesprekken met Intel. Google heeft naar verluidt gesprekken gevoerd met Intel over aangepaste AI-chipontwerpen, hoewel er geen formele overeenkomst is aangekondigd .
6. Ironwood (zevende generatie TPU) algemeen beschikbaar. Ironwood werd in april 2026 algemeen beschikbaar gesteld aan cloudklanten . Gebouwd op een 3nm-procedé met een dual-chiplet-architectuur, was het geoptimaliseerd voor MoE-modellen die het Gemini-ecosysteem aandrijven
.
Het rapport van The Information stelt expliciet dat Frozen v2 is ontworpen om de TPU-roadmap aan te vullen, niet te vervangen . De logica is eenvoudig:
Dit is analoog aan hoe hyperscalers zowel algemene CPU's voor de meeste workloads als vaste ASIC's voor specifieke high-volume taken (zoals videotranscodering, netwerk-offload) gebruiken. Frozen v2 is het AI-equivalent: een doelgerichte inferentie-engine naast de programmeerbare TPU-vloot.