Google utvecklar 'Frozen v2', ett serverchip som i form av en ASIC hårdkodar arkitekturen för AI modellen Gemini direkt i kislet för att uppnå 6–10 gånger fler tokens per watt jämfört med de senaste TPU:erna – men det... Projektet drivs av en svår AI beräkningsbrist som tvingade Google att begränsa kapaciteten även...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google tar ett av sina största hårdvarusatsningar hittills. Företaget utvecklar ett serverchip, internt med kodnamnet 'Frozen v2', som hårdkodar arkitektoniska delar av sin Gemini-AI-modell direkt i kislet som en dedikerad ASIC (Application-Specific Integrated Circuit). Enligt en första rapport från The Information den 20 juli 2026 syftar projektet till att dramatiskt förbättra tokens-per-watt-effektiviteten för att betjäna Gemini – till priset av att aldrig kunna köra en annan modell .
Frozen v2 är en applikationsspecifik slutledningsmotor, inte en programmerbar tensorprocessor som Googles Tensor Processing Units (TPU:er). TPU:er programmerbara acceleratorer som via programvara kan stödja en bredd av AI-modeller . Frozen v2 är raka motsatsen: Geminis specifika arkitektur – dess lager, operatorer och dataflöde – bränns in i chippet vid tillverkningstillfället, vilket gör det till en engångs-"Gemini-i-ett-chip".
Effektivitetsökningen är rubriken: Googles ingenjörer uppger att Frozen v2 skulle kunna leverera 6 till 10 gånger fler AI-tokens per enhet strömförbrukning än de senaste TPU-chippen .
Enligt The Information-rapporten och bekräftande täckning är Frozen v2 planerad för driftsättning tidigast 2028 . Detta innebär att chippet fortfarande är flera år från produktion och endast kommer att tas i bruk efter att den nuvarande åttonde generationens TPU-familj (Sunfish och Zebrafish) har driftsatts och mognat.
Startupen Taalas visar exakt vad denna avvägning innebär i praktiken. I februari 2026 presenterade Taalas sitt HC1-chip, som kodar hela Llama 3.1 8B-modellen – varje parameter – direkt i chippets transistorkretsar med hjälp av mask-ROM, utan externt HBM för viktlagring .
Siffrorna är fantastiska:
Nackdelen är lika dramatisk:
Taalas grundare beskrev arkitekturen som att man parar ihop en "mask-ROM-återkallelseväv" med en SRAM-återkallelseväv för att lagra både modellen och beräkna all KV-cache-aktioner på chippet, vilket helt eliminerar extern minnesförflyttning . Detta är samma grundläggande tillvägagångssätt som Frozen v2 skulle använda.
Googles AI-beräkningskapacitet är så ansträngd att företaget har börjat ransonera åtkomst även till betalande jättar. Flera datapunkter gör motivet tydligt:
Metas kapacitetsnek (mars 2026): Google meddelade Meta i mars 2026 att man inte kunde leverera all Gemini-beräkningskapacitet Meta ville köpa . Bristen försenade några av Metas interna AI-projekt och tvingade Meta att instruera sina ingenjörer att spara på AI-tokens
.
Backlogsiffror: Googles molnorderstock nästan fördubblades till 462 miljarder dollar under första kvartalet 2026, vilket representerar efterfrågan som är ungefär 23 gånger den tillgängliga processorkapaciteten . Vd Sundar Pichai bekräftade på resultatkonferensen: "Vi är beräkningsbegränsade på kort sikt... våra molnintäkter skulle ha varit högre om vi hade kunnat möta den efterfrågan"
.
Den bredare kapacitetsbristen: Google hyr till och med cirka 920 miljoner dollar per månad i Nvidia-GPU:er från SpaceX för att överbrygga sitt beräkningsgap . Googles moln-VP Amin Vahdat sa i november 2025 att företaget skulle behöva fördubbla AI-kapaciteten var sjätte månad för att möta efterfrågan
.
Dessa begränsningar motiverar direkt Frozen v2: om Google kan få 6–10 gånger mer Gemini-slutledning per watt, multiplicerar det effektivt kapaciteten utan att behöva nya datacenter.
Frozen v2 är en del av en mycket bredare hårdvarustrategi:
1. Åttonde generationens TPU:er delas upp i tränings- och slutledningschip. På Cloud Next 2026 förhandsvisade Google den åttonde generationens TPU-familj, som för första gången delas upp i två specialiserade varianter :
2. Långsiktigt avtal med Broadcom till 2031. Broadcom lämnade in en SEC 8-K som avslöjar ett långsiktigt avtal om att utveckla och leverera anpassade TPU:er för Googles framtida generationer, plus ett leveranssäkerhetsavtal för nätverkskomponenter till 2031 . Separat skrev Anthropic ett avtal om cirka 3,5 GW av Googles TPU-kapacitet, som tas i drift från 2027 och framåt
.
3. TPU-uthyrning till kunder inklusive OpenAI. Rapporter indikerar att Google i allt högre grad erbjuder TPU-kapacitet som en uthyrningsprodukt till externa AI-företag, med OpenAI nämnd som kund .
4. "Icefish"-projektet med MediaTek. Kodnamnet "Icefish" verkar vara kopplat till MediaTeks engagemang i ett Google-specifikt anpassat chipprojekt bortom TPU 8i – möjligen en lägreffekts edge- eller slutledningsaccelerator .
5. Diskussioner med Intel. Google har enligt uppgift haft diskussioner med Intel om anpassade AI-chipdesigner, men inget formellt avtal har tillkännages .
6. Ironwood (sjunde generationens TPU) allmänt tillgänglig. Ironwood gjordes allmänt tillgänglig för molnkunder i april 2026 . Byggd på en 3nm-process med en dual-chiplet-arkitektur, var den optimerad för MoE-modeller som driver Gemini-ekosystemet
.
The Information-rapporten anger uttryckligen att Frozen v2 är utformad för att komplettera, inte ersätta, Googles TPU-roadmap . Logiken är enkel:
Detta är analogt med hur hyperscalers använder både generella CPU:er för de flesta arbetsbelastningar och dedikerade ASIC:ar för specifika högvolymsuppgifter (t.ex. videotranskodning, nätverksavlastning). Frozen v2 är AI-motsvarigheten: en specialbyggd slutledningsmotor som sitter bredvid den programmerbara TPU-flottan.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google utvecklar 'Frozen v2', ett serverchip som i form av en ASIC hårdkodar arkitekturen för AI modellen Gemini direkt i kislet för att uppnå 6–10 gånger fler tokens per watt jämfört med de senaste TPU:erna – men det...
Google utvecklar 'Frozen v2', ett serverchip som i form av en ASIC hårdkodar arkitekturen för AI modellen Gemini direkt i kislet för att uppnå 6–10 gånger fler tokens per watt jämfört med de senaste TPU:erna – men det... Projektet drivs av en svår AI beräkningsbrist som tvingade Google att begränsa kapaciteten även för Meta, samtidigt som orderbacklogen vuxit till 460 miljarder dollar och vd Sundar Pichai har medgivit att företaget är...
Startupen Taalas har redan bevisat konceptet: deras HC1 chip kodar Llama 3.1 8B i mask ROM, levererar 17 000 tokens per sekund och är 20 gånger billigare än GPU:er – men är låst till en enda modell, vilket illustrerar...