Google sta sviluppando 'Frozen v2', un chip server che incide l'architettura del suo modello AI Gemini direttamente nel silicio come ASIC a funzione fissa, puntando a un'efficienza di 6–10x token per watt rispetto all... Il progetto è guidato da una grave carenza di potenza di calcolo AI che ha costretto Google a ra...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google sta compiendo la sua scommessa hardware più audace fino ad oggi. L'azienda sta sviluppando un chip per server, nome in codice interno 'Frozen v2', che codifica gli elementi architetturali del suo modello AI Gemini direttamente nel silicio come un ASIC a funzione fissa. Riportato per la prima volta da The Information il 20 luglio 2026, il progetto mira a migliorare drasticamente l'efficienza tokens-per-watt per servire Gemini — al costo di non poter mai eseguire un altro modello .
Frozen v2 è un motore di inferenza specifico per applicazione, non un processore tensoriale generico come le Tensor Processing Units (TPU) di Google. Le TPU sono acceleratori programmabili che supportano un'ampia gamma di modelli AI tramite riconfigurazione software . Frozen v2 è l'opposto: l'architettura specifica di Gemini — i suoi layer, operatori e flusso di dati — viene "bruciata" nel chip in fase di fabbricazione, rendendolo un "Gemini-in-a-chip" monouso.
Il guadagno in efficienza è il titolo: gli ingegneri di Google ipotizzano che Frozen v2 potrebbe fornire da 6 a 10 volte più token AI per unità di consumo energetico rispetto ai chip TPU più recenti .
Secondo il rapporto di The Information e le coperture che lo corroborano, Frozen v2 è destinato alla distribuzione già nel 2028 . Ciò significa che il chip è ancora a anni dalla produzione ed entrerà in servizio solo dopo che l'attuale famiglia di TPU di ottava generazione (Sunfish e Zebrafish) sarà stata distribuita e maturata.
La startup Taalas mostra esattamente cosa significa questo compromesso nella pratica. Nel febbraio 2026, Taalas ha svelato il suo chip HC1, che codifica l'intero modello Llama 3.1 8B — ogni parametro — direttamente nei circuiti a transistor del chip utilizzando una ROM di mascheratura, senza HBM esterna per l'archiviazione dei pesi .
I numeri sono sorprendenti:
Lo svantaggio è altrettanto drammatico:
Il fondatore di Taalas ha descritto l'architettura come l'abbinamento di un "tessuto di richiamo ROM di mascheratura" con un tessuto di richiamo SRAM per archiviare sia il modello che eseguire tutte le operazioni della cache KV sul chip, eliminando completamente il movimento di memoria esterno . Questo è lo stesso approccio fondamentale che Frozen v2 utilizzerebbe.
La capacità di calcolo AI di Google è così stressata che ha iniziato a razionare l'accesso persino a giganti paganti. Diversi punti dati rendono chiara la motivazione:
Il rifiuto di capacità a Meta (marzo 2026): Google ha detto a Meta nel marzo 2026 di non poter fornire tutta la capacità di calcolo Gemini che Meta voleva acquistare . La carenza ha ritardato alcuni dei progetti AI interni di Meta e ha costretto Meta a ordinare ai suoi ingegneri di conservare i token AI
.
Cifre del backlog: Il backlog degli ordini di Google Cloud è quasi raddoppiato a 462 miliardi di dollari nel primo trimestre del 2026, rappresentando una domanda circa 23 volte la sua capacità di elaborazione disponibile . Il CEO Sundar Pichai ha confermato durante la chiamata sugli utili: "Siamo vincolati dal calcolo nel breve termine... i nostri ricavi dal cloud sarebbero stati più alti se fossimo stati in grado di soddisfare quella domanda"
.
Stretta di capacità più ampia: Google sta persino noleggiando circa 920 milioni di dollari al mese in GPU Nvidia da SpaceX per colmare il suo divario di calcolo . Il VP del cloud di Google, Amin Vahdat, ha dichiarato nel novembre 2025 che l'azienda avrebbe dovuto raddoppiare la capacità AI ogni sei mesi per soddisfare la domanda
.
Questi vincoli motivano direttamente Frozen v2: se Google può ottenere 6-10x più inferenza Gemini per watt, moltiplica effettivamente la capacità senza bisogno di nuovi datacenter.
Frozen v2 è un pezzo di una strategia hardware molto più ampia:
1. TPU di ottava generazione divise in chip per training e inferenza. Al Cloud Next 2026, Google ha presentato in anteprima la famiglia di TPU di ottava generazione, divisa per la prima volta in due varianti specializzate :
2. Accordo a lungo termine con Broadcom fino al 2031. Broadcom ha depositato un modulo SEC 8-K che rivela un Accordo a Lungo Termine per sviluppare e fornire TPU personalizzate per le future generazioni di Google, più un Accordo di Garanzia di Fornitura per componenti di rete fino al 2031 . Separatamente, Anthropic ha firmato un accordo per circa 3,5 GW di capacità TPU di Google, in arrivo dal 2027 in poi
.
3. Noleggio TPU a clienti tra cui OpenAI. I rapporti indicano che Google sta offrendo sempre più capacità TPU come prodotto a noleggio a società AI esterne, con OpenAI nominata come cliente .
4. Progetto "Icefish" con MediaTek. Il nome in codice "Icefish" appare collegato al coinvolgimento di MediaTek in un progetto di chip personalizzato specifico di Google oltre a TPU 8i — possibilmente un acceleratore edge o di inferenza a potenza ridotta .
5. Discussioni con Intel. Secondo quanto riferito, Google ha avuto discussioni con Intel riguardo a progetti di chip AI personalizzati, anche se non è stato annunciato alcun accordo formale .
6. Ironwood (TPU di settima generazione) generalmente disponibile. Ironwood è stato reso generalmente disponibile ai clienti cloud nell'aprile 2026 . Costruito su un processo a 3nm con un'architettura dual-chiplet, è stato ottimizzato per modelli MoE che alimentano l'ecosistema Gemini
.
Il rapporto di The Information afferma esplicitamente che Frozen v2 è progettato per completare, non sostituire, la roadmap delle TPU di Google . La logica è semplice:
Questo è analogo a come gli hyperscaler utilizzano sia CPU generiche per la maggior parte dei carichi di lavoro sia ASIC a funzione fissa per attività specifiche ad alto volume (es. transcodifica video, offload di rete). Frozen v2 è l'equivalente AI: un motore di inferenza dedicato che si affianca alla flotta di TPU programmabili.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google sta sviluppando 'Frozen v2', un chip server che incide l'architettura del suo modello AI Gemini direttamente nel silicio come ASIC a funzione fissa, puntando a un'efficienza di 6–10x token per watt rispetto all...
Google sta sviluppando 'Frozen v2', un chip server che incide l'architettura del suo modello AI Gemini direttamente nel silicio come ASIC a funzione fissa, puntando a un'efficienza di 6–10x token per watt rispetto all... Il progetto è guidato da una grave carenza di potenza di calcolo AI che ha costretto Google a razionare la capacità persino a Meta, con un backlog cloud di 462 miliardi di dollari e il CEO Sundar Pichai che conferma c...
La startup Taalas dimostra già il concetto: il suo chip HC1 codifica Llama 3.1 8B in una ROM di mascheratura, raggiungendo 17.000 token/secondo e un costo 20x inferiore rispetto alle GPU, ma è bloccato su un singolo m...