Google正開發代號「Frozen v2」嘅伺服器晶片,將Gemini AI模型架構直接hardwire落矽晶片做固定功能ASIC,目標係每瓦特token數比最新TPU高6至10倍,但代價係從此只能行Gemini,冇得轉第二個模型。 呢個項目嘅推動力係Google Cloud面臨嚴重算力短缺:積壓訂單近4620億美元、CEO Sundar Pichai都承認「我哋短期內算力好緊張」,甚至2026年3月要限制Meta攞Gemini capacity,搞到Meta嘅內部AI項目延誤。

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google今次賭得好大。佢哋正開發代號 「Frozen v2」 嘅伺服器晶片,將Gemini AI模型嘅架構元素直接hardcode落矽晶片,做一粒固定功能ASIC(Application-Specific Integrated Circuit)。呢個項目由《The Information》喺2026年7月20日率先披露,目標係大幅提升Gemini推理嘅tokens-per-watt效率,但代價係永遠行唔到其他模型 。
Frozen v2係一粒 專門做推理嘅引擎,唔係好似Google嘅Tensor Processing Units(TPU)咁通用。TPU係可程式化加速器,靠軟件重新配置就可以支援好多種AI模型 。Frozen v2完全相反:Gemini嘅特定架構——包括layers、operators同dataflow——喺晶片製造嗰陣已經燒死咗,變成一粒「Gemini-in-a-chip」。
效率提升係最大賣點:Google工程師預計Frozen v2喺每單位功耗下,可以產生嘅AI tokens比最新TPU高 6至10倍 。
根據《The Information》嘅報道,Frozen v2最快 2028年 部署 。即係話距離量產仲有好幾年,要等現有第八代TPU家族(Sunfish同Zebrafish)落地成熟之後先會登場。
初創公司 Taalas 嘅例子清楚展示咗呢個tradeoff。2026年2月,Taalas發表咗 HC1晶片,將整個Llama 3.1 8B模型——每一個參數——直接encode落晶片嘅晶體管電路,用mask ROM儲存,唔需要外部HBM嚟放權重 。
數字好驚人:
但代價同樣極端:
Taalas創辦人形容個架構係用「mask ROM recall fabric」配搭「SRAM recall fabric」,將模型同所有KV cache運算都放喺晶片上面,完全唔使外部記憶體走動 。呢個正正係Frozen v2會用嘅基本策略。
Google嘅AI算力短缺好嚴重,甚至要限制客仔嘅用量。以下幾個數據點說明咗個情況:
Meta被cut capacity(2026年3月): Google喺2026年3月通知Meta,話冇辦法供應Meta想要嘅全部Gemini運算容量 。呢個短缺令Meta部分內部AI項目延誤,Meta仲要叫工程師慳住用AI tokens
。
積壓訂單數字: Google Cloud嘅未完成訂單喺2026年第一季幾乎翻咗一倍,去到 4620億美元,相當於現有處理能力嘅約 23倍 。CEO Sundar Pichai喺業績電話會確認:「我哋短期內算力好緊張……如果我哋能夠滿足需求,雲業務收入會更高」
。
更大嘅capacity壓力: Google甚至要每月用約 9.2億美元 向SpaceX租用Nvidia GPU 嚟填補算力缺口 。Google雲端VP Amin Vahdat喺2025年11月話,公司每六個月就要將AI capacity翻倍先滿足到需求
。
呢啲限制直接推動咗Frozen v2:如果Google可以做到每瓦特行多6–10倍Gemini推理,就等於唔駛起新數據中心都大大增加有效capacity。
Frozen v2只係Google整體硬件策略嘅一部分:
1. 第八代TPU分拆訓練同推理晶片。 喺Cloud Next 2026,Google預覽咗第八代TPU家族,首次分做兩個專用變體 :
2. Broadcom長期合作至2031年。 Broadcom嘅SEC 8-K披露,已同Google簽訂長期協議,開發及供應未來幾代定制TPU,另加網絡組件供應保證協議去到2031年 。另外,Anthropic 亦簽咗約3.5 GW Google TPU capacity嘅協議,由2027年起逐步上線
。
3. TPU租賃俾外部客戶,包括OpenAI。 有報導指Google越嚟越多將TPU capacity租俾外部AI公司,OpenAI係其中一個客戶 。
4. 同MediaTek嘅「Icefish」項目。 「Icefish」呢個代號據報同MediaTek參與嘅Google定制晶片項目有關,可能係一款低功耗邊緣或推理加速器 。
5. 同Intel傾緊合作。 報導指Google同Intel傾過定制AI晶片設計,但未有任何正式協議 。
6. Ironwood(第七代TPU)正式可用。 Ironwood喺2026年4月正式對外提供 。用3nm製程同雙晶片let架構,專為MoE模型優化,係Gemini生態嘅骨幹
。
《The Information》嘅報道明確指出,Frozen v2係 補充、唔係取代 Google嘅TPU路線圖 。邏輯好簡單:
呢個概念同大型雲端公司同時用通用CPU做大部分工作、以及用固定功能ASIC做特定高流量任務(例如影片轉碼、網絡卸載)係一樣嘅。Frozen v2就係AI版本嘅固定功能引擎,同可程式化嘅TPU艦隊並肩作戰。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google正開發代號「Frozen v2」嘅伺服器晶片,將Gemini AI模型架構直接hardwire落矽晶片做固定功能ASIC,目標係每瓦特token數比最新TPU高6至10倍,但代價係從此只能行Gemini,冇得轉第二個模型。
Google正開發代號「Frozen v2」嘅伺服器晶片,將Gemini AI模型架構直接hardwire落矽晶片做固定功能ASIC,目標係每瓦特token數比最新TPU高6至10倍,但代價係從此只能行Gemini,冇得轉第二個模型。 呢個項目嘅推動力係Google Cloud面臨嚴重算力短缺:積壓訂單近4620億美元、CEO Sundar Pichai都承認「我哋短期內算力好緊張」,甚至2026年3月要限制Meta攞Gemini capacity,搞到Meta嘅內部AI項目延誤。
初創公司Taalas已經證明呢個概念:佢哋嘅HC1晶片將Llama 3.1 8B模型直接encode入mask ROM,做到每秒17,000 tokens、成本比GPU低20倍,但只行得一個模型——呢個極端tradeoff就係Google Frozen v2嘅前車之鑑。