Frozen v2係一粒 專門做推理嘅引擎,唔係好似Google嘅Tensor Processing Units(TPU)咁通用。TPU係可程式化加速器,靠軟件重新配置就可以支援好多種AI模型 。Frozen v2完全相反:Gemini嘅特定架構——包括layers、operators同dataflow——喺晶片製造嗰陣已經燒死咗,變成一粒「Gemini-in-a-chip」。
| 層面 | 現有TPU(Ironwood、TPU 8i/8t) | Frozen v2 |
|---|---|---|
| 設計理念 | 通用AI加速器;可程式化矩陣單元、靈活dataflow | 固定功能ASIC;Gemini架構直接嵌入矽晶片,唔可以現場改 |
| 效率目標 | 對多種模型做訓練同推理都有不俗表現 | 行Gemini推理時比最新TPU高6–10倍tokens per watt |
| 記憶體模式 | HBM + SRAM動態載入模型權重 | 模型權重同計算路徑直接hardwire落mask ROM / 硬邏輯 |
| 靈活性 | 靠軟件重新配置可以行任何模型 | 一個模型(Gemini)——運行時冇得轉 |
效率提升係最大賣點:Google工程師預計Frozen v2喺每單位功耗下,可以產生嘅AI tokens比最新TPU高 6至10倍 。
根據《The Information》嘅報道,Frozen v2最快 2028年 部署 。即係話距離量產仲有好幾年,要等現有第八代TPU家族(Sunfish同Zebrafish)落地成熟之後先會登場。
初創公司 Taalas 嘅例子清楚展示咗呢個tradeoff。2026年2月,Taalas發表咗 HC1晶片,將整個Llama 3.1 8B模型——每一個參數——直接encode落晶片嘅晶體管電路,用mask ROM儲存,唔需要外部HBM嚟放權重 。
數字好驚人:
但代價同樣極端:
Taalas創辦人形容個架構係用「mask ROM recall fabric」配搭「SRAM recall fabric」,將模型同所有KV cache運算都放喺晶片上面,完全唔使外部記憶體走動 。呢個正正係Frozen v2會用嘅基本策略。
Google嘅AI算力短缺好嚴重,甚至要限制客仔嘅用量。以下幾個數據點說明咗個情況:
Meta被cut capacity(2026年3月): Google喺2026年3月通知Meta,話冇辦法供應Meta想要嘅全部Gemini運算容量 。呢個短缺令Meta部分內部AI項目延誤,Meta仲要叫工程師慳住用AI tokens 。
積壓訂單數字: Google Cloud嘅未完成訂單喺2026年第一季幾乎翻咗一倍,去到 4620億美元,相當於現有處理能力嘅約 23倍 。CEO Sundar Pichai喺業績電話會確認:「我哋短期內算力好緊張……如果我哋能夠滿足需求,雲業務收入會更高」。
更大嘅capacity壓力: Google甚至要每月用約 9.2億美元 向SpaceX租用Nvidia GPU 嚟填補算力缺口 。Google雲端VP Amin Vahdat喺2025年11月話,公司每六個月就要將AI capacity翻倍先滿足到需求 。
呢啲限制直接推動咗Frozen v2:如果Google可以做到每瓦特行多6–10倍Gemini推理,就等於唔駛起新數據中心都大大增加有效capacity。
Frozen v2只係Google整體硬件策略嘅一部分:
1. 第八代TPU分拆訓練同推理晶片。 喺Cloud Next 2026,Google預覽咗第八代TPU家族,首次分做兩個專用變體 :
2. Broadcom長期合作至2031年。 Broadcom嘅SEC 8-K披露,已同Google簽訂長期協議,開發及供應未來幾代定制TPU,另加網絡組件供應保證協議去到2031年 。另外,Anthropic 亦簽咗約3.5 GW Google TPU capacity嘅協議,由2027年起逐步上線 。
3. TPU租賃俾外部客戶,包括OpenAI。 有報導指Google越嚟越多將TPU capacity租俾外部AI公司,OpenAI係其中一個客戶 。
4. 同MediaTek嘅「Icefish」項目。 「Icefish」呢個代號據報同MediaTek參與嘅Google定制晶片項目有關,可能係一款低功耗邊緣或推理加速器 。
5. 同Intel傾緊合作。 報導指Google同Intel傾過定制AI晶片設計,但未有任何正式協議 。
6. Ironwood(第七代TPU)正式可用。 Ironwood喺2026年4月正式對外提供 。用3nm製程同雙晶片let架構,專為MoE模型優化,係Gemini生態嘅骨幹 。
《The Information》嘅報道明確指出,Frozen v2係 補充、唔係取代 Google嘅TPU路線圖 。邏輯好簡單:
呢個概念同大型雲端公司同時用通用CPU做大部分工作、以及用固定功能ASIC做特定高流量任務(例如影片轉碼、網絡卸載)係一樣嘅。Frozen v2就係AI版本嘅固定功能引擎,同可程式化嘅TPU艦隊並肩作戰。