| 内存模型 | 动态加载模型权重的 HBM + SRAM | 模型权重和计算路径直接嵌入到掩膜 ROM / 硬连线逻辑中 |
| 灵活性 | 通过软件重配置可运行任何模型 | 仅能运行一个模型 (Gemini) —— 无法在运行时切换 |
根据 The Information 的报道及后续跟进,Frozen v2 的目标部署时间是 最早 2028 年 。这意味着该芯片距离量产还有数年时间,并且将在当前第八代 TPU 系列(Sunfish 和 Zebrafish)部署并成熟之后才会投入使用。
初创公司 Taalas 以实战展示了这一取舍的真实面貌。2026 年 2 月,Taalas 发布了其 HC1 芯片,该芯片将整个 Llama 3.1 8B 模型——每一参数——直接编码到芯片的晶体管电路中,使用掩膜 ROM,无需外部 HBM 存储权重 。
数字令人震惊:
其代价同样巨大:
Taalas 的创始人将这种架构描述为将 "掩膜 ROM 召回结构" 与 SRAM 召回结构配对,在片上存储模型并计算所有 KV 缓存操作,完全消除了外部内存搬运 。这正是 Frozen v2 将采用的基础方法。
谷歌的 AI 算力承受着巨大压力,以至于它已经开始对包括付费巨头在内的客户进行配给。以下数据点清晰地揭示了动机:
对 Meta 的容量拒绝 (2026 年 3 月): 2026 年 3 月,谷歌告知 Meta,无法提供 Meta 想要购买的全部 Gemini 算力 。这一短缺推迟了 Meta 的一些内部 AI 项目,并迫使 Meta 指示其工程师节约使用 AI tokens
。
积压订单数据: 2026 年第一季度,谷歌云的订单积压几乎翻倍,达到 4620 亿美元,代表的需求大约是其可用处理能力的 23 倍 。CEO 桑达尔·皮查伊在财报电话会议上确认:"我们短期内受到算力限制……如果我们能够满足需求,我们的云收入本可以更高"
。
更广泛的算力紧缺: 为了弥合自身的算力缺口,谷歌甚至每月向 SpaceX 租用约 9.2 亿美元的英伟达 GPU 。谷歌云 VP Amin Vahdat 在 2025 年 11 月曾表示,公司需要每六个月将 AI 算力翻倍才能满足需求
。
这些限制直接催生了 Frozen v2:如果谷歌能让每瓦特产生 6-10 倍的 Gemini 推理输出,就相当于无需新建数据中心就将有效算力放大了数倍。
Frozen v2 只是谷歌更宏大硬件战略的一部分:
2. 与博通的长期协议延续至 2031 年。 博通提交的 SEC 8-K 文件披露了为谷歌未来几代产品开发和供应定制 TPU 的长期协议,以及网络组件的供应保障协议,有效期至 2031 年 。此外,Anthropic 签署了一项协议,从 2027 年开始获取约 3.5 GW 的谷歌 TPU 容量
。
6. 第七代 TPU Ironwood 正式可用。 Ironwood 于 2026 年 4 月向云客户正式推出 。它采用 3nm 工艺和双芯粒架构,专为驱动 Gemini 生态系统的 MoE 模型优化
。
这类似于超级数据中心既使用通用 CPU 处理大部分工作负载,又使用固定功能 ASIC 处理特定的高容量任务(如视频转码、网络卸载)。Frozen v2 就是 AI 领域的等效物:一个专用推理引擎,与可编程的 TPU 集群并肩作战。