| Acelerador de IA de propósito general; unidades matriciales programables, flujo de datos flexible |
| ASIC de función fija; la arquitectura de Gemini está incrustada en el silicio, no es programable en campo |
| Objetivo de eficiencia | Buena para entrenamiento e inferencia en muchos modelos | De 6 a 10 veces más tokens por vatio que las TPU más nuevas de Google en inferencia con Gemini |
| Modelo de memoria | HBM + SRAM para pesos de modelo cargados dinámicamente | Pesos del modelo y rutas de cómputo incrustados directamente en máscara ROM / lógica cableada |
| Flexibilidad | Puede ejecutar cualquier modelo mediante reconfiguración de software | Un solo modelo (Gemini) — sin posibilidad de cambiar de modelo en tiempo de ejecución |
La ganancia de eficiencia es el titular: los ingenieros de Google proyectan que Frozen v2 podría ofrecer de 6 a 10 veces más tokens de IA por unidad de consumo de energía que los chips TPU más recientes .
Según el informe de The Information y la cobertura que lo corrobora, Frozen v2 tiene como objetivo su implementación a partir de 2028 . Esto significa que el chip aún está a años de la producción y solo entrará en servicio después de que la generación actual de TPU de octava generación (Sunfish y Zebrafish) se haya implementado y consolidado.
La startup Taalas muestra exactamente lo que esta disyuntiva significa en la práctica. En febrero de 2026, Taalas presentó su chip HC1, que codifica todo el modelo Llama 3.1 8B (cada parámetro) directamente en los circuitos del transistor del chip mediante máscara ROM, sin HBM externo para el almacenamiento de pesos .
Las cifras son asombrosas:
La desventaja es igualmente dramática:
El fundador de Taalas describió la arquitectura como la combinación de un "tejido de recuperación de máscara ROM" con un tejido de recuperación SRAM para almacenar tanto el modelo como realizar todas las operaciones de la caché KV en el chip, eliminando por completo el movimiento de memoria externa . Este es el mismo enfoque fundamental que utilizaría Frozen v2.
La capacidad de cómputo de IA de Google está tan tensionada que ha comenzado a racionar el acceso incluso a gigantes que pagan. Varios puntos de datos aclaran la motivación:
La denegación de capacidad a Meta (marzo de 2026): Google le comunicó a Meta en marzo de 2026 que no podía suministrar toda la capacidad de cómputo de Gemini que Meta quería comprar . El déficit retrasó algunos proyectos internos de IA de Meta y obligó a Meta a pedir a sus ingenieros que conservaran los tokens de IA
.
Cifras de la cartera de pedidos: La cartera de pedidos de Google Cloud casi se duplicó hasta los 462.000 millones de dólares en el primer trimestre de 2026, lo que representa una demanda aproximadamente 23 veces su capacidad de procesamiento disponible . El CEO Sundar Pichai confirmó en la conferencia de resultados: "Estamos limitados en capacidad de cómputo a corto plazo... nuestros ingresos en la nube habrían sido mayores si hubiéramos podido satisfacer esa demanda"
.
Presión de capacidad más amplia: Google está incluso alquilando aproximadamente 920 millones de dólares al mes en GPU de Nvidia a SpaceX para cerrar su brecha de cómputo . Amin Vahdat, vicepresidente de la nube de Google, dijo en noviembre de 2025 que la empresa necesitaría duplicar la capacidad de IA cada seis meses para satisfacer la demanda
.
Estas limitaciones motivan directamente Frozen v2: si Google puede obtener de 6 a 10 veces más inferencia de Gemini por vatio, multiplica efectivamente la capacidad sin necesidad de nuevos centros de datos.
Frozen v2 es una pieza de una estrategia de hardware mucho más amplia:
1. TPU de octava generación divididas en chips de entrenamiento e inferencia. En Cloud Next 2026, Google presentó la familia de TPU de octava generación, dividida por primera vez en dos variantes de propósito específico :
2. Acuerdo a largo plazo con Broadcom hasta 2031. Broadcom presentó un formulario 8-K ante la SEC que revela un Acuerdo a Largo Plazo para desarrollar y suministrar TPU personalizadas para las futuras generaciones de Google, además de un Acuerdo de Garantía de Suministro para componentes de red hasta 2031 . Por separado, Anthropic firmó un acuerdo para unos 3,5 GW de capacidad de TPU de Google, que entrará en funcionamiento a partir de 2027
.
3. Alquiler de TPU a clientes, incluido OpenAI. Los informes indican que Google está ofreciendo cada vez más capacidad de TPU como un producto de alquiler a empresas externas de IA, y se menciona a OpenAI como cliente .
4. Proyecto "Icefish" con MediaTek. El nombre en clave "Icefish" parece estar vinculado a la participación de MediaTek en un proyecto de chip personalizado específico de Google más allá de la TPU 8i, posiblemente un acelerador de inferencia de baja potencia o para el borde .
5. Conversaciones con Intel. Google ha mantenido conversaciones con Intel sobre diseños de chips de IA personalizados, aunque no se ha anunciado ningún acuerdo formal .
6. Ironwood (TPU de séptima generación) disponible de forma general. Ironwood se puso a disposición general de los clientes de la nube en abril de 2026 . Construido en un proceso de 3nm con una arquitectura de dos troqueles, fue optimizado para modelos MoE que impulsan el ecosistema Gemini
.
El informe de The Information establece explícitamente que Frozen v2 está diseñado para complementar, no reemplazar, la hoja de ruta de las TPU de Google . La lógica es sencilla:
Esto es análogo a cómo los hiperescaladores utilizan tanto CPU de propósito general para la mayoría de las cargas de trabajo como ASIC de función fija para tareas específicas de alto volumen (por ejemplo, transcodificación de vídeo, descarga de redes). Frozen v2 es el equivalente en IA: un motor de inferencia de propósito específico que se sitúa junto a la flota de TPU programables.