Frozen v2 ialah enjin inferens khusus aplikasi, bukan pemproses tensor umum seperti Tensor Processing Units (TPU) Google. TPU ialah pemecut boleh atur cara yang menyokong pelbagai model AI melalui konfigurasi semula perisian . Frozen v2 adalah sebaliknya: seni bina khusus Gemini — lapisan, operator, dan aliran datanya — dibakar ke dalam cip semasa pembuatan, menjadikannya "Gemini-dalam-cip" tujuan tunggal.
| Dimensi | TPU Sedia Ada (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Falsafah reka bentuk | Pemecut AI tujuan umum; unit matriks boleh atur cara, aliran data fleksibel | ASIC fungsi tetap; seni bina Gemini terbenam dalam silikon, tidak boleh diatur cara di lapangan |
| Sasaran kecekapan | Baik untuk latihan dan inferens merentas banyak model | 6–10x lebih token per watt berbanding TPU terbaru Google pada inferens Gemini |
| Model memori | HBM + SRAM untuk pemberat model dimuatkan secara dinamik | Pemberat model dan laluan pengiraan terbenam terus dalam ROM topeng / logik keras |
| Fleksibiliti | Boleh menjalankan sebarang model melalui konfigurasi semula perisian | Satu model (Gemini) — tiada penukaran model masa jalan |
Keuntungan kecekapan adalah tajuk utama: jurutera Google dilaporkan mengunjurkan Frozen v2 boleh menyampaikan 6 hingga 10 kali lebih token AI per unit penggunaan kuasa berbanding cip TPU terkini .
Menurut laporan The Information dan liputan yang mengesahkan, Frozen v2 disasarkan untuk pelaksanaan seawal 2028 . Ini bermakna cip itu masih bertahun-tahun dari pengeluaran dan hanya akan memasuki perkhidmatan selepas keluarga TPU generasi kelapan semasa (Sunfish dan Zebrafish) telah digunakan dan matang.
Permulaan Taalas menunjukkan dengan tepat maksud pertukaran ini dalam amalan. Pada Februari 2026, Taalas melancarkan cip HC1, yang mengekod keseluruhan model Llama 3.1 8B — setiap parameter — terus ke dalam litar transistor cip menggunakan ROM topeng, tanpa HBM luaran untuk penyimpanan pemberat .
Angka-angka adalah menakjubkan:
Kelemahannya sama dramatik:
Pengasas Taalas menerangkan seni bina sebagai memasangkan "kain ingat ROM topeng" dengan kain ingat SRAM untuk menyimpan kedua-dua model dan mengira semua operasi cache KV pada cip, menghapuskan pergerakan memori luaran sepenuhnya . Ini adalah pendekatan asas yang sama yang akan digunakan oleh Frozen v2.
Kapasiti pengkomputeran AI Google begitu tertekan sehingga ia mula mencatu akses walaupun kepada gergasi yang membayar. Beberapa titik data menjelaskan motivasi:
Penafian kapasiti Meta (Mac 2026): Google memberitahu Meta pada Mac 2026 bahawa ia tidak boleh membekalkan semua kapasiti pengkomputeran Gemini yang ingin dibeli oleh Meta . Kekurangan itu melambatkan beberapa projek AI dalaman Meta dan memaksa Meta mengarahkan juruteranya untuk menjimatkan token AI .
Angka backlog: Backlog pesanan Google Cloud hampir berganda kepada $462 bilion pada Q1 2026, mewakili permintaan kira-kira 23 kali kapasiti pemprosesan yang tersedia . CEO Sundar Pichai mengesahkan pada panggilan pendapatan: "Kami dikekang pengkomputeran dalam jangka pendek... hasil awan kami akan lebih tinggi jika kami dapat memenuhi permintaan itu" .
Sesakan kapasiti yang lebih luas: Google malah memajak kira-kira $920 juta sebulan dalam GPU Nvidia daripada SpaceX untuk merapatkan jurang pengkomputerannya . VP awan Google Amin Vahdat berkata pada November 2025 bahawa syarikat itu perlu menggandakan kapasiti AI setiap enam bulan untuk memenuhi permintaan .
Kekangan ini secara langsung mendorong Frozen v2: jika Google boleh mendapatkan 6–10x lebih inferens Gemini per watt, ia secara berkesan menggandakan kapasiti tanpa memerlukan pusat data baharu.
Frozen v2 adalah salah satu bahagian daripada strategi perkakasan yang lebih luas:
1. TPU generasi kelapan dibahagikan kepada cip latihan dan inferens. Di Cloud Next 2026, Google mempratonton keluarga TPU generasi kelapan, dibahagikan buat pertama kali kepada dua varian tujuan khusus :
2. Perjanjian jangka panjang Broadcom melalui 2031. Broadcom memfailkan SEC 8-K mendedahkan Perjanjian Jangka Panjang untuk membangunkan dan membekalkan TPU tersuai untuk generasi masa depan Google, plus Perjanjian Jaminan Bekalan untuk komponen rangkaian melalui 2031 . Secara berasingan, Anthropic menandatangani perjanjian untuk ~3.5 GW kapasiti TPU Google, yang akan tersedia dari 2027 dan seterusnya .
3. Penyewaan TPU kepada pelanggan termasuk OpenAI. Laporan menunjukkan Google semakin menawarkan kapasiti TPU sebagai produk sewaan kepada syarikat AI luaran, dengan OpenAI dinamakan sebagai pelanggan .
4. Projek "Icefish" dengan MediaTek. Nama kod "Icefish" muncul dikaitkan dengan penglibatan MediaTek pada projek cip tersuai khusus Google di luar TPU 8i — mungkin pemecut tepi atau inferens kuasa rendah .
5. Perbincangan dengan Intel. Google dilaporkan telah mengadakan perbincangan dengan Intel tentang reka bentuk cip AI tersuai, walaupun tiada perjanjian rasmi telah diumumkan .
6. Ironwood (TPU generasi ketujuh) tersedia secara umum. Ironwood telah tersedia secara umum kepada pelanggan awan pada April 2026 . Dibina pada proses 3nm dengan seni bina dwi-chiplet, ia dioptimumkan untuk model MoE yang menjana ekosistem Gemini .
Laporan The Information secara jelas menyatakan Frozen v2 direka untuk melengkapkan, bukan menggantikan, peta jalan TPU Google . Logiknya adalah mudah:
Ini sama dengan cara hiperskala menggunakan kedua-dua CPU tujuan umum untuk kebanyakan beban kerja dan ASIC fungsi tetap untuk tugas volum tinggi yang khusus (cth., transkod video, pemunggahan rangkaian). Frozen v2 ialah setara AI: enjin inferens tujuan khusus yang duduk bersama armada TPU boleh atur cara.