Frozen v2 là một engine suy luận chuyên biệt cho ứng dụng (application-specific inference engine), không phải là một bộ xử lý tensor đa năng như Tensor Processing Units (TPUs) của Google. TPU là những bộ tăng tốc có thể lập trình, hỗ trợ nhiều loại mô hình AI thông qua cấu hình phần mềm . Frozen v2 thì ngược lại: kiến trúc cụ thể của Gemini — các lớp, toán tử và luồng dữ liệu — được 'đốt cháy' vào chip ngay tại thời điểm sản xuất, biến nó thành một 'Gemini-trong-một-chip' chuyên dụng.
| Khía cạnh | TPU hiện tại (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Triết lý thiết kế | Bộ tăng tốc AI đa năng; ma trận khả lập trình, luồng dữ liệu linh hoạt | ASIC chức năng cố định; kiến trúc của Gemini được nhúng vào silicon, không thể lập trình lại |
| Mục tiêu hiệu suất | Tốt cho cả huấn luyện và suy luận trên nhiều mô hình | Nhiều token/watt hơn 6–10 lần so với TPU mới nhất khi suy luận Gemini |
| Mô hình bộ nhớ | HBM + SRAM để nạp trọng số mô hình động | Trọng số mô hình và đường dẫn tính toán được nhúng trực tiếp trong mask ROM / logic cứng |
| Tính linh hoạt | Có thể chạy bất kỳ mô hình nào qua cấu hình phần mềm | Một mô hình (Gemini) — không thể chuyển đổi mô hình trong thời gian chạy |
Hiệu suất vượt trội là điểm nhấn: các kỹ sư của Google dự kiến Frozen v2 có thể cung cấp lượng token AI nhiều gấp 6 đến 10 lần trên mỗi đơn vị năng lượng tiêu thụ so với các chip TPU mới nhất .
Theo báo cáo của The Information và các nguồn tin xác nhận, Frozen v2 dự kiến được triển khai sớm nhất vào năm 2028 . Điều này có nghĩa là con chip này vẫn còn cách xa thời điểm sản xuất và sẽ chỉ được đưa vào hoạt động sau khi thế hệ TPU thứ tám hiện tại (Sunfish và Zebrafish) đã được triển khai và hoàn thiện.
Startup Taalas cho thấy rõ ràng sự đánh đổi này có ý nghĩa gì trong thực tế. Vào tháng 2 năm 2026, Taalas đã công bố chip HC1, 'đóng cứng' toàn bộ mô hình Llama 3.1 8B — mọi tham số — trực tiếp vào các mạch bán dẫn của chip bằng mask ROM, hoàn toàn không cần HBM bên ngoài để lưu trữ trọng số .
Các con số thật ấn tượng:
Mặt trái cũng không kém phần ấn tượng:
Nhà sáng lập Taalas mô tả kiến trúc này kết hợp 'mask ROM recall fabric' với 'SRAM recall fabric' để lưu trữ cả mô hình và thực hiện mọi phép toán KV cache ngay trên chip, loại bỏ hoàn toàn việc di chuyển bộ nhớ ra bên ngoài . Đây cũng chính là cách tiếp cận cơ bản mà Frozen v2 sẽ sử dụng.
Năng lực tính toán AI của Google đang bị căng thẳng đến mức họ đã phải phân bổ hạn chế (rationing) quyền truy cập ngay cả với những 'gã khổng lồ' đang trả tiền. Một số dữ liệu cho thấy rõ động lực này:
Vụ từ chối năng lực với Meta (tháng 3 năm 2026): Google đã nói với Meta vào tháng 3 năm 2026 rằng họ không thể cung cấp toàn bộ năng lực tính toán Gemini mà Meta muốn mua . Sự thiếu hụt này đã làm trì hoãn một số dự án AI nội bộ của Meta và buộc Meta phải yêu cầu các kỹ sư của mình tiết kiệm token AI .
Các con số về khoản tồn đọng: Khoản tồn đọng đơn hàng (backlog) của Google Cloud gần như tăng gấp đôi lên 462 tỷ USD trong quý 1 năm 2026, đại diện cho nhu cầu lớn gấp khoảng 23 lần năng lực xử lý hiện có . CEO Sundar Pichai đã xác nhận trong cuộc gọi báo cáo thu nhập: "Trong ngắn hạn, chúng tôi bị hạn chế về năng lực tính toán... doanh thu từ cloud của chúng tôi sẽ cao hơn nếu chúng tôi có thể đáp ứng nhu cầu đó" .
Áp lực năng lực rộng hơn: Google thậm chí đang thuê khoảng 920 triệu USD mỗi tháng GPU Nvidia từ SpaceX để lấp đầy khoảng trống năng lực tính toán . Amin Vahdat, Phó chủ tịch cloud của Google, cho biết vào tháng 11 năm 2025 rằng công ty sẽ cần tăng gấp đôi năng lực AI sau mỗi sáu tháng để đáp ứng nhu cầu .
Những hạn chế này trực tiếp thúc đẩy Frozen v2: nếu Google có thể đạt được hiệu suất suy luận Gemini cao gấp 6–10 lần trên mỗi watt, họ sẽ nhân hiệu quả năng lực lên một cách đáng kể mà không cần xây dựng thêm trung tâm dữ liệu mới.
Frozen v2 chỉ là một phần trong một chiến lược phần cứng rộng lớn hơn nhiều:
1. TPU thế hệ thứ tám được chia thành chip huấn luyện và suy luận. Tại Cloud Next 2026, Google đã giới thiệu dòng TPU thế hệ thứ tám, lần đầu tiên được chia thành hai biến thể chuyên biệt :
2. Thỏa thuận dài hạn với Broadcom đến năm 2031. Broadcom đã nộp một mẫu đơn 8-K lên SEC tiết lộ một Thỏa thuận Dài hạn (Long Term Agreement) để phát triển và cung cấp TPU tùy chỉnh cho các thế hệ tương lai của Google, cùng với một Thỏa thuận Đảm bảo Cung ứng (Supply Assurance Agreement) cho các thành phần mạng đến năm 2031 . Riêng biệt, Anthropic đã ký một thỏa thuận cho khoảng 3,5 GW năng lực TPU của Google, sẽ đi vào hoạt động từ năm 2027 trở đi .
3. Cho thuê TPU cho khách hàng bao gồm OpenAI. Các báo cáo chỉ ra rằng Google đang ngày càng cung cấp năng lực TPU như một sản phẩm cho thuê cho các công ty AI bên ngoài, với OpenAI được nêu tên là một khách hàng .
4. Dự án "Icefish" với MediaTek. Mã hiệu "Icefish" dường như liên quan đến sự tham gia của MediaTek vào một dự án chip tùy chỉnh cụ thể của Google ngoài TPU 8i — có thể là một bộ tăng tốc suy luận hoặc biên (edge) với công suất thấp hơn .
5. Thảo luận với Intel. Google được cho là đã có các cuộc thảo luận với Intel về các thiết kế chip AI tùy chỉnh, mặc dù chưa có thỏa thuận chính thức nào được công bố .
6. Ironwood (TPU thế hệ thứ bảy) được phát hành rộng rãi. Ironwood đã được phát hành rộng rãi cho khách hàng cloud vào tháng 4 năm 2026 . Được xây dựng trên tiến trình 3nm với kiến trúc dual-chiplet, nó được tối ưu hóa cho các mô hình MoE (Mixture of Experts) hỗ trợ hệ sinh thái Gemini .
Báo cáo của The Information nêu rõ rằng Frozen v2 được thiết kế để bổ sung, chứ không phải thay thế, lộ trình TPU của Google . Logic rất rõ ràng:
Điều này tương tự như cách các hyperscaler sử dụng cả CPU đa năng cho hầu hết các khối lượng công việc và các ASIC chức năng cố định cho các tác vụ khối lượng lớn cụ thể (ví dụ: mã hóa video, giảm tải mạng). Frozen v2 là phiên bản AI của điều này: một engine suy luận chuyên dụng nằm cạnh đội tàu TPU có thể lập trình.