Google đang phát triển 'Frozen v2', một chip máy chủ chuyên dụng (ASIC) 'đóng cứng' kiến trúc mô hình AI Gemini vào silicon, nhằm đạt hiệu suất token/watt cao gấp 6–10 lần so với các TPU mới nhất nhưng chỉ có thể chạy... Dự án này ra đời trong bối cảnh Google đang thiếu hụt trầm trọng năng lực tính toán AI, đến mức...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google đang thực hiện một canh bạc phần cứng lớn nhất từ trước đến nay. Công ty đang phát triển một chip máy chủ, có mã nội bộ là 'Frozen v2', với các thành phần kiến trúc của mô hình AI Gemini được 'đóng cứng' trực tiếp vào silicon như một ASIC chức năng cố định. Thông tin này lần đầu được The Information đưa tin vào ngày 20 tháng 7 năm 2026, cho thấy dự án này nhằm cải thiện đáng kể hiệu suất token/watt cho việc phục vụ mô hình Gemini, nhưng cái giá phải trả là không bao giờ có thể chạy một mô hình nào khác .
Frozen v2 là một engine suy luận chuyên biệt cho ứng dụng (application-specific inference engine), không phải là một bộ xử lý tensor đa năng như Tensor Processing Units (TPUs) của Google. TPU là những bộ tăng tốc có thể lập trình, hỗ trợ nhiều loại mô hình AI thông qua cấu hình phần mềm . Frozen v2 thì ngược lại: kiến trúc cụ thể của Gemini — các lớp, toán tử và luồng dữ liệu — được 'đốt cháy' vào chip ngay tại thời điểm sản xuất, biến nó thành một 'Gemini-trong-một-chip' chuyên dụng.
Hiệu suất vượt trội là điểm nhấn: các kỹ sư của Google dự kiến Frozen v2 có thể cung cấp lượng token AI nhiều gấp 6 đến 10 lần trên mỗi đơn vị năng lượng tiêu thụ so với các chip TPU mới nhất .
Theo báo cáo của The Information và các nguồn tin xác nhận, Frozen v2 dự kiến được triển khai sớm nhất vào năm 2028 . Điều này có nghĩa là con chip này vẫn còn cách xa thời điểm sản xuất và sẽ chỉ được đưa vào hoạt động sau khi thế hệ TPU thứ tám hiện tại (Sunfish và Zebrafish) đã được triển khai và hoàn thiện.
Startup Taalas cho thấy rõ ràng sự đánh đổi này có ý nghĩa gì trong thực tế. Vào tháng 2 năm 2026, Taalas đã công bố chip HC1, 'đóng cứng' toàn bộ mô hình Llama 3.1 8B — mọi tham số — trực tiếp vào các mạch bán dẫn của chip bằng mask ROM, hoàn toàn không cần HBM bên ngoài để lưu trữ trọng số .
Các con số thật ấn tượng:
Mặt trái cũng không kém phần ấn tượng:
Nhà sáng lập Taalas mô tả kiến trúc này kết hợp 'mask ROM recall fabric' với 'SRAM recall fabric' để lưu trữ cả mô hình và thực hiện mọi phép toán KV cache ngay trên chip, loại bỏ hoàn toàn việc di chuyển bộ nhớ ra bên ngoài . Đây cũng chính là cách tiếp cận cơ bản mà Frozen v2 sẽ sử dụng.
Năng lực tính toán AI của Google đang bị căng thẳng đến mức họ đã phải phân bổ hạn chế (rationing) quyền truy cập ngay cả với những 'gã khổng lồ' đang trả tiền. Một số dữ liệu cho thấy rõ động lực này:
Vụ từ chối năng lực với Meta (tháng 3 năm 2026): Google đã nói với Meta vào tháng 3 năm 2026 rằng họ không thể cung cấp toàn bộ năng lực tính toán Gemini mà Meta muốn mua . Sự thiếu hụt này đã làm trì hoãn một số dự án AI nội bộ của Meta và buộc Meta phải yêu cầu các kỹ sư của mình tiết kiệm token AI
.
Các con số về khoản tồn đọng: Khoản tồn đọng đơn hàng (backlog) của Google Cloud gần như tăng gấp đôi lên 462 tỷ USD trong quý 1 năm 2026, đại diện cho nhu cầu lớn gấp khoảng 23 lần năng lực xử lý hiện có . CEO Sundar Pichai đã xác nhận trong cuộc gọi báo cáo thu nhập: "Trong ngắn hạn, chúng tôi bị hạn chế về năng lực tính toán... doanh thu từ cloud của chúng tôi sẽ cao hơn nếu chúng tôi có thể đáp ứng nhu cầu đó"
.
Áp lực năng lực rộng hơn: Google thậm chí đang thuê khoảng 920 triệu USD mỗi tháng GPU Nvidia từ SpaceX để lấp đầy khoảng trống năng lực tính toán . Amin Vahdat, Phó chủ tịch cloud của Google, cho biết vào tháng 11 năm 2025 rằng công ty sẽ cần tăng gấp đôi năng lực AI sau mỗi sáu tháng để đáp ứng nhu cầu
.
Những hạn chế này trực tiếp thúc đẩy Frozen v2: nếu Google có thể đạt được hiệu suất suy luận Gemini cao gấp 6–10 lần trên mỗi watt, họ sẽ nhân hiệu quả năng lực lên một cách đáng kể mà không cần xây dựng thêm trung tâm dữ liệu mới.
Frozen v2 chỉ là một phần trong một chiến lược phần cứng rộng lớn hơn nhiều:
1. TPU thế hệ thứ tám được chia thành chip huấn luyện và suy luận. Tại Cloud Next 2026, Google đã giới thiệu dòng TPU thế hệ thứ tám, lần đầu tiên được chia thành hai biến thể chuyên biệt :
2. Thỏa thuận dài hạn với Broadcom đến năm 2031. Broadcom đã nộp một mẫu đơn 8-K lên SEC tiết lộ một Thỏa thuận Dài hạn (Long Term Agreement) để phát triển và cung cấp TPU tùy chỉnh cho các thế hệ tương lai của Google, cùng với một Thỏa thuận Đảm bảo Cung ứng (Supply Assurance Agreement) cho các thành phần mạng đến năm 2031 . Riêng biệt, Anthropic đã ký một thỏa thuận cho khoảng 3,5 GW năng lực TPU của Google, sẽ đi vào hoạt động từ năm 2027 trở đi
.
3. Cho thuê TPU cho khách hàng bao gồm OpenAI. Các báo cáo chỉ ra rằng Google đang ngày càng cung cấp năng lực TPU như một sản phẩm cho thuê cho các công ty AI bên ngoài, với OpenAI được nêu tên là một khách hàng .
4. Dự án "Icefish" với MediaTek. Mã hiệu "Icefish" dường như liên quan đến sự tham gia của MediaTek vào một dự án chip tùy chỉnh cụ thể của Google ngoài TPU 8i — có thể là một bộ tăng tốc suy luận hoặc biên (edge) với công suất thấp hơn .
5. Thảo luận với Intel. Google được cho là đã có các cuộc thảo luận với Intel về các thiết kế chip AI tùy chỉnh, mặc dù chưa có thỏa thuận chính thức nào được công bố .
6. Ironwood (TPU thế hệ thứ bảy) được phát hành rộng rãi. Ironwood đã được phát hành rộng rãi cho khách hàng cloud vào tháng 4 năm 2026 . Được xây dựng trên tiến trình 3nm với kiến trúc dual-chiplet, nó được tối ưu hóa cho các mô hình MoE (Mixture of Experts) hỗ trợ hệ sinh thái Gemini
.
Báo cáo của The Information nêu rõ rằng Frozen v2 được thiết kế để bổ sung, chứ không phải thay thế, lộ trình TPU của Google . Logic rất rõ ràng:
Điều này tương tự như cách các hyperscaler sử dụng cả CPU đa năng cho hầu hết các khối lượng công việc và các ASIC chức năng cố định cho các tác vụ khối lượng lớn cụ thể (ví dụ: mã hóa video, giảm tải mạng). Frozen v2 là phiên bản AI của điều này: một engine suy luận chuyên dụng nằm cạnh đội tàu TPU có thể lập trình.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google đang phát triển 'Frozen v2', một chip máy chủ chuyên dụng (ASIC) 'đóng cứng' kiến trúc mô hình AI Gemini vào silicon, nhằm đạt hiệu suất token/watt cao gấp 6–10 lần so với các TPU mới nhất nhưng chỉ có thể chạy...
Google đang phát triển 'Frozen v2', một chip máy chủ chuyên dụng (ASIC) 'đóng cứng' kiến trúc mô hình AI Gemini vào silicon, nhằm đạt hiệu suất token/watt cao gấp 6–10 lần so với các TPU mới nhất nhưng chỉ có thể chạy... Dự án này ra đời trong bối cảnh Google đang thiếu hụt trầm trọng năng lực tính toán AI, đến mức phải hạn chế cung cấp cho cả Meta, với khoản tồn đọng đơn hàng lên tới 460 tỷ USD.
Startup Taalas đã chứng minh khái niệm này: chip HC1 của họ 'đóng cứng' toàn bộ mô hình Llama 3.1 8B vào silicon, đạt 17.000 token/giây và chi phí thấp hơn 20 lần so với GPU, nhưng bị khóa cứng với một mô hình duy nhấ...