Frozen v2 คือ เอ็นจินอินเฟอเรนซ์ที่เฉพาะเจาะจงกับแอปพลิเคชัน (application-specific inference engine) ไม่ใช่โปรเซสเซอร์เทนเซอร์ทั่วไปอย่าง Tensor Processing Units (TPUs) ของ Google TPUs เป็นตัวเร่งความเร็วที่ตั้งโปรแกรมได้ซึ่งรองรับโมเดล AI ที่หลากหลายผ่านการกำหนดค่าซอฟต์แวร์ Frozen v2 ตรงกันข้าม: สถาปัตยกรรมเฉพาะของ Gemini (เลเยอร์ โอเปอเรเตอร์ และ dataflow) จะถูกฝังลงในชิปตั้งแต่ขั้นตอนการผลิต ทำให้มันเป็น 'Gemini-in-a-chip' แบบวัตถุประสงค์เดียว
| มิติ | TPUs ที่มีอยู่ (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| ปรัชญาการออกแบบ | ตัวเร่งความเร็ว AI แบบเอนกประสงค์; หน่วยเมทริกซ์ที่ตั้งโปรแกรมได้, dataflow ที่ยืดหยุ่น | ASIC ฟังก์ชันคงที่; สถาปัตยกรรมของ Gemini ถูกฝังในซิลิคอน ไม่สามารถตั้งโปรแกรมในภาคสนามได้ |
| เป้าหมายประสิทธิภาพ | ดีสำหรับการเทรนและอินเฟอเรนซ์ในหลายโมเดล | 6–10x tokens ต่อวัตต์มากกว่า TPU รุ่นใหม่ที่สุดของ Google บนอินเฟอเรนซ์ Gemini |
| โมเดลหน่วยความจำ | HBM + SRAM สำหรับโหลดน้ำหนักโมเดลแบบไดนามิก | น้ำหนักโมเดลและเส้นทางการคำนวณถูกฝังโดยตรงใน mask ROM / วงจรลอจิกแบบตายตัว |
| ความยืดหยุ่น | สามารถรันโมเดลใดก็ได้ผ่านการกำหนดค่าซอฟต์แวร์ | หนึ่งโมเดล (Gemini) — ไม่มีการสลับโมเดลขณะรันไทม์ |
ประสิทธิภาพที่เพิ่มขึ้นคือประเด็นสำคัญ: วิศวกรของ Google รายงานว่า Frozen v2 สามารถส่ง tokens AI ได้มากกว่า 6 ถึง 10 เท่าต่อหน่วยการใช้พลังงาน เมื่อเทียบกับชิป TPU รุ่นล่าสุด
ตามรายงานของ The Information และข่าวที่ยืนยันข้อมูล Frozen v2 มีเป้าหมายในการปรับใช้ ภายในปี 2028 เป็นอย่างเร็วที่สุด ซึ่งหมายความว่าชิปนี้ยังต้องใช้เวลาอีกหลายปีกว่าจะผลิต และจะเริ่มให้บริการหลังจากตระกูล TPU เจนเนอเรชั่นที่ 8 (Sunfish และ Zebrafish) ถูกปรับใช้และมีความสมบูรณ์แล้วเท่านั้น
สตาร์ทอัพ Taalas แสดงให้เห็นว่าการแลกเปลี่ยนนี้หมายถึงอะไรในทางปฏิบัติ ในเดือนกุมภาพันธ์ 2026 Taalas เปิดตัว ชิป HC1 ซึ่งเข้ารหัสโมเดล Llama 3.1 8B ทั้งตัว — ทุกพารามิเตอร์ — ลงในวงจรทรานซิสเตอร์ของชิปโดยตรงโดยใช้ mask ROM โดยไม่มี HBM ภายนอกสำหรับจัดเก็บน้ำหนัก
ตัวเลขที่น่าทึ่ง:
ข้อเสียก็รุนแรงไม่แพ้กัน:
ผู้ก่อตั้ง Taalas อธิบายสถาปัตยกรรมนี้ว่าจับคู่ 'mask ROM recall fabric' กับ SRAM recall fabric เพื่อจัดเก็บทั้งโมเดลและดำเนินการคำนวณ KV cache ทั้งหมดบนชิป ขจัดการเคลื่อนย้ายหน่วยความจำภายนอกทั้งหมด นี่เป็นแนวทางพื้นฐานเดียวกับที่ Frozen v2 จะใช้
กำลังการประมวลผล AI ของ Google ตึงตัวมากถึงขนาดที่บริษัทเริ่มปันส่วนการเข้าถึงแม้แต่กับยักษ์ใหญ่ที่จ่ายเงิน ข้อมูลหลายจุดทำให้เห็นถึงแรงจูงใจที่ชัดเจน:
การปฏิเสธกำลังการประมวลผลของ Meta (มีนาคม 2026): Google บอกกับ Meta ในเดือนมีนาคม 2026 ว่าไม่สามารถจัดหากำลังประมวลผล Gemini ทั้งหมดที่ Meta ต้องการซื้อได้ การขาดแคลนนี้ทำให้โปรเจกต์ AI ภายในบางโปรเจกต์ของ Meta ล่าช้า และบังคับให้ Meta สั่งให้วิศวกรของตนอนุรักษ์ Tokens AI
ตัวเลข Backlog: คำสั่งซื้อที่ค้างส่งของ Google Cloud เกือบสองเท่าเป็น 462 พันล้านดอลลาร์ ในไตรมาส 1 ปี 2026 ซึ่งเป็นความต้องการที่มากกว่ากำลังการประมวลผลที่มีอยู่ประมาณ 23 เท่า CEO Sundar Pichai ยืนยันในการประชุมผลประกอบการ: 'เรามีข้อจำกัดด้านการประมวลผลในระยะสั้น... รายได้คลาวด์ของเราจะสูงขึ้นหากเราสามารถตอบสนองความต้องการนั้นได้'
กำลังการผลิตที่ตึงตัวในวงกว้าง: Google ถึงกับเช่า GPU Nvidia มูลค่าประมาณ 920 ล้านดอลลาร์ต่อเดือนจาก SpaceX เพื่อเติมเต็มช่องว่างด้านการประมวลผล Amin Vahdat รองประธานฝ่ายคลาวด์ของ Google กล่าวในเดือนพฤศจิกายน 2025 ว่าบริษัทจะต้องเพิ่มกำลังการผลิต AI เป็นสองเท่าทุก ๆ หกเดือนเพื่อตอบสนองความต้องการ
ข้อจำกัดเหล่านี้เป็นแรงจูงใจโดยตรงต่อ Frozen v2: หาก Google สามารถเพิ่มอินเฟอเรนซ์ Gemini ได้ 6–10x ต่อวัตต์ ก็เท่ากับเป็นการเพิ่มกำลังการผลิตอย่างมีประสิทธิภาพโดยไม่ต้องสร้างดาต้าเซ็นเตอร์ใหม่
Frozen v2 เป็นเพียงส่วนหนึ่งของกลยุทธ์ฮาร์ดแวร์ที่กว้างขึ้น:
1. ตระกูล TPU เจนเนอเรชั่นที่ 8 แบ่งเป็นชิปสำหรับเทรนและอินเฟอเรนซ์ ที่ Cloud Next 2026 Google เปิดตัวตระกูล TPU เจนเนอเรชั่นที่ 8 ซึ่งเป็นครั้งแรกที่แบ่งออกเป็นสองรุ่นที่ออกแบบมาเพื่อวัตถุประสงค์เฉพาะ :
2. ข้อตกลงระยะยาวกับ Broadcom จนถึงปี 2031 Broadcom ยื่นแบบฟอร์ม 8-K ต่อ SEC เปิดเผยข้อตกลงระยะยาว (Long Term Agreement) ในการพัฒนาและจัดหา TPU ที่กำหนดเองสำหรับ Google รุ่นอนาคต รวมถึงข้อตกลงการรับประกันอุปทาน (Supply Assurance Agreement) สำหรับส่วนประกอบเครือข่ายจนถึงปี 2031 นอกจากนี้ Anthropic ได้เซ็นสัญญาสำหรับกำลังการผลิต TPU ของ Google ประมาณ 3.5 GW ซึ่งจะเริ่มใช้งานตั้งแต่ปี 2027 เป็นต้นไป
3. การให้เช่า TPU แก่ลูกค้ารวมถึง OpenAI รายงานระบุว่า Google เสนอความจุ TPU เป็นผลิตภัณฑ์ให้เช่าแก่บริษัท AI ภายนอกมากขึ้น โดยมี OpenAI เป็นลูกค้ารายหนึ่ง
4. โปรเจกต์ 'Icefish' กับ MediaTek รหัส 'Icefish' ดูเหมือนจะเชื่อมโยงกับการมีส่วนร่วมของ MediaTek ในโปรเจกต์ชิปที่กำหนดเองเฉพาะของ Google ที่นอกเหนือไปจาก TPU 8i — ซึ่งอาจเป็นเอจหรือตัวเร่งความเร็วอินเฟอเรนซ์ที่ใช้พลังงานต่ำ
5. การหารือกับ Intel Google มีรายงานว่าได้หารือกับ Intel เกี่ยวกับการออกแบบชิป AI ที่กำหนดเอง แม้ว่าจะยังไม่มีการประกาศข้อตกลงอย่างเป็นทางการ
6. Ironwood (TPU เจนเนอเรชั่นที่ 7) พร้อมใช้งานทั่วไป Ironwood เปิดให้บริการแก่ลูกค้าคลาวด์โดยทั่วไปในเดือนเมษายน 2026 สร้างบนกระบวนการ 3nm ด้วยสถาปัตยกรรม dual-chiplet ได้รับการปรับให้เหมาะสมสำหรับโมเดล MoE ที่ขับเคลื่อนระบบนิเวศ Gemini
รายงานของ The Information ระบุอย่างชัดเจนว่า Frozen v2 ถูก ออกแบบมาเพื่อเสริม ไม่ใช่แทนที่ แผนงาน TPU ของ Google เหตุผลนั้นตรงไปตรงมา:
สิ่งนี้คล้ายคลึงกับวิธีที่ผู้ให้บริการคลาวด์รายใหญ่ใช้ทั้ง CPU แบบเอนกประสงค์สำหรับงานส่วนใหญ่ และ ASIC แบบฟังก์ชันคงที่สำหรับงานปริมาณสูงที่เฉพาะเจาะจง (เช่น การแปลงรหัสวิดีโอ การลดภาระงานเครือข่าย) Frozen v2 คือสิ่งที่เทียบเท่ากับ AI: เอ็นจินอินเฟอเรนซ์ที่สร้างขึ้นตามวัตถุประสงค์ซึ่งทำงานเคียงข้างกับกองเรือ TPU ที่ตั้งโปรแกรมได้