Frozen v2 הוא מנוע הסקה ייעודי ליישום ספציפי, ולא מעבד טנזור כללי כמו יחידות עיבוד הטנזור (TPU) של גוגל. TPU הם מאיצים הניתנים לתכנות התומכים במגוון רחב של מודלי AI באמצעות תצורת תוכנה מחדש . Frozen v2 הוא ההפך הגמור: הארכיטקטורה הספציפית של Gemini — השכבות, האופרטורים ותזרים הנתונים שלה — נצרבים בשבב בזמן הייצור, מה שהופך אותו למכשיר יחיד-תכליתי המכונה "Gemini-on-a-chip".
| מאפיין | TPU קיימים (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| פילוסופיית עיצוב | מאיץ AI כללי; יחידות מטריצה ניתנות לתכנות, תזרים נתונים גמיש | ASIC בעל תפקוד קבוע; הארכיטקטורה של Gemini משובצת בסיליקון, אינה ניתנת לתכנות בשטח |
| יעד יעילות | טוב לאימון והסקה על פני מודלים רבים | פי 6–10 יותר טוקנים לוואט מה-TPU החדשים ביותר של גוגל בהסקת Gemini |
| מודל זיכרון | HBM + SRAM עבור משקלי מודל הנטענים באופן דינמי | משקלי מודל ונתיבי חישוב משובצים ישירות ב-Mask ROM / לוגיקה חוטית |
| גמישות | יכול להריץ כל מודל באמצעות תצורת תוכנה מחדש | מודל אחד (Gemini) — אין מעבר בין מודלים בזמן ריצה |
שיפור היעילות הוא הכותרת הראשית: מהנדסי גוגל מעריכים כי Frozen v2 יוכל לספק פי 6 עד 10 יותר טוקני AI ליחידת צריכת חשמל מאשר שבבי ה-TPU העדכניים ביותר .
על פי דו"ח The Information וסיקור מחזק, Frozen v2 מיועד לפריסה כבר בשנת 2028 . המשמעות היא שהשבב עדיין רחוק שנים מייצור, וייכנס לשירות רק לאחר שדור משפחת TPU השמיני הנוכחי (Sunfish ו-Zebrafish) ייפרס ויבשיל.
הסטארט-אפ Taalas מדגים בדיוק את הפשרה שהגישה הזו כרוכה בה. בפברואר 2026 חשפה Taalas את שבב HC1 שלה, שמקודד את כל מודל Llama 3.1 8B — כל פרמטר — ישירות לתוך מעגלי הטרנזיסטור של השבב באמצעות Mask ROM, ללא HBM חיצוני לאחסון משקלים .
הנתונים מדהימים:
החיסרון דרמטי לא פחות:
מייסד Taalas תיאר את הארכיטקטורה כשילוב של "רקמת שליפת Mask ROM" עם רקמת שליפת SRAM לאחסון המודל וחישוב כל פעולות מטמון KV על השבב, תוך ביטול מוחלט של תנועת זיכרון חיצונית . זוהי אותה גישה בסיסית ש-Frozen v2 ישתמש בה.
קיבולת מחשוב ה-AI של גוגל כל כך לחוצה עד שהיא החלה לרסן גישה אפילו לענקיות משלמות. מספר נקודות נתונים מבהירות את המניע:
סירוב הקיבולת למטא (מרץ 2026): גוגל אמרה למטא במרץ 2026 שהיא לא תוכל לספק את כל קיבולת החישוב של Gemini שמטא רצתה לרכוש . המחסור עיכב כמה מפרויקטי ה-AI הפנימיים של מטא ואילץ את מטא להורות למהנדסיה לחסוך בטוקני AI .
נתוני צבר הזמנות: צבר ההזמנות של Google Cloud כמעט הוכפל ל-462 מיליארד דולר ברבעון הראשון של 2026, המייצג ביקוש של בערך פי 23 מקיבולת העיבוד הזמינה שלה . המנכ"ל סונדאר פיצ'אי אישר בשיחת הרווחים: "אנחנו מוגבלים חישובית בטווח הקרוב... ההכנסות שלנו מענן היו גבוהות יותר אם היינו יכולים לעמוד בביקוש הזה" .
מחסור רחב יותר: גוגל אף שוכרת כ-920 מיליון דולר לחודש ב-GPU של Nvidia מ-SpaceX כדי לגשר על פער החישוב שלה . סגן נשיא Google Cloud, אמין והדאת, אמר בנובמבר 2025 שהחברה תצטרך להכפיל את קיבולת ה-AI כל שישה חודשים כדי לעמוד בביקוש .
אילוצים אלו מניעים ישירות את Frozen v2: אם גוגל תוכל לקבל פי 6–10 יותר הסקת Gemini לוואט, היא מכפילה למעשה את הקיבולת מבלי להזדקק למרכזי נתונים חדשים.
Frozen v2 הוא חלק אחד מאסטרטגיית חומרה רחבה בהרבה:
1. דור שמיני של TPU שמתפצל לשבבי אימון והסקה. ב-Cloud Next 2026, גוגל הציגה את משפחת ה-TPU מהדור השמיני, שהתפצלה לראשונה לשני דגמים ייעודיים :
2. הסכם ארוך טווח עם Broadcom עד 2031. Broadcom הגישה 8-K ל-SEC החושפת הסכם ארוך טווח (Long Term Agreement) לפיתוח ואספקת TPU מותאמים אישית לדורות העתידיים של גוגל, بالإضافة להסכם אספקה מובטחת (Supply Assurance Agreement) לרכיבי רשת עד 2031 . במקביל, Anthropic חתמה על עסקה לכ-3.5 ג'יגה-ואט של קיבולת TPU של גוגל, שתיכנס לפעולה מ-2027 ואילך .
3. השכרת TPU ללקוחות כולל OpenAI. דיווחים מצביעים על כך שגוגל מציעה יותר ויותר קיבולת TPU כמוצר השכרה לחברות AI חיצוניות, כאשר OpenAI נקראת כלקוחה .
4. פרויקט "Icefish" עם MediaTek. שם הקוד "Icefish" מופיע בהקשר למעורבות של MediaTek בפרויקט שבב מותאם אישית ספציפי לגוגל מעבר ל-TPU 8i — אולי מאיץ קצה או הסקה בעל הספק נמוך .
5. דיונים עם Intel. על פי דיווחים, גוגל ניהלה דיונים עם Intel בנוגע לעיצובי שבבי AI מותאמים אישית, אם כי לא הוכרז על הסכם רשמי .
6. Ironwood (דור שביעי של TPU) זמין באופן כללי. Ironwood הפך לזמין באופן כללי ללקוחות הענן באפריל 2026 . בנוי בתהליך 3nm עם ארכיטקטורת dual-chiplet, הוא עבר אופטימיזציה עבור מודלי MoE המניעים את מערכת Gemini .
הדיווח של The Information קובע במפורש כי Frozen v2 נועד להשלים, לא להחליף, את מפת הדרכים של TPU של גוגל . ההיגיון פשוט:
זה אנלוגי לאופן שבו ענקיות האינטרנט משתמשות גם במעבדים לשימוש כללי (CPUs) עבור רוב עומסי העבודה וגם ב-ASIC ייעודיים למשימות ספציפיות בעלות נפח גבוה (כמו קידוד וידאו, ניתוב רשת). Frozen v2 הוא המקבילה בתחום ה-AI: מנוע הסקה ייעודי שיושב לצד צי ה-TPU הניתן לתכנות.