גוגל סיפקה נקודות ביקורת רשמיות של QAT (אימון מודע קוונטיזציה) למשפחת Gemma 4, הכוללת דגמים בגדלים E2B, E4B, 12B, 26B A4B ו 31B [1][4][5]. טכנולוגיית הקוונטיזציה מפחיתה את דיוק הערכים המספריים לאחסון וחישוב, כש int4 מייצג כל מספר ב 4 סיביות לעומת 16 סיביות בדיוק BF16 [2].

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
גוגל סיפקה נקודות ביקורת רשמיות של אימון מודע קוונטיזציה (Quantization-Aware Training, או בקיצור QAT) עבור סדרת Gemma 4. המגוון כולל את הדגמים E2B, E4B, 12B, 26B A4B ו-31B . המטרה היא לאפשר הרצה של בינה מלאכותית מתקדמת על מכשירים עם משאבים מוגבלים, כמו סמארטפונים. הנה כל מה שאתם צריכים לדעת.
קוונטיזציה היא תהליך שמקטין את הדיוק המספרי המשמש לאחסון וחישוב של הפרמטרים במודל. בשיטת int4, כל ערך מיוצג בעזרת 4 סיביות בלבד, במקום 16 סיביות (BF16). זהו קיצוץ של פי 4 בגודל הנתונים .
החידוש בגישה של גוגל הוא שיטת ה-QAT. בניגוד לקוונטיזציה רגילה שמתבצעת לאחר סיום האימון (Post-Training Quantization) ועלולה לפגוע באיכות, אימון מודע קוונטיזציה משלב סימולציה של תהליך הכיווץ במהלך שלב האימון עצמו. המודל לומד לפצות על אובדן הדיוק, וכך ניתן לשמר ביצועים קרובים למקור תוך שימוש בזיכרון קטן משמעותית .
נקודות הביקורת הרשמיות משתמשות בסכמה בשם W4A16 עבור דגמי ה-dense במשפחת Gemma 4. פירוש הדבר הוא שימוש במשקלים (weights) באורך 4 סיביות (int4) והפעלות (activations) באורך 16 סיביות בפורמט compressed-tensors, עם group_size=32 .
סדרת Gemma 4 זמינה בחמישה גדלים: E2B, E4B, 12B, 26B A4B ו-31B . השימוש בקוונטיזציה של QAT ב-4 סיביות מפחית את דרישות הזיכרון בכ-72% תוך שמירה על ביצועים הקרובים למקור
.
חשוב להדגיש: באותה רמת דיוק של 4 סיביות, שיטת QAT שומרת על איכות גבוהה בהרבה לעומת המרה פשוטה (
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
גוגל סיפקה נקודות ביקורת רשמיות של QAT (אימון מודע קוונטיזציה) למשפחת Gemma 4, הכוללת דגמים בגדלים E2B, E4B, 12B, 26B A4B ו 31B [1][4][5].
גוגל סיפקה נקודות ביקורת רשמיות של QAT (אימון מודע קוונטיזציה) למשפחת Gemma 4, הכוללת דגמים בגדלים E2B, E4B, 12B, 26B A4B ו 31B [1][4][5]. טכנולוגיית הקוונטיזציה מפחיתה את דיוק הערכים המספריים לאחסון וחישוב, כש int4 מייצג כל מספר ב 4 סיביות לעומת 16 סיביות בדיוק BF16 [2].
שיטת QAT מאמנת את המודל תוך התחשבות בקוונטיזציה, מה שמאפשר לפריסות ב 4 סיביות לשמר ביצועים קרובים למקור תוך שימוש בזיכרון קטן בהרבה [5].