Google har offentliggjort officielle QAT checkpoints (Quantization Aware Training) til hele Gemma 4 familien, der omfatter E2B, E4B, 12B, 26B A4B og 31B [1][4][5]. QAT metoden simulerer kvantisering allerede under træning, så de 4 bit komprimerede modeller bevarer næsten samme kvalitet som de originale 16 bit versio...

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Google har taget et bemærkelsesværdigt skridt for at gøre avancerede, åbne AI-modeller tilgængelige på helt almindeligt forbrugerudstyr. Den 5. juni 2025 offentliggjorde de officielle QAT-checkpoints (Quantization-Aware Training) til hele deres nye Gemma 4-serie . Det er en teknik, der gør det muligt at skære op mod 72 % af hukommelsesforbruget, uden at modellernes præcision forringes nævneværdigt
.
Kvantisering handler i bund og grund om at reducere præcisionen af de tal, en AI-model gemmer og regner med. Hvor en model normalt bruger 16-bit (BF16) til hver vægt, nøjes en 4-bit (int4) model med kun 4 bit – en firdobling af effektiviteten .
Traditionel efter-træningskvantisering (PTQ) komprimerer en færdigtrænet model, hvilket ofte koster på kvaliteten. QAT er smartere: Her simuleres kvantiseringen allerede under træningsprocessen, så modellen lærer at kompensere for det præcisionstab, der opstår . Google sammenligner det med, at modellen bliver "trænet med komprimeringen i tankerne", hvilket resulterer i en 4-bit udgave, der performer næsten identisk med originalen
.
Google har gjort QAT-checkpoints tilgængelige for alle fem størrelser i Gemma 4-serien, som spænder fra ultra-mobil til krævende opgaver. Det officielle format for dense-modellerne er W4A16, hvilket betyder 4-bit heltalsvægte og 16-bit aktiveringer .
De komprimerede modeller frigør markant plads, men det er vigtigt at forstå, at 26B A4B er en MoE-model (Mixture-of-Experts), der ved hvert token kun aktiverer ca. 3,8 af sine 26 milliarder parametre. Det giver en meget effektiv inferens-profil, der ligner en langt mindre model i praksis .
Google udgiver QAT-modellerne i flere formater for at sikre bred kompatibilitet:
Vigtig advarsel: QAT’s fordel er størst ved 4-bit. Hvis man naivt konverterer QAT-vægte til et Q4_0-format uden om de officielle pipelines, kan kvaliteten falde dramatisk. For 26B-modellen er der set et fald i top-1 nøjagtighed til blot 70,2 %
. Brug derfor altid de officielle QAT-orienterede formater for at bevare kvaliteten
.
Den praktiske konsekvens er, at AI-landskabet på forbrugerhardware rykkes markant.
Det er ikke længere nødvendigt med et serverkort til titusindvis af kroner for at eksperimentere med topmodellerne. QAT rykker avanceret, multimodal AI ned på forbrugerens skrivebord og ned i lommen.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google har offentliggjort officielle QAT checkpoints (Quantization Aware Training) til hele Gemma 4 familien, der omfatter E2B, E4B, 12B, 26B A4B og 31B [1][4][5].
Google har offentliggjort officielle QAT checkpoints (Quantization Aware Training) til hele Gemma 4 familien, der omfatter E2B, E4B, 12B, 26B A4B og 31B [1][4][5]. QAT metoden simulerer kvantisering allerede under træning, så de 4 bit komprimerede modeller bevarer næsten samme kvalitet som de originale 16 bit versioner [5].
Hukommelsesforbruget reduceres med ca. 72 % – Gemma 4 E2B modellen kan med en ny mobil optimering komme helt ned på 1 GB [5][12].