Google släpper officiella QAT checkpoints (Quantization Aware Training) för Gemma 4 familjen i storlekarna E2B, E4B, 12B, 26B A4B och 31B [1][4][5]. QAT tekniken simulerar komprimering redan under träningen, vilket ger nära originalprestanda trots att minnesanvändningen minskar med omkring 72 % [5].

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Google har tagit ett stort kliv mot att göra avancerad AI tillgänglig för alla. Den 4 juni 2026 släppte de officiella QAT-checkpoints (Quantization-Aware Training) för hela Gemma 4-familjen. Detta innebär att modeller som tidigare krävde kraftfulla server-GPU:er nu kan köras lokalt på allt från din mobiltelefon till en vanlig speldator – med bibehållen hög prestanda .
Traditionell komprimering, så kallad Post-Training Quantization (PTQ), sker efter att modellen är färdigtränad. Detta kan liknas vid att försöka pressa ner en fullvuxen elefant i en handväska – resultatet blir ofta en märkbar kvalitetsförlust .
Quantization-Aware Training (QAT) använder en smartare metod. Redan under träningen simulerar modellen den lägre numeriska precision (int4 istället för BF16) som den senare ska komprimeras till. Modellen lär sig alltså att kompensera för den precision som går förlorad, vilket gör att den presterar nästan lika bra som originalet, trots att den bara tar upp en bråkdel av minnet .
Förenklat kan man säga att Gemma 4 QAT-modellerna är ungefär 72 % minnessnålare än sina BF16-förlagor, utan att bli märkbart "dummare" .
Gemma 4-familjen består av fem modeller, alla nu tillgängliga i QAT-optimerade versioner. Tabellen nedan ger en överblick över de ungefärliga minnesbehoven i 4-bitarsläge .
Det är värt att notera att den officiella QAT-dokumentationen varnar för att en naiv konvertering till det populära Q4_0-formatet drastiskt kan sänka kvaliteten. För 26B-modellen nådde en sådan konvertering till exempel bara 70,2 % top-1 noggrannhet, vilket understryker hur viktigt det är att använda rätt format för ändamålet .
Google tillhandahåller flera olika format för olika behov och plattformar :
Släppet av Gemma 4 QAT suddar ut gränsen mellan vad som är "server-AI" och "fick-AI". Här är några konkreta scenarier:
Om det finns en röd tråd i Gemma 4 QAT-dokumentationen så är det denna: välj rätt format. Eftersom QAT-modellerna är specifikt tränade för att fungera bra i ett visst kvantiserat format, kan en godtycklig konvertering till ett annat format (som Q4_0) leda till en dramatisk kvalitetsförsämring . Vill du vara på den säkra sidan och bevara de prestandaförbättringar som QAT ger, ska du hålla dig till de officiella, QAT-orienterade formaten som
compressed-tensors .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google släpper officiella QAT checkpoints (Quantization Aware Training) för Gemma 4 familjen i storlekarna E2B, E4B, 12B, 26B A4B och 31B [1][4][5].
Google släpper officiella QAT checkpoints (Quantization Aware Training) för Gemma 4 familjen i storlekarna E2B, E4B, 12B, 26B A4B och 31B [1][4][5]. QAT tekniken simulerar komprimering redan under träningen, vilket ger nära originalprestanda trots att minnesanvändningen minskar med omkring 72 % [5].
En ny mobiloptimerad kvantisering pressar ner minnesbehovet för den minsta modellen E2B till endast 1 GB – perfekt för telefoner och surfplattor [5][13].