Google vydal modely Gemma 4 s oficiálními QAT checkpointy v pěti velikostech: E2B, E4B, 12B, 26B A4B a 31B [1][4][5]. Díky kvantizačně uvědomělému tréninku (QAT) si 4bitové modely drží kvalitu srovnatelnou s originálem, přičemž využívají přibližně o 72 % méně paměti [5].

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Google oficiálně vydal kvantizačně uvědomělé trénovací checkpointy (Quantization-Aware Training, zkráceně QAT) pro celou rodinu modelů Gemma 4. Ta nyní obsahuje pět velikostí: E2B, E4B, 12B, 26B A4B a 31B . Klíčovou výhodou je dramatické snížení paměťových nároků, díky kterému lze špičkové modely spustit i na slabším spotřebitelském hardwaru.
Při kvantizaci modelu se snižuje počet bitů, kterými jsou reprezentovány jeho váhy a aktivace. Běžná přesnost BF16 využívá 16 bitů na každou hodnotu, zatímco int4 si vystačí se 4 bity – to znamená až čtyřnásobnou úsporu dat . Běžná post-tréninková kvantizace (PTQ) ale často vede ke ztrátě kvality odpovědí.
Kvantizačně uvědomělý trénink tento problém řeší simulováním kvantizace už ve fázi trénování. Model se tak naučí přesnost kompenzovat, takže výsledná 4bitová verze podává výkon blízký původnímu 16bitovému modelu . U modelů Gemma 4 se používá schéma W4A16 – to znamená 4bitové váhy, 16bitové aktivace,
group_size=32 a formát compressed-tensors .
Zatímco plné 16bitové verze potřebují desítky gigabajtů paměti, QAT 4bitové varianty přinášejí zhruba 72% úsporu . V tabulce uvádíme předpokládanou operační paměť pro 4bitový chod:
QAT je klíčové právě pro 4bitové nasazení, protože běžný převod do Q4_0 by znamenal citelný propad přesnosti. Například u modelu 26B klesla top-1 přesnost po naivním převodu na asi 70,2 %, zatímco oficiální QAT orientované formáty si drží podstatně vyšší kvalitu .
Google zveřejnil několik typů checkpointů: unquantized QAT, GGUF (Q4_0), compressed-tensors a mobilní formát. Pro mobily vznikla speciální směs kvantizačních šířek optimalizovaná pro E2B a E4B, která umožnila stlačit E2B až na přibližně 1 GB . Textová verze bez vkládacích vrstev si podle dokumentace vystačí dokonce s méně než 1 GB
.
Pro inference engine jako vLLM nebo llama.cpp se používají buď oficiální GGUF soubory, nebo formát compressed-tensors s W4A16, který zachovává výhody QAT . Uživatelé by měli pamatovat na to, že volba formátu podstatně ovlivňuje konečnou kvalitu výstupu modelu
.
Nové QAT checkpointy znamenají, že i uživatelé s běžným hardwarem (herní GPU, výkonnější notebooky, moderní telefony) si mohou vyzkoušet modely, které ještě donedávna vyžadovaly serverové nasazení. Klíčem k úspěchu je používat oficiální QAT checkpointy ve formátech, které zachovávají kvalitu natrénovaného modelu .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google vydal modely Gemma 4 s oficiálními QAT checkpointy v pěti velikostech: E2B, E4B, 12B, 26B A4B a 31B [1][4][5].
Google vydal modely Gemma 4 s oficiálními QAT checkpointy v pěti velikostech: E2B, E4B, 12B, 26B A4B a 31B [1][4][5]. Díky kvantizačně uvědomělému tréninku (QAT) si 4bitové modely drží kvalitu srovnatelnou s originálem, přičemž využívají přibližně o 72 % méně paměti [5].
Nejmenší model E2B se pro nasazení v mobilech smrsknul až na přibližně 1 GB paměti [13][14].