Google opublikowało 5 czerwca oficjalne checkpointy QAT (Quantization Aware Training) dla całej rodziny modeli Gemma 4: E2B, E4B, 12B, 26B A4B oraz 31B [1][4][5][12]. Technika QAT symuluje kwantyzację już podczas treningu, co pozwala na około 72% mniejsze zużycie pamięci RAM przy jednoczesnym zachowaniu wydajności z...

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
5 czerwca 2026 roku Google DeepMind opublikowało długo wyczekiwane checkpointy QAT (Quantization-Aware Training) dla całej rodziny modeli Gemma 4 . Krótko mówiąc: to przełom, który pozwala uruchomić bardzo zaawansowaną sztuczną inteligencję na sprzęcie, który do tej pory był dla niej niedostępny – w tym na smartfonach, laptopach i starszych kartach graficznych z 8 GB VRAM.
Tradycyjna kwantyzacja polega na kompresji już wytrenowanego modelu (np. z precyzji BF16 do 4-bitowej), co często kończy się wyraźnym spadkiem jego „inteligencji” . QAT działa inaczej: symuluje kwantyzację w trakcie treningu, zmuszając model do nauczenia się, jak radzić sobie z mniejszą precyzją. Dzięki temu skompresowana wersja do formatu 4-bitowego zachowuje niemal oryginalną jakość odpowiedzi, a jednocześnie zużywa około 72% mniej pamięci RAM
.
Wyobraź sobie, że masz do dyspozycji wydajność modelu, który normalnie potrzebowałby karty graficznej za kilkadziesiąt tysięcy złotych, ale uruchamiasz go na swoim domowym komputerze. To właśnie obietnica, którą spełnia Gemma 4 QAT.
Oficjalne checkpointy QAT od Google używają schematu W4A16 dla modeli dense („gęstych” w architekturze): wagi są 4-bitowymi liczbami całkowitymi (int4), a aktywacje pozostają w precyzji 16-bitowej. Dodatkowo obowiązuje parametr group_size=32 .
W praktyce mamy do wyboru kilka formatów wdrożeniowych:
compressed-tensors – oficjalny format W4A16 zoptymalizowany pod silniki takie jak vLLM wNa8o8) – zupełnie nowy, eksperymentalny schemat, który dla najmniejszych modeli (E2B, E4B) wykorzystuje mieszankę różnych szerokości kwantyzacji, by zmieścić model w zaledwie ~1 GB pamięci Gemma 4 jest dostępna w pięciu rozmiarach . Tabela poniżej pokazuje, jak drastycznie spada zapotrzebowanie na pamięć po zastosowaniu QAT:
Oto realne scenariusze uruchamiania modeli Gemma 4 QAT na sprzęcie konsumenckim:
Dokumentacja Google i Unsloth zawiera kluczowe ostrzeżenie: samodzielna, naiwna konwersja wag QAT do formatu Q4_0 może prowadzić do katastrofalnego spadku dokładności. W przypadku modelu 26B, top-1 accuracy potrafi spaść do zaledwie 70.2% . Dlatego tak ważne jest korzystanie z oficjalnych, gotowych checkpointów QAT w formacie
compressed-tensors lub dedykowanych plików GGUF, gdzie proces konwersji został przeprowadzony prawidłowo . Zespół Unsloth opracował nawet własną, dynamiczną metodę, która podnosi dokładność takiej konwersji do 85.6%, zachowując przy tym mniejszy rozmiar pliku
.
Podsumowując, Google oddało w ręce społeczności potężne narzędzie. Gemma 4 QAT burzy dotychczasowe bariery sprzętowe, demokratyzując dostęp do modeli AI o ogromnych możliwościach. Niezależnie od tego, czy chcesz eksperymentować na telefonie, czy uruchomić zaawansowanego asystenta kodowania na domowym PC, z Gemma 4 QAT jest to teraz wreszcie realne.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google opublikowało 5 czerwca oficjalne checkpointy QAT (Quantization Aware Training) dla całej rodziny modeli Gemma 4: E2B, E4B, 12B, 26B A4B oraz 31B [1][4][5][12].
Google opublikowało 5 czerwca oficjalne checkpointy QAT (Quantization Aware Training) dla całej rodziny modeli Gemma 4: E2B, E4B, 12B, 26B A4B oraz 31B [1][4][5][12]. Technika QAT symuluje kwantyzację już podczas treningu, co pozwala na około 72% mniejsze zużycie pamięci RAM przy jednoczesnym zachowaniu wydajności zbliżonej do oryginału [5][12].
Nowy, eksperymentalny format mobilny dla modeli E2B i E4B redukuje ich rozmiar w pamięci do zaledwie około 1 GB, umożliwiając pracę bezpośrednio na smartfonach [12][13][17].