Google офіційно випустила контрольні точки Gemma 4 з QAT для моделей E2B, E4B, 12B, 26B A4B та 31B [1][4][5]. QAT версії зменшують використання пам'яті приблизно на 72%, зберігаючи продуктивність, близьку до оригіналу [5].

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
4 червня 2026 року компанія Google зробила потужний крок назустріч розробникам, які прагнуть запускати великі мовні моделі локально, без дорогих серверів. Вона офіційно представила контрольні точки Gemma 4 з навчанням, чутливим до квантування (Quantization-Aware Training, QAT) . Якщо просто, це означає, що тепер «розумні» ШІ-моделі можуть бути «легкими» настільки, щоб поміститися у ваш телефон або на не найдорожчу відеокарту, майже не втрачаючи в якості відповідей
.
У світі штучного інтелекту квантування — це процес зменшення точності чисел, які модель використовує для зберігання параметрів і обчислень. Наприклад, замість 16-бітного формату з плаваючою комою (BF16) можна використовувати лише 4 біти на число (int4) — це зменшує обсяг даних у 4 рази, але часто призводить до втрати якості .
Традиційний підхід — посттренувальне квантування (PTQ) — стискає вже готову модель, через що вона може «дурнішати». QAT діє інакше: квантування симулюється ще на етапі навчання, тому модель заздалегідь вчиться компенсувати втрату точності . У результаті ми отримуємо майже ту саму якість, що й у повнорозмірної BF16-версії, але з радикально меншим споживанням пам'яті
.
Офіційні чекпоінти від Google для щільних (dense) моделей Gemma 4 використовують схему W4A16: 4-бітні цілочисельні ваги (weights) та 16-бітні активації (activations) з group_size=32 у форматі compressed-tensors .
Лінійка Gemma 4 налічує п'ять основних розмірів, і для всіх доступні QAT-оптимізовані версії .
Моделі E2B та E4B спочатку позиціонувалися для периферійних та мобільних пристроїв — вони підтримують текст, зображення й аудіо . 12B — це відносно нова уніфікована мультимодальна модель без зовнішнього енкодера, а 26B A4B належить до класу суміші експертів, де на кожен токен активується лише мала частина параметрів, що забезпечує ефективність при високій загальній «місткості»
. 31B — це флагманська щільна модель із контекстним вікном до 256 тисяч токенів
.
Google подбала про сумісність із популярними фреймворками для інференсу. Ось основні варіанти, які ви знайдете на Hugging Face :
llama.cpp, Ollama, MLX та інших сумісних бібліотек. Це «народний» стандарт для локального запуску Найбільша перевага QAT — це можливість запускати ШІ там, де раніше про це годі було й думати.
Для порівняння, звичайна BF16-версія 31B-моделі потребує близько 58–64 ГБ відеопам'яті . Тож QAT перетворює її з «серверного монстра» на «домашнього помічника».
Потужний потенціал QAT вимагає обережності. Google прямо попереджає: наївне конвертування QAT-ваг у звичайний Q4_0 формат призводить до значної втрати якості. Наприклад, для моделі 26B A4B точність топ-1 може впасти до жалюгідних 70.2%. Це як взяти суперкар і залити в нього низькооктанове пальне — їхати буде, але динаміка втрачена .
Розробники повинні використовувати або офіційні compressed-tensors чекпоінти для vLLM, або спеціально оптимізовані GGUF-збірки, щоб зберегти ті самі «~72% економії пам'яті з майже оригінальною якістю», які обіцяє QAT .
Загалом, вихід Gemma 4 QAT — це не просто черговий реліз, а тектонічний зсув у доступності передового ШІ. Він стирає межу між «великими хмарними обчисленнями» та «локальним, приватним і безплатним інтелектом» на вашому власному пристрої.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google офіційно випустила контрольні точки Gemma 4 з QAT для моделей E2B, E4B, 12B, 26B A4B та 31B [1][4][5].
Google офіційно випустила контрольні точки Gemma 4 з QAT для моделей E2B, E4B, 12B, 26B A4B та 31B [1][4][5]. QAT версії зменшують використання пам'яті приблизно на 72%, зберігаючи продуктивність, близьку до оригіналу [5].
Для смартфонів створено спеціальні мобільні формати, зокрема модель E2B може працювати всього з 1 ГБ пам'яті [5][8][12].