Googleが公開したGemma 4 QAT(量子化アウェア学習)チェックポイントは、16ビット精度と比較してメモリ使用量を約72%削減[2][5]。31Bモデルが単一のコンシューマーGPUで動作可能になり、最小のE2Bモデルは約1GBにまで圧縮[5][6]。 E2B、E4B、12B、26B A4B(MoE)、31Bの全5サイズで提供[2][4]。GGUFやvLLM向けのcompressed tensors形式、さらにモバイル最適化スキーマも用意される一方、Q4 0への単純変換では精度が低下するため、変換方法の選択が重要[5][18]。

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Googleは、Gemma 4ファミリー全モデルに対応する「量子化アウェア学習(Quantization-Aware Training:QAT)」チェックポイントを公式に公開しました。これは、学習済みの16ビットモデルを後から圧縮する従来の「学習後量子化(PTQ)」とは一線を画すアプローチです。
QATは、学習プロセス自体に量子化のシミュレーションを組み込むことで、モデルが精度低下を補償する方法を自ら学習します。その結果、最終的な4ビットモデルでも、オリジナルに迫る性能を維持したまま、メモリ使用量を約72%も削減することが可能になりました。これにより、これまでハードウェアの制約から巨大モデルの導入を諦めていた開発者や研究者にとって、状況は劇的に変わります。
標準的な学習後量子化(PTQ)では、完全に学習されたモデルの重みを、例えばbfloat16からint4に変換します。問題は、モデルが低い精度で動作するよう学習されていないため、多くの場合、品質が著しく劣化する点です。
一方で、QATは量子化の工程を学習ループの中に直接統合します。モデルは順伝播と逆伝播の過程で量子化された値を参照するため、より制約の多い数値表現に対しても耐性を獲得します。「元の性能に迫る(near original performance)」と評される所以です。
今回公開された公式チェックポイントは、W4A16という方式を採用しています。これは、重みを4ビット整数で、活性化関数を16ビットで扱い、group_sizeは32、保存形式にはcompressed-tensorsを用います。このアプローチにより、メモリ節約とスループット向上の絶妙なバランスを実現しています
。
5つのモデルサイズすべてにQATチェックポイントが提供されており、それぞれに投機的デコード用のドラフターモデルも用意されています。実用的なメモリ使用量は、BF16とQAT 4ビットの間で劇的に変化します。
| モデル | アーキテクチャ | アクティブパラメータ | BF16時メモリ | QAT 4-bit時メモリ | 主なターゲットハードウェア |
|---|---|---|---|---|---|
| E2B | Dense + PLE | 約23億(埋め込み込みで51億) | 約9.6 GB | 約3.2 GB (Q4_0); 約1 GB (モバイル形式) | スマホ、エッジデバイス、ブラウザ |
| E4B | Dense + PLE | 約45億(埋め込み込みで80億) | 約15 GB | 約5 GB (Q4_0) | ミドルレンジGPU、メモリ多めのスマホ |
| 12B | Dense, encoder-free統一マルチモーダル | 約119.5億 | 約24 GB | 約7 GB (Q4_0) | 8 GB GPU搭載PC、ゲーミングノートPC |
| 26B A4B | Mixture of Experts (MoE) | 約38億 / 全260億 | 約48 GB | 約15 GB (Q4_0) | 12~16 GB GPU、ハイエンドワークステーション |
| 31B | Dense | 約307億 | 約58 GB | 約17~18 GB (Q4_0) | 24 GB GPU (RTX 3090/4090)、大容量VRAM環境 |
メモリ数値はGoogle公式モデル概要とUnslothのドキュメントに基づき、Q4_0は広く使われているGGUF量子化レベルの数値です。
特に注目すべきは、26B A4Bです。これはMoE(Mixture of Experts)アーキテクチャを採用しており、総パラメータ数は260億に上る一方、トークン処理ごとに実際にアクティブになるのは約38億のパラメータのみです。これは、約40億パラメータモデルに近い計算コストで、はるかに大規模で高密度なモデルに匹敵する推論能力を提供することを意味します。4ビット形式なら、多くの開発者がすでに所有している12~16 GBのGPUで動作します
。
GoogleはQATチェックポイントを4つの異なる形式でリリースしました。形式の選択は、最終的なモデルの品質に直接影響を与えます。
このリリースにおける最大の注意点は、QATの重みを単純にQ4_0に変換すると、精度が大幅に低下する可能性があることです。 Unslothのドキュメントによると、26BモデルのQAT重みを安易にQ4_0変換した場合、Top-1精度はわずか約70.2%にとどまりました。Unslothの最適化手法「Dynamic」では85.6%まで回復しましたが、これは変換方法論の選択が、QAT本来の性能を引き出す上で決定的に重要であることを示しています。
ほとんどのユーザーにとっては、提供されている公式のcompressed-tensorsまたはGGUFチェックポイントから始めるのが最も安全で確実な道と言えるでしょう。
QAT 4ビット化がもたらす真の価値は、単なるメモリ削減ではなく、ローカルAI推論の新たなハードウェア地図を描き出したことにあります。
スマートフォンとエッジデバイス:
E2Bはモバイル向けに設計されたモデルです。GoogleのLiteRT-LMフレームワークを使えば、2ビットと4ビットの量子化により1.5 GB未満のRAMでもE2Bを実行できます。Google Playストアの「AI Edge Gallery」アプリから、E2BやE4Bを完全に端末上で選択・実行することも可能です
。テキスト、画像、音声入力にネイティブ対応しているため、リアルタイム音声翻訳や画像質問応答といった機能を、クラウド接続なしで実現できる可能性を秘めています
。
8 GB GPU:
QATデプロイメントのスイートスポットです。E2B(約3.2 GB)、E4B(約5 GB)、さらに12Bモデル(約7 GB)は、いずれも8 GBのVRAMに快適に収まります。つまり、ミドルレンジのノートPCや数世代前のデスクトップ向けGPU(RTX 2070など)でも、256Kトークンものコンテキストウィンドウを持つ統合マルチモーダルモデルが動作する時代が到来したのです。
12~16 GB GPU:
このクラスには26B A4B(Q4_0で約15 GB)が適合し、RTX 3080、4070 Ti、4080などが現実的な選択肢となります。MoEアーキテクチャのおかげで、同クラスの巨大モデルと比較して推論遅延が短く、より軽快に動作する点も見逃せません
。
20~24 GB GPU:
最重量級の31Bモデルも、Q4_0なら約17~18 GBまで圧縮され、RTX 3090や4090ユーザーにとって現実的な範囲に収まります。このモデルを16ビット精度で動かそうとすると60 GB近いVRAMが必要で、コンシューマー向けGPUでは全く手の届かない存在でした。QAT 4ビット化こそが、Gemma 4最大のモデルを高性能な個人向けGPUでも動かせるようにする鍵です。
現実的な注意点: ここで示したメモリ使用量は、あくまでモデルの重み自体のサイズです。実際の実行時には、長大なコンテキストを扱うためのKVキャッシュなどのオーバーヘッドが数ギガバイト単位で追加されます。特に31Bモデルで256Kのコンテキストを扱う場合、必要なメモリは基本の重みサイズを大幅に上回り、コミュニティの報告では20GB前半まで必要になるケースもあるようです。常に、記載された数値よりも多めのVRAMを余裕として見積もるようにしましょう。
実用面から見ると、このリリースは「このモデル、ローカルで動かせますか?」という問いに対するデフォルトの答えを変えてしまいます。主要なオープンウェイトモデルファミリーが、QATチェックポイントを後付けではなく、最初から第一級の要素として提供するのはこれが初めてです。
その影響は、以下のような分野に広がります。
プライバシーが重視される領域:
医療、法律、パーソナルアシスタントといった、これまでクラウドAPIへの依存が前提だったアプリケーションも、ノートPCやスマートフォン上で完全に動作させることが現実的になります。QATによって推論品質が十分に保たれるため、ローカル処理への移行が一気に加速するでしょう。
オフラインおよびエッジ環境での活用:
安定したネット接続が期待できない現場調査や災害対応、産業環境においても、高性能なマルチモーダルモデルを汎用的なハードウェアで展開できる道が開けます。E2Bのオーディオ対応と1 GBモバイル量子化が組み合わされば、一般的なスマートフォンでのリアルタイム音声翻訳も、夢物語ではなくなります。
開発者ツールとIDEへの統合:
12Bおよび26Bモデルは、多くの開発者がすでに持っているハードウェアに適合します。これにより、コード補完、リファクタリング、ドキュメント生成などを、レイテンシやAPIコストの制約なしにローカルで実行可能になります。
実験とファインチューニングの民主化:
小規模な研究チームや個人開発者にとって、A100やH100のクラスタを用意するのはコスト面で大きな障壁でした。QAT版Gemma 4の登場は、研究開発への参入障壁を劇的に引き下げ、12Bから31Bクラスのモデルを用いたカスタマイズや、ドメイン特化型のファインチューニングを、個人のコンシューマーハードウェアで行うことを可能にします。
今回のQATチェックポイントは、ベースのGemma 4モデルと同様に寛容なApache 2.0ライセンスの下で公開され、すでにHugging Faceから全5モデルサイズがダウンロード可能です。「本格的なAI」の実行環境に関する常識が、今、まさに書き換えられようとしています。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Googleが公開したGemma 4 QAT(量子化アウェア学習)チェックポイントは、16ビット精度と比較してメモリ使用量を約72%削減[2][5]。31Bモデルが単一のコンシューマーGPUで動作可能になり、最小のE2Bモデルは約1GBにまで圧縮[5][6]。
Googleが公開したGemma 4 QAT(量子化アウェア学習)チェックポイントは、16ビット精度と比較してメモリ使用量を約72%削減[2][5]。31Bモデルが単一のコンシューマーGPUで動作可能になり、最小のE2Bモデルは約1GBにまで圧縮[5][6]。 E2B、E4B、12B、26B A4B(MoE)、31Bの全5サイズで提供[2][4]。GGUFやvLLM向けのcompressed tensors形式、さらにモバイル最適化スキーマも用意される一方、Q4 0への単純変換では精度が低下するため、変換方法の選択が重要[5][18]。
実用的な観点では、12Bモデルが8GB GPUに、26B MoEは16GBクラスに、そして31Bは18~20GBのVRAMがあれば動作する計算に[18][28]。ただし、実行時にはKVキャッシュなどのオーバーヘッドが加わるため、常に余裕を持ったVRAMの確保が求められる[21][29]。