Google, Gemma 4 ailesi için resmi Kuantizasyon Farkında Eğitim (QAT) kontrol noktalarını yayınladı; seride E2B, E4B, 12B, 26B A4B ve 31B boyutlarında modeller yer alıyor [1][4][5]. QAT, model eğitimi sırasında kuantizasyonu simüle ederek, 4 bit hassasiyette çalışırken neredeyse orijinal performansı koruyor ve bellek...

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Google, yapay zeka modellerini güçlü sunuculardan kurtarıp doğrudan kullanıcıların cihazlarına taşıma konusunda kritik bir adım attı. 4 Haziran 2026'da, en yeni açık ağırlıklı modelleri olan Gemma 4 ailesi için Kuantizasyon Farkında Eğitim (QAT) ile optimize edilmiş kontrol noktalarını yayınladı . Peki bu ne anlama geliyor? En basit tabirle, artık en gelişmiş yapay zeka modellerini, performansından neredeyse hiç ödün vermeden, akıllı telefonunuzda veya dizüstü bilgisayarınızda çalıştırabileceksiniz.
Yapay zeka modellerini "kuantize etmek", bir nevi yüksek çözünürlüklü bir fotoğrafı sıkıştırarak boyutunu küçültmeye benzer. Modeller normalde parametrelerini (yani öğrendiği bilgileri) 16-bitlik yüksek hassasiyetle (BF16) saklar. Kuantizasyon, bu hassasiyeti düşürerek, örneğin her bir sayıyı sadece 4 bit (int4) ile temsil ederek veri boyutunu dörtte birine indirir .
Ancak standart bir sıkıştırma (Kuantizasyon Sonrası Eğitim - PTQ) genellikle modelin "zekasında" gözle görülür bir düşüşe neden olur. Google'ın QAT yaklaşımı ise, modeli daha eğitim aşamasındayken bu sıkıştırmaya hazırlıyor. Model, "ileride sıkıştırılacağını" bilerek eğitildiği için, 4-bit gibi düşük hassasiyetlerde bile orijinal performansına çok yakın sonuçlar verebiliyor .
Resmi QAT kontrol noktaları, yoğun (dense) Gemma 4 modelleri için W4A16 şemasını kullanıyor. Bu, ağırlıkların 4-bit tam sayı, aktivasyonların ise 16-bit olarak tutulduğu, group_size=32 ayarına sahip ve compressed-tensors formatında sunulan bir yapı .
Gemma 4 ailesi, farklı ihtiyaçlara yönelik beş farklı parametre boyutunda sunuluyor: E2B, E4B, 12B, 26B A4B ve 31B . QAT sayesinde tüm bu modeller, orijinal BF16 hallerine kıyasla yaklaşık %72 daha az bellek kullanıyor ve neredeyse aynı kaliteyi koruyor
.
Bilgi Notu: "26B A4B" modelindeki "A", İngilizce "active" (aktif) kelimesinden gelir. Bu, Uzman Karması (Mixture of Experts) mimarisi sayesinde, modelin her bir işlem için toplam 26 milyar parametresinin yalnızca yaklaşık 3.8 milyarını kullanması anlamına gelir. Bu sayede, 26B seviyesinde bir zeka sunarken, işlem maliyeti 4B'lık bir modele yakın olur
.
Modelleri kullanmak için birkaç farklı seçenek mevcut. Seçiminiz, kullandığınız yazılıma ve amacınıza göre değişecektir :
Bu yeni modellerin asıl devrim yarattığı nokta, onları çalıştırmak için gereken donanımı demokratikleştirmesi:
QAT'nin kalite avantajı, özellikle 4-bit seviyesinde kritik önem taşır. Google'ın Gemma 4 QAT belgeleri, QAT ağırlıklarını doğrudan standart bir Q4_0 formatına dönüştürmenin, 26B modelinde doğruluğu sadece %85.6'ya kadar düşürebildiği konusunda açıkça uyarıyor . Bu nedenle, eğer amacınız QAT'nin sunduğu yüksek kaliteyi korumaksa, resmi
compressed-tensors formatındaki kontrol noktalarını kullanmak en güvenli ve doğru yöntemdir .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google, Gemma 4 ailesi için resmi Kuantizasyon Farkında Eğitim (QAT) kontrol noktalarını yayınladı; seride E2B, E4B, 12B, 26B A4B ve 31B boyutlarında modeller yer alıyor [1][4][5].
Google, Gemma 4 ailesi için resmi Kuantizasyon Farkında Eğitim (QAT) kontrol noktalarını yayınladı; seride E2B, E4B, 12B, 26B A4B ve 31B boyutlarında modeller yer alıyor [1][4][5]. QAT, model eğitimi sırasında kuantizasyonu simüle ederek, 4 bit hassasiyette çalışırken neredeyse orijinal performansı koruyor ve bellek kullanımını yaklaşık %72 azaltıyor [5][12].
Yeni mobil format sayesinde Gemma 4 E2B modeli sadece 1 GB bellek kaplıyor ve bu, gelişmiş yapay zekanın akıllı telefonlarda çalıştırılabilmesi için bir dönüm noktası [12][13][17].