Google ปล่อยเวอร์ชัน QAT อย่างเป็นทางการสำหรับ Gemma 4 ทุกรุ่น ได้แก่ E2B, E4B, 12B, 26B A4B และ 31B [1][4][5] Quantization คือการลดความละเอียดของตัวเลขที่ใช้ในการคำนวณ โดยการใช้ int4 (4 บิต) จะช่วยลดขนาดข้อมูลลงได้ถึง 4 เท่าเมื่อเทียบกับ BF16 [2] เทคนิค QAT แตกต่างจากการบีบอัดแบบทั่วไป (PTQ) เพราะจำลองการบีบอัดตั้ง...

Create a landscape editorial hero image for this Studio Global article: What are the key details of Google's June 4 release of Gemma 4 QAT models, including their quantization approach, supported model sizes and. Article summary: Google provides official Quantization-Aware Training (QAT) checkpoints for Gemma 4, and the Gemma 4 lineup includes E2B, E4B, 12B, 26B A4B, and 31B sizes [1][4][5]. Here are the key details.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# What Is Google Gemma 4? Google Gemma 4 is the most capable open model family from DeepMind yet, shipping four sizes under Apache 2.0 with multimodal input, native reasoning, and" source context "What Is Google Gemma 4? Architecture, Benchmarks, and Why It ..." Reference image 2: visual subject "# What Is Google Gemma 4? Google
Google ได้สร้างมาตรฐานใหม่ให้กับการเข้าถึง AI ขั้นสูงด้วยการเปิดตัวเช็คพอยต์ Quantization-Aware Training (QAT) สำหรับโมเดลตระกูล Gemma 4 ในวันที่ 4 มิถุนายน 2026 นี่ไม่ใช่แค่การอัปเดตธรรมดา แต่เป็นการปฏิวัติวิธีที่เราจะรันโมเดลภาษาขนาดใหญ่บนอุปกรณ์ส่วนตัวของเรา
หัวใจหลักของเรื่องนี้คือ Quantization หรือการลดความแม่นยำของตัวเลขที่ใช้เก็บและคำนวณค่าพารามิเตอร์ในโมเดล AI ลองนึกภาพว่าปกติโมเดลจะเก็บค่าต่างๆ เป็นตัวเลขทศนิยม 16 บิต (BF16) แต่ QAT ย่อเหลือเพียง 4 บิต (int4) ซึ่งคิดเป็นการลดขนาดข้อมูลลงถึง 4 เท่า
แต่การย่อข้อมูลมักทำให้คุณภาพของโมเดลลดลง ปัญหานี้คือสิ่งที่ QAT เข้ามาแก้
Post-Training Quantization (PTQ) แบบเดิมที่เราใช้กันจะบีบอัดโมเดลหลังจากเทรนเสร็จแล้ว ซึ่งมักทำให้ประสิทธิภาพตก
Quantization-Aware Training (QAT) ต่างออกไป เพราะมันจำลองกระบวนการบีบอัดนี้ตั้งแต่ ขั้นตอนการเทรน ทำให้โมเดลเรียนรู้ที่จะปรับตัวและชดเชยความผิดพลาดที่อาจเกิดขึ้นตั้งแต่แรก ส่งผลให้โมเดลเวอร์ชัน 4 บิตมีประสิทธิภาพใกล้เคียงกับเวอร์ชัน 16 บิตแบบดั้งเดิมมาก
สำหรับ Gemma 4 รุ่นตระกูล Dense (ไม่ใช่ MoE) จะใช้โครงสร้าง W4A16 กล่าวคือใช้ค่าน้ำหนัก (Weights) แบบจำนวนเต็ม 4 บิต และการกระตุ้น (Activations) แบบ 16 บิต โดยมี group_size=32 และมาในฟอร์แมต compressed-tensors
Gemma 4 เปิดตัวมาด้วยกันทั้งหมด 5 ขนาด โดยทุกตัวมีเวอร์ชัน QAT ให้ใช้งานแล้ว :
อย่าลืมว่าเวอร์ชัน QAT ถูกออกแบบมาให้ใช้กับฟอร์แมตเฉพาะ หากนำน้ำหนัก QAT ไปแปลงเป็นฟอร์แมตยอดนิยมอย่าง Q4_0 ด้วยวิธีปกติ (Naive Conversion) ประสิทธิภาพอาจลดลงอย่างมาก ตัวอย่างเช่น โมเดล 26B มีความแม่นยำแบบ top-1 ลดลงเหลือเพียง 70.2% เมื่อแปลงแบบผิดวิธี
เช็คพอยต์ QAT มีให้เลือกดาวน์โหลดหลายฟอร์แมต ขึ้นอยู่กับการใช้งาน :
นี่คือสิ่งที่หลายคนรอคอย QAT ทำให้การรันโมเดลใหญ่ๆ บนฮาร์ดแวร์ที่เราใช้กันอยู่ทุกวันเป็นจริงได้:
การมาของ QAT บน Gemma 4 เป็นการทลายกำแพงสำคัญของ AI โดยสิ้นเชิง:
การเปิดตัวครั้งนี้เป็นสัญญาณว่า อนาคตของ AI ที่ทรงพลังและเข้าถึงได้กำลังเริ่มต้นขึ้นแล้วบนอุปกรณ์ที่คุณถืออยู่ในมือ
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google ปล่อยเวอร์ชัน QAT อย่างเป็นทางการสำหรับ Gemma 4 ทุกรุ่น ได้แก่ E2B, E4B, 12B, 26B A4B และ 31B [1][4][5]
Google ปล่อยเวอร์ชัน QAT อย่างเป็นทางการสำหรับ Gemma 4 ทุกรุ่น ได้แก่ E2B, E4B, 12B, 26B A4B และ 31B [1][4][5] Quantization คือการลดความละเอียดของตัวเลขที่ใช้ในการคำนวณ โดยการใช้ int4 (4 บิต) จะช่วยลดขนาดข้อมูลลงได้ถึง 4 เท่าเมื่อเทียบกับ BF16 [2]
เทคนิค QAT แตกต่างจากการบีบอัดแบบทั่วไป (PTQ) เพราะจำลองการบีบอัดตั้งแต่ขั้นตอนการเทรน ทำให้โมเดลเรียนรู้ที่จะชดเชยความแม่นยำที่หายไป [4]