Vào ngày 5 tháng 6 năm 2026, Google DeepMind đã chính thức phát hành các điểm kiểm tra QAT (Quantization-Aware Training – Huấn luyện có nhận thức về lượng tử hóa) cho toàn bộ dòng mô hình Gemma 4 . Đây là một bước tiến lớn trong việc dân chủ hóa AI, cho phép các mô hình ngôn ngữ và đa phương thức mạnh mẽ chạy trực tiếp trên máy tính cá nhân, laptop và thậm chí cả điện thoại thông minh mà vẫn giữ được hiệu năng ấn tượng.
Lượng tử hóa (Quantization) là kỹ thuật giảm độ chính xác của các con số mà mô hình dùng để lưu trữ và tính toán. Thay vì dùng 16 bit cho mỗi tham số (độ chính xác BF16), int4 chỉ dùng 4 bit, giúp giảm kích thước dữ liệu xuống 4 lần . Tuy nhiên, các phương pháp lượng tử hóa truyền thống thường làm giảm đáng kể chất lượng đầu ra của mô hình.
QAT giải quyết vấn đề này một cách triệt để. Thay vì nén một mô hình đã huấn luyện xong (hậu lượng tử hóa - PTQ), QAT tích hợp mô phỏng quá trình lượng tử hóa vào chính giai đoạn huấn luyện. Điều này cho phép mô hình "học" cách bù đắp cho sự mất mát độ chính xác, kết quả là phiên bản 4-bit vẫn giữ được hiệu năng gần như bản gốc 16-bit .
Các điểm kiểm tra chính thức sử dụng sơ đồ W4A16 cho các mô hình Gemma 4 dày đặc: trọng số nguyên 4 bit, kích hoạt 16 bit, với group_size=32, sử dụng định dạng compressed-tensors .
Dòng Gemma 4 cung cấp năm kích cỡ tham số khác nhau, phục vụ từ các thiết bị biên nhỏ nhất đến các máy trạm cấu hình cao :
Lưu ý đặc biệt về mô hình 26B A4B: Đây là kiến trúc Hỗn hợp Chuyên gia (MoE) với tổng 26 tỷ tham số nhưng chỉ kích hoạt khoảng 3.8 tỷ tham số cho mỗi token. Điều này có nghĩa là bạn nhận được sức mạnh suy luận của một mô hình cỡ 26B nhưng chi phí tính toán chỉ tương đương một mô hình 4B khi chạy suy luận
.
Google cung cấp bốn phiên bản điểm kiểm tra QAT, đáp ứng hầu hết các hệ sinh thái suy luận phổ biến :
Việc phát hành QAT chính thức mang lại những khả năng chưa từng có cho người dùng phổ thông:
Mô hình 31B với cửa sổ ngữ cảnh 256K token giờ đây khả thi trên phần cứng tiêu dùng cao cấp, thay vì đòi hỏi GPU máy chủ H100 80GB như trước đây . Điều này có nghĩa là các nhà phát triển độc lập, sinh viên và các công ty khởi nghiệp có thể thử nghiệm và triển khai các tác nhân AI (agentic workflows), trợ lý lập trình và hệ thống suy luận phức tạp mà không cần chi phí đám mây khổng lồ
.
Mặc dù QAT mang lại lợi thế vượt trội, Google và cộng đồng (như Unsloth) đã đưa ra một lưu ý quan trọng. Việc chuyển đổi một cách "ngây thơ" từ trọng số QAT sang định dạng Q4_0 tiêu chuẩn có thể làm giảm mạnh độ chính xác. Thử nghiệm với mô hình 26B cho thấy cách chuyển đổi thô sơ chỉ đạt 70.2% độ chính xác top-1, nhưng khi áp dụng phương pháp tối ưu hóa động (Unsloth Dynamic), con số này được đẩy lên 85.6% .
Lời khuyên thực tế là hãy ưu tiên sử dụng các điểm kiểm tra QAT-oriented chính thức (như compressed-tensors hoặc GGUF chính chủ từ Google) để bảo toàn tối đa chất lượng mà QAT mang lại .
Với việc phát hành các điểm kiểm tra QAT cho Gemma 4, Google đã xóa nhòa ranh giới giữa AI "phòng thí nghiệm" và AI "trong túi bạn". Từ chiếc điện thoại Android với 1GB RAM cho đến máy trạm RTX 4090 mạnh mẽ, giờ đây sức mạnh của các mô hình ngôn ngữ lớn nhất đã thực sự được dân chủ hóa. Kỷ nguyên AI riêng tư, ngoại tuyến và cá nhân hóa sâu sắc đã chính thức bắt đầu.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google chính thức phát hành các điểm kiểm tra QAT cho năm kích cỡ mô hình Gemma 4: E2B, E4B, 12B, 26B A4B và 31B, sử dụng phương pháp lượng tử hóa W4A16 cho các mô hình dày đặc [1][4][5].
Google chính thức phát hành các điểm kiểm tra QAT cho năm kích cỡ mô hình Gemma 4: E2B, E4B, 12B, 26B A4B và 31B, sử dụng phương pháp lượng tử hóa W4A16 cho các mô hình dày đặc [1][4][5]. QAT mô phỏng quá trình lượng tử hóa ngay trong lúc huấn luyện, giúp mô hình học cách bù đắp cho sự mất mát độ chính xác, duy trì hiệu năng gần như bản gốc 16 bit [2][5].
Với QAT, Gemma 4 E2B có thể chạy chỉ với 1GB RAM trên thiết bị di động, E4B cần 5GB, 12B cần 7GB, 26B A4B cần 15GB và bản 31B cần 18 20GB ở chế độ 4 bit [3][5][6].
| 26B A4B | MoE (Hỗn hợp chuyên gia) | ~15 GB | Giảm ~72% |
| 31B | Dày đặc, 30.7B tham số | ~18–20 GB | Giảm ~72% |