Ở độ chính xác đầy đủ, mô hình yêu cầu khoảng 55 GB VRAM, nhưng Meta phát hành kèm lượng tử hóa 4-bit, nén mô hình xuống dưới 20 GB .
Meta phát hành hai cấu hình lượng tử hóa, cả hai đều được xây dựng bằng K-Quant và đo trên 15 điểm chuẩn :
Để giải quyết vấn đề độ trễ khi chạy mô hình 30B trên máy cục bộ, Meta kết hợp Muse Glimmer với DFlash — một mô hình chấm phác thảo suy luận nhỏ có 5 lớp, có khả năng đề xuất các khối 16 token cùng một lúc, sau đó mô hình chính xác minh song song .
Meta báo cáo thông lượng sau đây trên mô hình lượng tử hóa 17 GB ở kích thước lô 1 với giải mã tham lam (greedy decoding) :
| Phần cứng | Cơ bản (tok/s) | Với DFlash (tok/s) | Tăng tốc |
|---|---|---|---|
| NVIDIA RTX 5090 | 74,9 | 233,4 | 3,1x |
| Apple M5 Max | 26,6 | 50,2 | 1,9x |
| Apple M4 Max | 23,7 | 37,8 | 1,6x |
SGLang báo cáo 236,4 tok/s trên cùng phần cứng RTX 5090 trong một phép đo riêng ngay ngày đầu ra mắt . Các thử nghiệm độc lập ban đầu trên RTX 5090 sử dụng llama.cpp đôi khi cho thấy con số thấp hơn (ví dụ: ~137 tok/s), cho thấy rằng con số 233+ tok/s yêu cầu các tối ưu hóa cụ thể
.
Muse Glimmer chủ yếu không phải là chatbot — nó là một tác tử AI cục bộ được thiết kế cho các luồng công việc tự động . Meta đã tinh chỉnh mô hình để có thể lập kế hoạch, gọi công cụ và tự sửa lỗi
. Nó hỗ trợ Nguyên mẫu Ngữ cảnh Mô hình (MCP) một cách tự nhiên và tích hợp với các khung tác tử phổ biến
.
Các trường hợp sử dụng chính bao gồm: gọi hàm, lập trình cục bộ, phiên sử dụng công cụ dài, đánh giá LLM-as-a-judge, phân tích tài liệu và trợ lý cá nhân .
Meta đã công bố so sánh trực tiếp với Google Gemma 4 31B và Alibaba Qwen 3.6 27B (cả hai đều ở chế độ suy luận) :
Muse Glimmer dẫn đầu trong hầu hết các điểm chuẩn về tác tử, bao gồm MCP Atlas (75,5 so với 62,5 của Qwen) và DeepSearch QA (74,6 so với 71,1) . Nó cũng đạt 94,7 trên AIME 2026, dẫn trước cả hai đối thủ cạnh tranh
.
Lưu ý: Một phân tích của bên thứ ba chỉ ra rằng Glimmer thua Qwen 3.6 27B ở TerminalBench 2.1 (51,7 so với 60,7) và OSWorld-Verified (65,9 so với 75,6), và có xu hướng từ chối một số nhiệm vụ tự động hóa ở cấp hệ điều hành .
Muse Glimmer được chưng cất từ Muse Spark (mô hình tiên tiến đóng của Meta) bằng cách sử dụng chưng cất logit trong quá trình tiền huấn luyện, sau đó là tinh chỉnh có giám sát và RLHF . Bản thân Muse Spark vẫn là mô hình đóng — chỉ khả dụng dưới dạng API được lưu trữ — khiến Glimmer trở thành phiên bản trọng số mở được chưng cất dành cho người dùng muốn triển khai cục bộ
. Meta đã ám chỉ rằng một bản phát hành mở của Muse Spark có thể tiếp nối
.
Muse Glimmer là sản phẩm rõ ràng nhất cho đến nay về tầm nhìn "siêu trí tuệ cá nhân" của Mark Zuckerberg — AI mạnh mẽ chạy cục bộ trên các thiết bị cá nhân, không tốn phí đám mây, phí đăng ký hoặc dữ liệu rời khỏi thiết bị . TechCrunch gọi đây là "bức tranh rõ ràng nhất" về tầm nhìn đó
.
Việc phát hành diễn ra sau nhiều tháng hỗn loạn nội bộ sau khi Llama 4 ra mắt đầy thất vọng vào mùa xuân năm 2026, sau đó Meta dường như đã từ bỏ AI trọng số mở. Muse Glimmer mở lại chiến lược đó .
Vào tháng 6 năm 2025, Meta đã đầu tư 14,3 tỷ USD vào công ty gắn nhãn dữ liệu Scale AI, mua lại khoảng 49% cổ phần . Thương vụ này đã đưa CEO 28 tuổi của Scale, Alexandr Wang, đến lãnh đạo bộ phận "Siêu trí tuệ" mới của Meta
. Khoản đầu tư nhằm mục đích đảm bảo dữ liệu đào tạo chất lượng cao và nhân tài cho dòng mô hình Muse
. CNBC đưa tin vào tháng 1 năm 2026 rằng Wang đang lãnh đạo đơn vị AI TBD của Meta để xây dựng một sản phẩm kế thừa cho Llama, có tên mã là Avocado
.
Muse Glimmer có thể tải xuống từ Hugging Face tại meta-models/Muse-Glimmer-30B theo giấy phép Apache 2.0 . Nó được hỗ trợ ngay ngày đầu tiên trên:
Các báo cáo ban đầu từ cộng đồng cho thấy ngay cả RTX 3090 (24 GB) cũng có thể chạy mô hình lượng tử hóa Q4_K_XL với DFlash và cửa sổ ngữ cảnh 262K, sử dụng khoảng 22-23 GB VRAM .