AMD đã công bố các điểm chuẩn hiệu năng sơ bộ cho Muse Glimmer 30B trên phần cứng mới nhất của họ. Các bài kiểm tra được thực hiện trên Windows bằng dự án llama.cpp với backend Vulkan và giải mã suy diễn dFlash (dFlash speculative decoding) .
Cần lưu ý rằng đây là những kết quả sơ bộ, được AMD đo lường sớm, do đó hiệu năng thực tế có thể thay đổi tùy thuộc vào cấu hình hệ thống, khả năng tản nhiệt và khối lượng công việc .
Mô hình sử dụng kỹ thuật lượng tử hóa 4-bit (K-Quant-Dynamic) để nén dung lượng bộ nhớ từ hơn 55 GB ở độ chính xác đầy đủ xuống còn khoảng 18–20 GB . Điều này cho phép trọng số mô hình, bộ nhớ đệm KV (KV cache) và bộ mã hóa nhận thức (perception encoder) được tải đồng thời lên một GPU tiêu dùng duy nhất có 24 GB hoặc 32 GB VRAM . Các thử nghiệm của Meta cho thấy mức độ lượng tử hóa này "gây ra sự suy giảm rất ít hoặc không đáng kể đối với các tác vụ đại lý" .
AMD và các đối tác của mình đã đảm bảo nhiều lộ trình tức thời để các nhà phát triển bắt đầu xây dựng ứng dụng với Muse Glimmer ngay từ ngày đầu.
LM Studio đã hợp tác trực tiếp với Meta để cung cấp hỗ trợ ngay ngày đầu cho Muse Glimmer trong ứng dụng desktop LM Studio Bionic của họ . Người dùng có thể tải xuống và chạy mô hình cục bộ chỉ với vài cú nhấp chuột từ danh mục trong ứng dụng. Phiên bản Muse Glimmer nhỏ nhất yêu cầu ít nhất 26 GB RAM . LM Studio có sẵn trên cả Windows và Linux, sử dụng runtime llama.cpp và là một công cụ chủ chốt trong hệ sinh thái AI cục bộ của AMD .
Máy chủ AI nguồn mở cục bộ của AMD, Lemonade, được định vị là một lộ trình tích hợp chính . Lemonade cho phép các ứng dụng truy cập vào mô hình đang chạy cục bộ thông qua API OpenAI tiêu chuẩn của ngành, cho phép bất kỳ ứng dụng hiện có nào tương thích với OpenAI đều có thể hoạt động ngay lập tức với một phiên bản Muse Glimmer cục bộ . Nó hỗ trợ các mô hình sinh văn bản, hình ảnh và âm thanh trong một gói C++ nhẹ duy nhất, chạy trên Windows, Linux, macOS và Docker .
Ngoài LM Studio và Lemonade, Muse Glimmer còn nhận được sự hỗ trợ rộng rãi từ hệ sinh thái, đang được triển khai cùng với ngày ra mắt:
meta-models/Muse-Glimmer-30B theo giấy phép Apache 2.0 .Sự đa dạng của các công cụ này có nghĩa là các nhà phát triển không bị khóa vào một runtime duy nhất và có thể chọn giải pháp phù hợp nhất với tình huống triển khai của họ .
AMD gọi rõ ràng sự kết hợp giữa Muse Glimmer và phần cứng của họ là "giai đoạn tiếp theo của PC Đại Lý" . Luận điểm chiến lược này xoay quanh ba yếu tố:
Chạy suy luận hoàn toàn trên phần cứng cục bộ có nghĩa là dữ liệu nhạy cảm — tài liệu, mã nguồn, thông tin cá nhân — không bao giờ rời khỏi máy của người dùng. Không có cuộc gọi API nào đến máy chủ bên thứ ba, không có dữ liệu nào bị ghi lại bởi các nhà cung cấp đám mây và không phụ thuộc vào kết nối mạng . Đối với các trường hợp sử dụng trong doanh nghiệp liên quan đến dữ liệu bảo mật, đây là một lợi thế quyết định.
Khi phần cứng đã được mua, suy luận cục bộ không có chi phí cho mỗi token. Không có phí sử dụng API, không có phí đăng ký cho các điểm cuối suy luận và không có chi phí điện toán đám mây biến đổi . Đối với các nhà phát triển chạy các vòng lặp đại lý liên tục hoặc khối lượng công việc hàng loạt nặng, điều này thay đổi hoàn toàn kinh tế học của việc triển khai các AI đại lý.
Quyết định của Meta phát hành Muse Glimmer theo giấy phép Apache 2.0 là một phần quan trọng trong chiến lược này . Các nhà phát triển có thể hoàn toàn kiểm tra, sửa đổi, tinh chỉnh và phân phối lại mô hình mà không bị hạn chế. Điều này loại bỏ sự phụ thuộc vào bất kỳ nhà cung cấp mô hình duy nhất nào và phù hợp với nỗ lực rộng lớn hơn của AMD nhằm xây dựng một giải pháp thay thế mở cho hệ sinh thái CUDA độc quyền của Nvidia .
Như AMD đã tuyên bố trên blog chính thức: "Sự kết hợp giữa các mô hình trọng số mở như Muse Glimmer và phần cứng cục bộ mạnh mẽ giúp mọi hoạt động suy luận được riêng tư, độ trễ thấp và độc lập với chi phí API đám mây hoặc kết nối mạng" .
Mặc dù thông báo này rất có ý nghĩa, nhưng cần lưu ý một số điểm để có cái nhìn thực tế:
Việc AMD xác nhận hỗ trợ cục bộ cho Muse Glimmer 30B của Meta là một cột mốc quan trọng đối với hệ sinh thái AI cục bộ. Nó khẳng định rằng một mô hình đại lý hiệu năng cao với 30 tỷ tham số có thể chạy trên một GPU tiêu dùng duy nhất, cung cấp cho các nhà phát triển một giải pháp thay thế mã nguồn mở trưởng thành theo giấy phép Apache 2.0 và đưa ra các lộ trình tích hợp rõ ràng, tức thời thông qua LM Studio và Lemonade. Thông báo này củng cố luận điểm về "PC Đại Lý" — một tương lai nơi các AI đại lý mạnh mẽ có thể chạy một cách riêng tư, liên tục và hiệu quả về chi phí trên phần cứng mà người dùng đã sở hữu .