AMD merilis tolok ukur performa awal untuk Muse Glimmer 30B di perangkat keras terbaru mereka. Pengujian dilakukan di Windows menggunakan proyek llama.cpp dengan backend Vulkan dan speculative decoding dFlash .
Perlu dicatat, ini adalah hasil awal yang diukur oleh AMD sendiri, sehingga performa akhir di dunia nyata mungkin berbeda tergantung konfigurasi sistem, pendinginan, dan beban kerja .
Model ini menggunakan kuantisasi 4-bit (K-Quant-Dynamic) untuk menekan ukuran memorinya dari lebih dari 55 GB pada presisi penuh menjadi sekitar 18–20 GB . Ini memungkinkan bobot model, cache KV, dan encoder persepsi dimuat secara bersamaan ke dalam satu GPU konsumen dengan VRAM 24 GB atau 32 GB . Pengujian Meta sendiri menemukan bahwa tingkat kuantisasi ini "menimbulkan degradasi yang minimal hingga tidak ada sama sekali pada tugas-tugas agenik" .
AMD dan mitra-mitranya telah menyediakan berbagai jalur langsung bagi developer untuk mulai membangun dengan Muse Glimmer sejak hari pertama.
LM Studio bermitra langsung dengan Meta untuk memberikan dukungan sejak hari pertama untuk Muse Glimmer di aplikasi desktop LM Studio Bionic . Pengguna dapat mengunduh dan menjalankan model secara lokal hanya dengan beberapa klik dari katalog dalam aplikasi. Varian Muse Glimmer terkecil membutuhkan setidaknya RAM 26 GB . LM Studio tersedia di Windows dan Linux, menggunakan runtime llama.cpp, dan merupakan alat penting dalam ekosistem AI lokal AMD .
Server AI lokal sumber terbuka milik AMD, Lemonade, diposisikan sebagai jalur integrasi utama . Lemonade menyajikan model yang berjalan secara lokal melalui API standar industri OpenAI, sehingga aplikasi apa pun yang sudah bekerja dengan OpenAI dapat langsung bekerja dengan instance Muse Glimmer lokal . Lemonade mendukung pembuatan teks, gambar, dan model audio dalam satu paket C++ ringan yang berjalan di Windows, Linux, macOS, dan Docker .
Selain LM Studio dan Lemonade, Muse Glimmer mendapat dukungan ekosistem luas yang mulai diluncurkan bersamaan:
meta-models/Muse-Glimmer-30B di bawah lisensi Apache 2.0 .Luasnya perangkat ini berarti developer tidak terkunci pada satu runtime dan dapat memilih tumpukan yang paling sesuai dengan skenario deployment mereka .
AMD secara eksplisit menyebut kombinasi Muse Glimmer dan perangkat keras mereka sebagai "fase berikutnya dari PC Agenik" . Argumen strategisnya terdiri dari tiga bagian:
Menjalankan inferensi sepenuhnya di perangkat keras lokal berarti data sensitif — dokumen, kode, informasi pribadi — tidak pernah meninggalkan mesin pengguna. Tidak ada panggilan API ke server pihak ketiga, tidak ada data yang dicatat oleh penyedia cloud, dan tidak ada ketergantungan pada konektivitas jaringan . Untuk kasus penggunaan perusahaan yang melibatkan data rahasia, ini adalah keunggulan yang menentukan.
Setelah perangkat keras dibeli, inferensi lokal tidak memiliki biaya per-token. Tidak ada biaya penggunaan API, tidak ada biaya langganan untuk titik akhir inferensi, dan tidak ada biaya komputasi cloud yang berubah-ubah . Bagi developer yang menjalankan proses agen berkelanjutan atau beban kerja batch yang berat, ini secara fundamental mengubah ekonomi penerapan agen AI.
Keputusan Meta untuk merilis Muse Glimmer di bawah lisensi Apache 2.0 yang permisif adalah bagian penting dari tawaran ini . Developer dapat memeriksa, memodifikasi, melakukan fine-tuning, dan mendistribusikan ulang model tanpa batasan. Ini menghilangkan ketergantungan pada vendor penyedia model tunggal dan selaras dengan dorongan AMD yang lebih luas untuk membangun alternatif terbuka dari ekosistem CUDA milik Nvidia .
Seperti yang dinyatakan AMD di blog resmi mereka: "Kombinasi model open-weight seperti Muse Glimmer dan perangkat keras lokal yang bertenaga menjaga semua inferensi tetap privat, latensi rendah, dan tidak bergantung pada biaya atau konektivitas API cloud" .
Meskipun pengumuman ini signifikan, ada beberapa catatan yang perlu diingat:
Konfirmasi AMD atas dukungan lokal untuk Meta Muse Glimmer 30B adalah tonggak penting bagi ekosistem AI lokal. Ini memvalidasi bahwa model agenik 30 miliar parameter yang mumpuni dapat berjalan di satu GPU konsumen, memberikan developer alternatif open-weight yang matang di bawah lisensi Apache 2.0, dan menawarkan jalur integrasi yang jelas dan langsung melalui LM Studio dan Lemonade. Pengumuman ini memperkuat argumen untuk "PC Agenik" — sebuah masa depan di mana agen AI yang canggih berjalan secara pribadi, terus-menerus, dan hemat biaya di perangkat keras yang sudah dimiliki pengguna .