AMD опублікувала попередні показники продуктивності для Muse Glimmer 30B на своєму новітньому обладнанні. Тести проводилися на Windows з використанням проєкту llama.cpp з бекендом Vulkan та спекулятивним декодуванням dFlash .
Важливо зазначити, що це ранні, попередні результати, виміряні AMD, тому реальна продуктивність може відрізнятися залежно від конфігурації системи, охолодження та навантаження .
Модель використовує 4-бітне квантування (K-Quant-Dynamic), щоб зменшити свій обсяг пам’яті з понад 55 ГБ у повній точності до приблизно 18–20 ГБ . Це дозволяє одночасно завантажити ваги моделі, KV-кеш та кодувальник сприйняття на одну споживчу відеокарту з 24 ГБ або 32 ГБ VRAM . Власні тести Meta показали, що такий рівень квантування призводить до «мінімальної або нульової деградації на агентних завданнях» .
AMD та її партнери забезпечили декілька негайних шляхів для розробників, щоб почати працювати з Muse Glimmer з першого дня.
LM Studio напряму співпрацювала з Meta, щоб забезпечити підтримку Muse Glimmer з першого дня у своєму десктопному додатку LM Studio Bionic . Користувачі можуть завантажити та запустити модель локально за кілька кліків з каталогу додатку. Найменший варіант Muse Glimmer вимагає щонайменше 26 ГБ оперативної пам’яті . LM Studio доступна як на Windows, так і на Linux, використовує середовище виконання llama.cpp і є ключовим інструментом для локальної AI-екосистеми AMD .
Власний відкритий локальний AI-сервер AMD, Lemonade, позиціонується як основний шлях інтеграції . Lemonade надає доступ до локально запущених моделей через стандартний OpenAI API, що дозволяє будь-якому існуючому додатку, який працює з OpenAI, миттєво працювати з локальним екземпляром Muse Glimmer . Він підтримує генерацію тексту, зображень та аудіомоделі в одному легкому пакунку на C++, який працює на Windows, Linux, macOS та Docker .
Окрім LM Studio та Lemonade, Muse Glimmer має широку підтримку екосистеми, яка розгортається разом із запуском:
meta-models/Muse-Glimmer-30B під ліцензією Apache 2.0 .Така широта інструментів означає, що розробники не прив'язані до єдиного середовища виконання і можуть вибрати стек, який найкраще підходить для їхнього сценарію розгортання .
AMD прямо називає комбінацію Muse Glimmer та свого обладнання «наступною фазою Агентного ПК» . Стратегічна аргументація складається з трьох частин:
Запуск інференсу повністю на локальному обладнанні означає, що конфіденційні дані — документи, код, особиста інформація — ніколи не залишають машину користувача. Відсутні виклики API до сторонніх серверів, дані не логуються хмарними провайдерами, і немає залежності від мережевого з'єднання . Для корпоративних випадків використання, що включають конфіденційні дані, це є вирішальною перевагою.
Після придбання апаратного забезпечення локальний інференс не має вартості за токен. Відсутні плата за використання API, абонентська плата за кінцеві точки інференсу та змінні витрати на хмарні обчислення . Для розробників, які запускають безперервні цикли агентів або важкі пакетні навантаження, це фундаментально змінює економіку розгортання AI-агентів.
Рішення Meta випустити Muse Glimmer під дозвільною ліцензією Apache 2.0 є критично важливою частиною пропозиції . Розробники можуть повністю перевіряти, модифікувати, доналаштовувати та розповсюджувати модель без обмежень. Це усуває прив'язку до єдиного постачальника моделей і узгоджується з ширшим прагненням AMD побудувати відкриту альтернативу пропрієтарній екосистемі CUDA від Nvidia .
Як заявляє AMD у своєму офіційному блозі: «Поєднання моделей з відкритою вагою, таких як Muse Glimmer, і потужного локального обладнання зберігає весь інференс приватним, з низькою затримкою та незалежним від витрат на хмарні API або підключення» .
Хоча оголошення є значним, слід пам'ятати про декілька застережень:
Підтвердження AMD локальної підтримки Meta Muse Glimmer 30B є значною віхою для локальної AI-екосистеми. Воно підтверджує, що продуктивна 30-мільярдна параметрична модель-агент може працювати на одній споживчій відеокарті, надає розробникам зрілу відкриту альтернативу під ліцензією Apache 2.0 та пропонує чіткі, негайні шляхи інтеграції через LM Studio та Lemonade. Це оголошення посилює аргументи на користь «Агентного ПК» — майбутнього, де потужні AI-агенти працюють приватно, безперервно та економічно ефективно на апаратному забезпеченні, яким користувачі вже володіють .