نشرت AMD نتائج أداء أولية لنموذج Muse Glimmer 30B على أحدث أجهزتها. تم إجراء الاختبارات على نظام ويندوز باستخدام مشروع llama.cpp مع واجهة Vulkan الخلفية وتقنية فك الترميز التخميني dFlash .
من المهم ملاحظة أن هذه نتائج أولية قاستها AMD بنفسها، لذا قد يختلف الأداء النهائي في التطبيقات الحقيقية اعتمادًا على تكوين النظام والتبريد وطبيعة المهام .
يستخدم النموذج تقنية الضغط 4-bit (K-Quant-Dynamic) لتصغير حجمه من أكثر من 55 جيجابايت في الدقة الكاملة إلى حوالي 18–20 جيجابايت . هذا يسمح بتحميل أوزان النموذج وذاكرة التخزين المؤقت ومشفر الإدراك الحسي في وقت واحد على بطاقة رسوميات استهلاكية واحدة بسعة 24 أو 32 جيجابايت . وجدت Meta في اختباراتها أن هذا المستوى من الضغط لا يسبب "سوى أدنى حد من التدهور في المهام الوكيلة" .
ضمنت AMD وشركاؤها وجود مسارات متعددة وفورية للمطورين لبدء العمل مع Muse Glimmer من اليوم الأول.
تعاونت LM Studio بشكل مباشر مع Meta لتوفير الدعم الفوري من اليوم الأول لنموذج Muse Glimmer في تطبيقها سطح المكتب LM Studio Bionic . يمكن للمستخدمين تنزيل النموذج وتشغيله محليًا ببضع نقرات من الكتالوج المدمج في التطبيق. أصغر نسخة من Muse Glimmer تتطلب على الأقل 26 جيجابايت من ذاكرة الوصول العشوائي . يتوفر LM Studio على كل من ويندوز ولينكس، ويستخدم بيئة تشغيل llama.cpp، وهو أداة رئيسية في نظام AMD البيئي للذكاء الاصطناعي المحلي .
يتم وضع خادم الذكاء الاصطناعي المحلي مفتوح المصدر من AMD، Lemonade، كمسار تكامل أساسي . يوفر Lemonade إمكانية الوصول إلى النماذج المحلية عبر واجهة برمجة التطبيقات القياسية OpenAI API. هذا يعني أن أي تطبيق حالي يعمل مع OpenAI يمكنه العمل فورًا مع نسخة محلية من Muse Glimmer . يدعم الخادم نماذج النصوص وتوليد الصور والصوت في حزمة C++ واحدة خفيفة الوزن تعمل على ويندوز ولينكس وماك وDocker .
بالإضافة إلى LM Studio وLemonade، يتمتع Muse Glimmer بدعم واسع من النظام البيئي الذي يتم إطلاقه بالتزامن مع الإصدار:
meta-models/Muse-Glimmer-30B ورخصة Apache 2.0 .هذا التنوع في الأدوات يعني أن المطورين ليسوا مقيدين ببيئة تشغيل واحدة ويمكنهم اختيار المجموعة التي تناسب سيناريو النشر الخاص بهم .
تطلق AMD صراحةً على مزيج Muse Glimmer وأجهزتها اسم "المرحلة التالية من حاسبات Agentic PC" . الحجة الاستراتيجية قائمة على ثلاث نقاط:
تشغيل الاستدلال محليًا يعني أن البيانات الحساسة — المستندات، الأكواد، المعلومات الشخصية — لا تغادر جهاز المستخدم أبدًا. لا توجد استدعاءات لواجهات برمجة تطبيقات خارجية، ولا يتم تسجيل البيانات من قبل مزودي الخدمات السحابية، ولا توجد تبعية على الاتصال بالشبكة . لحالات الاستخدام المؤسسي التي تتضمن بيانات سرية، هذه ميزة حاسمة.
بمجرد شراء الجهاز، لا يوجد للاستدلال المحلي تكلفة لكل رمز. لا توجد رسوم استخدام لواجهة برمجة التطبيقات، ولا رسوم اشتراك لنقاط نهاية الاستدلال، ولا تكاليف حوسبة سحابية متغيرة . للمطورين الذين يديرون حلقات وكيل مستمرة أو مهام دفعية ثقيلة، هذا يغير بشكل أساسي اقتصاديات نشر وكلاء الذكاء الاصطناعي.
قرار Meta بإصدار Muse Glimmer تحت رخصة Apache 2.0 المتسامحة هو جزء حاسم من هذه الاستراتيجية . يمكن للمطورين فحص النموذج بالكامل وتعديله وضبطه بدقة وإعادة توزيعه دون قيود. هذا يلغي أي تقييد لمزود نموذج معين ويتوافق مع مسعى AMD الأوسع لبناء بديل مفتوح للنظام البيئي الاحتكاري Nvidia CUDA .
وكما تذكر AMD في مدونتها الرسمية: "مزيج النماذج مفتوحة الأوزان مثل Muse Glimmer والأجهزة المحلية القوية يحافظ على سرية كل عمليات الاستدلال، ويقلل زمن الاستجابة، ويجعلها مستقلة عن تكاليف واجهة برمجة التطبيقات السحابية أو الاتصال بالإنترنت" .
بينما الإعلان مهم، هناك عدة تحفظات يجب وضعها في الاعتبار:
تأكيد AMD لدعمها المحلي لنموذج Muse Glimmer 30B من Meta هو إنجاز كبير للنظام البيئي للذكاء الاصطناعي المحلي. إنه يؤكد أن نموذجًا وكيلًا قويًا بـ 30 مليار معامل يمكن تشغيله على بطاقة رسوميات استهلاكية واحدة، ويوفر للمطورين بديلاً ناضجًا مفتوح الأوزان تحت رخصة Apache 2.0، ويقدم مسارات تكامل فورية وواضحة عبر LM Studio وLemonade. هذا الإعلان يعزز فكرة "حاسبات Agentic PC" — مستقبل تعمل فيه وكلاء الذكاء الاصطناعي الأقوياء بشكل خاص ومستمر ومنخفض التكلفة على الأجهزة التي يمتلكها المستخدمون بالفعل .