AMD ने अपने नवीनतम हार्डवेयर पर Muse Glimmer 30B के प्रारंभिक प्रदर्शन बेंचमार्क प्रकाशित किए। ये परीक्षण विंडोज पर llama.cpp प्रोजेक्ट के Vulkan बैकएंड और dFlash स्पेक्युलेटिव डिकोडिंग के साथ चलाए गए ।
यह ध्यान रखना महत्वपूर्ण है कि ये शुरुआती परिणाम हैं, जिन्हें AMD ने अपने परीक्षणों में मापा है। वास्तविक दुनिया का प्रदर्शन अलग हो सकता है ।
मॉडल अपने मेमोरी फुटप्रिंट को कम करने के लिए 4-बिट क्वांटाइजेशन (K-Quant-Dynamic) का उपयोग करता है, जिससे यह पूर्ण प्रेसिजन में 55 GB से अधिक से घटकर लगभग 18-20 GB रह जाता है । यह मॉडल वेट्स, केवी कैश और परसेप्शन एनकोडर को एक साथ 24 GB या 32 GB VRAM वाले सिंगल कंज्यूमर GPU पर लोड करने की अनुमति देता है । Meta के अपने परीक्षणों में पाया गया कि क्वांटाइजेशन के इस स्तर से 'एजेंटिक कार्यों में न्यूनतम या कोई गिरावट नहीं आती' ।
AMD और उसके पार्टनर्स ने डेवलपर्स के लिए पहले दिन से ही Muse Glimmer के साथ काम शुरू करने के कई तत्काल रास्ते सुनिश्चित किए हैं।
LM Studio ने सीधे Meta के साथ साझेदारी की है और अपने LM Studio Bionic डेस्कटॉप एप्लिकेशन में Muse Glimmer के लिए डे-ज़ीरो सपोर्ट प्रदान किया है । उपयोगकर्ता इन-ऐप कैटलॉग से कुछ ही क्लिक में मॉडल को डाउनलोड और स्थानीय रूप से चला सकते हैं। सबसे छोटे Muse Glimmer वेरिएंट को कम से कम 26 GB RAM की आवश्यकता होती है । LM Studio विंडोज और लिनक्स दोनों पर उपलब्ध है और AMD के स्थानीय AI इकोसिस्टम के लिए एक प्रमुख टूल है ।
AMD का अपना ओपन-सोर्स स्थानीय AI सर्वर, Lemonade, एक प्रमुख एकीकरण पथ के रूप में स्थापित है । यह उद्योग-मानक OpenAI API के माध्यम से स्थानीय रूप से चलने वाले मॉडलों को एक्सपोज़ करता है, जिससे कोई भी मौजूदा एप्लिकेशन जो OpenAI के साथ काम करता है, तुरंत स्थानीय Muse Glimmer इंस्टेंस के साथ काम कर सकता है । यह टेक्स्ट जनरेशन, इमेज जनरेशन और ऑडियो मॉडल को एक ही हल्के C++ पैकेज में सपोर्ट करता है जो विंडोज, लिनक्स, macOS और Docker पर चलता है ।
LM Studio और Lemonade के अलावा, Muse Glimmer को लॉन्च के साथ ही कई अन्य प्लेटफॉर्म्स पर भी सपोर्ट मिल रहा है:
meta-models/Muse-Glimmer-30B पर Apache 2.0 लाइसेंस के तहत उपलब्ध हैं ।टूलिंग की यह विस्तृत श्रृंखला डेवलपर्स को एक ही रनटाइम में बंद नहीं करती, बल्कि उन्हें अपने डिप्लॉयमेंट परिदृश्य के अनुसार सबसे उपयुक्त स्टैक चुनने की सुविधा देती है ।
AMD ने स्पष्ट रूप से Muse Glimmer और अपने हार्डवेयर के संयोजन को 'एजेंटिक PC का अगला चरण' बताया है । इसका रणनीतिक तर्क तीन गुना है:
पूरी तरह से स्थानीय हार्डवेयर पर इन्फ्रेंस चलाने का मतलब है कि संवेदनशील डेटा — दस्तावेज़, कोड, व्यक्तिगत जानकारी — उपयोगकर्ता की मशीन से कभी बाहर नहीं जाता। तीसरे पक्ष के सर्वरों पर कोई एपीआई कॉल नहीं होती, क्लाउड प्रदाताओं द्वारा कोई डेटा लॉग नहीं किया जाता, और नेटवर्क कनेक्टिविटी पर कोई निर्भरता नहीं रहती । गोपनीय डेटा से जुड़े एंटरप्राइज़ उपयोग के मामलों में यह एक निर्णायक लाभ है।
एक बार हार्डवेयर खरीद लेने के बाद, स्थानीय इन्फ्रेंस की प्रति-टोकन कोई लागत नहीं होती। इसमें कोई एपीआई उपयोग शुल्क, इन्फ्रेंस एंडपॉइंट के लिए कोई सब्सक्रिप्शन शुल्क, और कोई परिवर्तनीय क्लाउड कंप्यूटिंग लागत नहीं होती । निरंतर एजेंट लूप या भारी बैच वर्कलोड चलाने वाले डेवलपर्स के लिए, यह AI एजेंटों को तैनात करने की अर्थव्यवस्था को मौलिक रूप से बदल देता है।
Meta द्वारा Muse Glimmer को अनुमेय Apache 2.0 लाइसेंस के तहत जारी करना इस तर्क का एक महत्वपूर्ण हिस्सा है । डेवलपर बिना किसी प्रतिबंध के मॉडल का पूरी तरह से निरीक्षण, संशोधन, फाइन-ट्यून और पुनर्वितरण कर सकते हैं। यह किसी एक मॉडल प्रदाता पर विक्रेता लॉक-इन को समाप्त करता है और Nvidia के मालिकाना CUDA इकोसिस्टम के लिए एक खुला विकल्प बनाने के AMD के व्यापक प्रयास के अनुरूप है ।
जैसा कि AMD ने अपने आधिकारिक ब्लॉग पर कहा: 'Muse Glimmer जैसे ओपन-वेट मॉडल और शक्तिशाली स्थानीय हार्डवेयर का संयोजन सभी इन्फ्रेंस को निजी, कम-विलंबता और क्लाउड API लागतों या कनेक्टिविटी से स्वतंत्र रखता है' ।
हालांकि यह घोषणा महत्वपूर्ण है, फिर भी कुछ सावधानियां बरतनी चाहिए:
Meta के Muse Glimmer 30B के लिए AMD की स्थानीय सपोर्ट की पुष्टि स्थानीय AI इकोसिस्टम के लिए एक महत्वपूर्ण मील का पत्थर है। यह साबित करता है कि एक प्रदर्शनशील, 30 बिलियन-पैरामीटर वाला एजेंटिक मॉडल एक कंज्यूमर GPU पर चल सकता है, डेवलपर्स को Apache 2.0 के तहत एक परिपक्व ओपन-वेट विकल्प प्रदान करता है, और LM Studio और Lemonade के माध्यम से स्पष्ट, तत्काल एकीकरण पथ प्रदान करता है। यह घोषणा 'एजेंटिक PC' के मामले को मजबूत करती है — एक ऐसा भविष्य जहां सक्षम AI एजेंट उपयोगकर्ता के पहले से मौजूद हार्डवेयर पर निजी, निरंतर और लागत-प्रभावी रूप से चलते हैं ।