AMD פרסמה מדדי ביצועים ראשוניים עבור Muse Glimmer 30B על החומרה העדכנית ביותר שלה. הבדיקות בוצעו על Windows תוך שימוש בפרויקט llama.cpp עם backend מבוסס Vulkan ופענוח ספקולטיבי (dFlash) .
חשוב לציין כי אלו תוצאות ראשוניות שנמדדו על ידי AMD, ולכן ביצועים סופיים בעולם האמיתי עשויים להשתנות בהתאם לתצורת המערכת, הקירור והעומס .
המודל משתמש בקוונטיזציה של 4 סיביות (K-Quant-Dynamic) כדי לדחוס את טביעת הרגל בזיכרון מלמעלה מ-55 גיגה-בייט בדיוק מלא לכ-18–20 גיגה-בייט . קומפרסיה זו מאפשרת לטעון את משקולות המודל, מטמון ה-KV ומקודד התפיסה (perception encoder) בו-זמנית על כרטיס מסך אחד לצרכן בעל 24 גיגה-בייט או 32 גיגה-בייט זיכרון VRAM . בדיקות Meta עצמה מצאו שרמת קוונטיזציה זו גורמת ל"פגיעה מינימלית עד אפסית במשימות סוכן" .
AMD ושותפיה דאגו שמספר מסלולים מיידיים יעמדו לרשות המפתחים להתחיל לעבוד עם Muse Glimmer מהיום הראשון.
LM Studio שיתפה פעולה ישירות עם Meta כדי לספק תמיכה מיידית ב-Muse Glimmer מתוך יישום שולחן העבודה LM Studio Bionic . משתמשים יכולים להוריד ולהריץ את המודל מקומית בכמה קליקים מהקטלוג המובנה באפליקציה. הגרסה הקטנה ביותר של Muse Glimmer דורשת לפחות 26 גיגה-בייט של RAM . LM Studio זמינה גם ב-Windows וגם בלינוקס, משתמשת ב-runtime של llama.cpp, ומהווה כלי מרכזי במערכת האקולוגית המקומית של AMD ל-AI .
שרת ה-AI המקומי בקוד הפתוח של AMD, Lemonade, ממוקם כמסלול אינטגרציה ראשי . Lemonade חושף מודלים רצים מקומית דרך ממשק ה-API הסטנדרטי של OpenAI (OpenAI API), מה שמאפשר לכל יישום קיים שעובד עם OpenAI לעבוד באופן מיידי עם מופע מקומי של Muse Glimmer . Lemonade תומך ביצירת טקסט, תמונות ומודלי שמע בחבילה אחת קלת-משקל ב-C++ הרצה על Windows, Linux, macOS ו-Docker .
מעבר ל-LM Studio ו-Lemonade, ל-Muse Glimmer תמיכה רחבה במערכת האקולוגית שמתגלגלת במקביל להשקה:
meta-models/Muse-Glimmer-30B תחת רישיון Apache 2.0 .רוחב הכלים הזה אומר שמפתחים אינם נעולים ל-runtime יחיד ויכולים לבחור את הערימה המתאימה ביותר לתרחיש הפריסה שלהם .
AMD קוראת במפורש לשילוב של Muse Glimmer והחומרה שלה "השלב הבא של המחשב האישי הסוכן" . הטיעון האסטרטגי משולש:
הרצת הסקה (inference) במלואה על חומרה מקומית פירושה שמידע רגיש – מסמכים, קוד, מידע אישי – לעולם לא עוזב את המכונה של המשתמש. אין קריאות API לשרתי צד שלישי, אין נתונים שנרשמים על ידי ספקי ענן, ואין תלות בקישוריות רשת . עבור מקרים ארגוניים הכוללים מידע סודי, זהו יתרון מכריע.
לאחר רכישת החומרה, להסקה מקומית אין עלות לטוקן. אין דמי שימוש ב-API, אין חיובי מנוי עבור נקודות קצה להסקה, ואין עלויות מחשוב ענן משתנות . עבור מפתחים המריצים לולאות סוכן רציפות או עומסי עבודה כבדים של עיבוד-אצווה (batch), הדבר משנה מהיסוד את הכלכלה של פריסת סוכני AI.
החלטתה של Meta לשחרר את Muse Glimmer תחת רישיון Apache 2.0 המתירני היא חלק קריטי מההצעה . מפתחים יכולים לבדוק, לשנות, לכוונן (fine-tune) ולהפיץ מחדש את המודל לחלוטין ללא הגבלה. זה מבטל את נעילת הספק (vendor lock-in) לכל ספק מודל יחיד ומתיישר עם המאמץ הרחב יותר של AMD לבנות חלופה פתוחה למערכת הקניינית CUDA של Nvidia .
כפי ש-AMD מצהירה בבלוג הרשמי שלה: "השילוב של מודלים עם משקולות פתוחות כמו Muse Glimmer וחומרה מקומית רבת-עצמה שומר על כל ההסקה פרטית, בעלת השהייה נמוכה, ועצמאית מעלויות או קישוריות של API בענן" .
בעוד ההכרזה משמעותית, מספר אזהרות צריכות למתן ציפיות:
אישורה של AMD לתמיכה מקומית ב-Muse Glimmer 30B של Meta הוא אבן דרך משמעותית עבור המערכת האקולוגית המקומית של AI. זה מאמת שמודל סוכן בעל 30 מיליארד פרמטרים יכול לרוץ על כרטיס מסך אחד לצרכן, מספק למפתחים חלופה רבת-עצמה עם משקולות פתוחות תחת Apache 2.0, ומציע מסלולי אינטגרציה מיידיים וברורים דרך LM Studio ו-Lemonade. ההכרזה מחזקת את הטיעון בעד "המחשב האישי הסוכן" – עתיד שבו סוכני AI מתקדמים פועלים באופן פרטי, רציף וחסכוני על חומרה שכבר נמצאת בבעלות המשתמשים .