AMD เผยแพร่ benchmark ประสิทธิภาพเบื้องต้นของ Muse Glimmer 30B บนฮาร์ดแวร์รุ่นล่าสุด การทดสอบใช้ llama.cpp กับ Vulkan backend และ dFlash speculative decoding บนระบบปฏิบัติการ Windows
ควรทราบว่าผลลัพธ์เหล่านี้เป็นข้อมูลเบื้องต้นจากการทดสอบของ AMD ประสิทธิภาพจริงอาจแตกต่างกันไปตามการกำหนดค่าระบบ การระบายความร้อน และปริมาณงาน
โมเดลใช้การบีบอัด 4-bit (K-Quant-Dynamic) เพื่อลดขนาดหน่วยความจำจากกว่า 55 GB ในความแม่นยำเต็มรูปแบบ เหลือประมาณ 18–20 GB ซึ่งทำให้น้ำหนักโมเดล, KV cache และ perception encoder สามารถโหลดพร้อมกันบน GPU ทั่วไปที่มี VRAM 24 GB หรือ 32 GB การทดสอบของ Meta พบว่าการบีบอัดในระดับนี้ "แทบไม่ทำให้ประสิทธิภาพในงานที่เป็น agentic tasks ลดลงเลย"
AMD และพันธมิตรได้เตรียมช่องทางหลายช่องทางเพื่อให้นักพัฒนาสามารถสร้างแอปพลิเคชันด้วย Muse Glimmer ได้ทันทีตั้งแต่วันแรก
LM Studio ร่วมมือกับ Meta โดยตรงเพื่อรองรับ Muse Glimmer ในแอปพลิเคชันเดสก์ท็อป LM Studio Bionic ตั้งแต่วันแรก ผู้ใช้สามารถดาวน์โหลดและรันโมเดลได้ในไม่กี่คลิกจากแค็ตตาล็อกในแอป Muse Glimmer รุ่นที่เล็กที่สุดต้องการ RAM อย่างน้อย 26 GB LM Studio ใช้งานได้ทั้งบน Windows และ Linux ใช้รันไทม์ llama.cpp และเป็นเครื่องมือสำคัญในระบบนิเวศ AI local ของ AMD
AMD มีเซิร์ฟเวอร์ AI โอเพนซอร์สของตัวเองชื่อ Lemonade ซึ่งถูกวางตำแหน่งให้เป็นช่องทางหลักสำหรับการผสานรวม Lemonade เปิดเผยโมเดลที่ทำงานบนเครื่องผ่าน API มาตรฐานของ OpenAI ทำให้แอปพลิเคชันใด ๆ ที่ทำงานกับ OpenAI สามารถทำงานกับ Muse Glimmer ที่รันบนเครื่อง local ได้ทันที Lemonade รองรับการสร้างข้อความ รูปภาพ และโมเดลเสียงในแพ็คเกจ C++ น้ำหนักเบาชุดเดียว ทำงานได้บน Windows, Linux, macOS และ Docker
นอกเหนือจาก LM Studio และ Lemonade แล้ว Muse Glimmer ยังมีระบบรองรับจากชุมชนที่กว้างขวางซึ่งทยอยออกมาพร้อมกับการเปิดตัว:
meta-models/Muse-Glimmer-30B ภายใต้สัญญาอนุญาต Apache 2.0 เครื่องมือที่หลากหลายนี้หมายความว่านักพัฒนาไม่ได้ถูกล็อกให้ใช้รันไทม์เดียว และสามารถเลือกสแต็กที่เหมาะสมกับสถานการณ์การปรับใช้ของตนได้
AMD เรียกการผสมผสานระหว่าง Muse Glimmer และฮาร์ดแวร์ของตนอย่างชัดเจนว่า "เฟสถัดไปของ Agentic PC" เหตุผลเชิงกลยุทธ์มีสามประการ:
การรัน inference บนฮาร์ดแวร์ในเครื่องทั้งหมดหมายความว่าข้อมูลที่ละเอียดอ่อน ไม่ว่าจะเป็นเอกสาร โค้ด หรือข้อมูลส่วนตัว จะไม่ถูกส่งออกจากเครื่องของผู้ใช้เลย ไม่มีการเรียก API ไปยังเซิร์ฟเวอร์ภายนอก ไม่มีข้อมูลที่ถูกบันทึกโดยผู้ให้บริการคลาวด์ และไม่ต้องพึ่งพาการเชื่อมต่อเครือข่าย สำหรับกรณีใช้งานในองค์กรที่เกี่ยวข้องกับข้อมูลที่เป็นความลับ นี่คือข้อได้เปรียบที่ชัดเจน
เมื่อซื้อฮาร์ดแวร์แล้ว การอนุมานในเครื่องไม่มีค่าใช้จ่ายต่อโทเคน ไม่มีค่าธรรมเนียมการใช้งาน API ไม่มีค่าสมัครสมาชิกสำหรับจุดสิ้นสุดการอนุมาน และไม่มีต้นทุนการประมวลผลแบบคลาวด์แบบแปรผัน สำหรับนักพัฒนาที่รันลูปเอเจนต์ต่อเนื่องหรืองานแบบ batch ขนาดหนัก สิ่งนี้เปลี่ยนแปลงเศรษฐศาสตร์ของการปรับใช้ AI Agent โดยพื้นฐาน
การตัดสินใจของ Meta ในการเผยแพร่ Muse Glimmer ภายใต้สัญญาอนุญาต Apache 2.0 เป็นส่วนสำคัญของข้อเสนอ นักพัฒนาสามารถตรวจสอบ แก้ไข ปรับแต่ง และแจกจ่ายโมเดลได้อย่างเต็มที่โดยไม่มีข้อจำกัด ซึ่งช่วยขจัดปัญหาการล็อกกับผู้ให้บริการโมเดลรายใดรายหนึ่ง และสอดคล้องกับความพยายามของ AMD ในการสร้างทางเลือกโอเพนซอร์สแทนระบบนิเวศ CUDA ที่เป็นกรรมสิทธิ์ของ Nvidia
AMD ระบุในบล็อกทางการว่า "การรวมกันของโมเดล open-weight เช่น Muse Glimmer และฮาร์ดแวร์ในเครื่องที่ทรงพลัง ช่วยให้การอนุมานทั้งหมดเป็นส่วนตัว หน่วงเวลาต่ำ และไม่ขึ้นกับต้นทุนหรือการเชื่อมต่อ API คลาวด์"
แม้การประกาศครั้งนี้จะมีความสำคัญ แต่ก็มีข้อควรพิจารณาหลายประการ:
การยืนยันของ AMD ในการรองรับ Muse Glimmer 30B ของ Meta บนเครื่อง local ถือเป็นก้าวสำคัญสำหรับระบบนิเวศ AI ในเครื่อง เป็นการยืนยันว่าโมเดลเอเจนต์ขนาด 30B พารามิเตอร์ที่ทรงพลังสามารถรันบน GPU ทั่วไปใบเดียวได้ มอบทางเลือกโอเพนซอร์สที่แข็งแกร่งและโตเต็มที่ภายใต้สัญญาอนุญาต Apache 2.0 และมีช่องทางผสานรวมที่ชัดเจนและทันทีผ่าน LM Studio และ Lemonade การประกาศนี้ช่วยเสริมสร้างแนวคิด "Agentic PC" อนาคตที่ AI Agent ที่ทรงพลังจะทำงานอย่างเป็นส่วนตัว ต่อเนื่อง และคุ้มค่าบนฮาร์ดแวร์ที่ผู้ใช้เป็นเจ้าของอยู่แล้ว