เมื่อวันที่ 24 กรกฎาคม 2026 AMD ได้ประกาศเปิดตัว Instella-MoE โมเดลภาษา Mixture-of-Experts (MoE) แบบโอเพนซอร์สเต็มรูปแบบ ขนาด 16,000 ล้านพารามิเตอร์ (16B) ซึ่งถูกฝึกสอนตั้งแต่เริ่มต้นบน GPU AMD Instinct MI300X และ MI325X โดยใช้ซอฟต์แวร์สแต็ก ROCm จุดเด่นคือโมเดลนี้จะเปิดใช้งานเพียง 2.8 พันล้านพารามิเตอร์ต่อหนึ่ง Token ทำให้มีประสิทธิภาพสูง แต่ยังคงให้ประสิทธิภาพการทำงานที่แข่งขันได้ในหลายเกณฑ์มาตรฐาน
การเปิดตัวครั้งนี้ถือเป็นก้าวสำคัญทางกลยุทธ์ แสดงให้เห็นว่าฮาร์ดแวร์และซอฟต์แวร์โอเพนซอร์สของ AMD สามารถรองรับการพัฒนา AI ขนาดใหญ่ ตั้งแต่การฝึกสอนล่วงหน้า (Pre-training) จนถึงการเรียนรู้แบบเสริมแรง (Reinforcement Learning) ซึ่งถือเป็นการท้าชนระบบนิเวศ CUDA ที่โดดเด่นของ NVIDIA
Instella-MoE ใช้การกำหนดค่าแบบ Shared-plus-Routed Expert โดยมีผู้เชี่ยวชาญที่แชร์กัน (Shared Experts) 2 คนที่ทำงานตลอดเวลา และผู้เชี่ยวชาญแบบกำหนดเส้นทาง (Routed Experts) 6 คนที่ถูกเลือกจากทั้งหมด 64 คนต่อ Token โมเดลประกอบด้วย 27 ชั้น Decoder แต่ละชั้นมี Hidden Size ขนาด 2,048
นวัตกรรมทางสถาปัตยกรรมที่โดดเด่นมี 2 ประการ:
นอกจากนี้ โมเดลยังใช้ Multi-Token Prediction (MTP) ระหว่างช่วง Pre-training และ Mid-training อีกด้วย
หลังจากขั้นตอนการฝึกขยายบริบทระยะยาวโดยเฉพาะ Instella-MoE รองรับบริบทได้สูงสุดถึง 64,000 Token
AMD เผยแพร่กระบวนการฝึกสอนทั้งหมด ซึ่งประกอบด้วย 6 ขั้นตอนตามลำดับ :
โมเดลพื้นฐาน Instella-MoE-16B-A3B ได้คะแนนเฉลี่ย 76.7 ในการทดสอบมาตรฐาน ทำให้ติดอันดับต้นๆ ในบรรดาโมเดลโอเพนซอร์สเต็มรูปแบบในระดับเดียวกัน รายงานระบุว่าโมเดลนี้มีประสิทธิภาพเหนือกว่า SmolLM3-3B และ OLMo-3-7B และสามารถแข่งขันกับโมเดลที่มีขนาดใหญ่กว่าได้ แม้จะเปิดใช้งานเพียง 2.8 พันล้านพารามิเตอร์ต่อ Token
ตามความมุ่งมั่นในด้าน AI แบบเปิด AMD ได้เผยแพร่สิ่งที่เกี่ยวข้องกับการฝึกสอนทั้งหมดอย่างเปิดเผย :
สิ่งประดิษฐ์ทั้งหมดนี้มีให้ใช้งานบน Hugging Face ภายใต้เนมสเปซ amd/Instella-MoE-16B-A3B โดยใช้สิทธิ์การใช้งานแบบ Research RAIL (Responsible AI License) สำหรับวัตถุประสงค์ทางวิชาการและการวิจัยเท่านั้น
Instella-MoE ไม่ใช่แค่การปล่อยโมเดลเท่านั้น แต่มันคือการพิสูจน์โดยตรงว่า ซอฟต์แวร์สแต็ก ROCm และฮาร์ดแวร์ GPU Instinct ของ AMD สามารถรองรับการพัฒนา AI ในระดับแนวหน้าได้ ตั้งแต่การฝึกสอนล่วงหน้าไปจนถึงการเรียนรู้แบบเสริมแรง โดยใช้โครงสร้างพื้นฐานแบบโอเพนซอร์สทั้งหมด ด้วยการส่งมอบประสิทธิภาพที่แข่งขันได้เมื่อเทียบกับโมเดลโอเพนซอร์สชั้นนำที่ฝึกบนฮาร์ดแวร์ NVIDIA ทำให้ AMD วางตำแหน่งระบบนิเวศของตนเองให้เป็นทางเลือกที่ใช้งานได้จริงแทนที่ CUDA ของ NVIDIA สำหรับการวิจัยและพัฒนา AI ขนาดใหญ่
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD ประกาศเปิดตัว Instella MoE เมื่อวันที่ 24 กรกฎาคม 2026 โมเดลภาษา Mixture of Experts (MoE) ขนาด 16B พารามิเตอร์ แต่เปิดใช้งานเพียง 2.8B ต่อ Token ฝึกสอนบน GPU AMD Instinct MI300X และ MI325X
AMD ประกาศเปิดตัว Instella MoE เมื่อวันที่ 24 กรกฎาคม 2026 โมเดลภาษา Mixture of Experts (MoE) ขนาด 16B พารามิเตอร์ แต่เปิดใช้งานเพียง 2.8B ต่อ Token ฝึกสอนบน GPU AMD Instinct MI300X และ MI325X มาพร้อมนวัตกรรมสถาปัตยกรรม Gated Multi head Latent Attention (Gated MLA) และ FarSkip Collective ที่เร่งความเร็ว Pre training ได้ถึง 12.7% ผ่านกระบวนการฝึก 6 ขั้นตอน เป็นโมเดลโอเพนซอร์สเต็มรูปแบบ
ผลงานเด่น! Instella MoE 16B A3B ทำคะแนนเฉลี่ย 76.7 แต้ม สูงกว่า SmolLM3 3B และ OLMo 3 7B รองรับบริบทยาว 64K Token เปิดเผยทุกอย่างบน Hugging Face ภายใต้สัญญาอนุญาต Research RAIL