ข้อควรทราบ: ขณะที่แหล่งข่าวหลายแห่งเรียกโมเดลนี้ว่า 'M3 Pro' แต่รายงานของรอยเตอร์ R ไม่ได้ยืนยันชื่อนี้โดยตรง ดังนั้นชื่อจริงที่ใช้เปิดตัวอาจแตกต่างออกไป
เส้นทางการพัฒนาโมเดลของ MiniMax ดำเนินไปอย่างรวดเร็ว:
| โมเดล | วันที่เปิดตัว | จำนวนพารามิเตอร์ | สถาปัตยกรรม | คุณสมบัติเด่น |
|---|---|---|---|---|
| MiniMax-M1 | มิถุนายน 2025 | 456B รวม / 45.9B ทำงานจริง | MoE + Hybrid Attention | โมเดล AI Reasoning แบบ Open-Weight ตัวแรกของโลกที่มี Hybrid Attention, 1M context, สัญญาอนุญาต Apache 2.0, อ้างว่าเหนือกว่า DeepSeek R1 ในบางงาน BPW |
| MiniMax M3 | 1 มิถุนายน 2026 | ~428B รวม / ~23B ทำงานจริง | MoE (Sparse Attention) | โค้ดดิ้งระดับแนวหน้า (59.0% SWE-bench Pro), รองรับ 1M token, มัลติโมดัล (ภาพ/วิดีโอ/ควบคุมคอมพิวเตอร์), Open-Weight บน Hugging Face BBP |
| M3 Pro (วางแผน) | TBD (คาด Q3 2026) | 2.7T รวม (น่าจะเป็น MoE) | TBD | น่าจะเป็น Open-Weight Model ที่ใหญ่ที่สุดในโลก, ใหญ่ที่สุดโดยบริษัทจีน R |
การก้าวกระโดดจาก M3 (~428B) มาสู่ 2.7T ถือเป็นการเพิ่มขนาดพารามิเตอร์รวมถึง ~6.3 เท่า หาก MiniMax ยังคงใช้สถาปัตยกรรม Mixture-of-Experts (MoE) เช่นเดิม จำนวนพารามิเตอร์ที่ทำงานจริงต่อการประมวลผลหนึ่งครั้ง (Active Parameters) อาจยังคงอยู่ที่หลักสิบถึงร้อยล้านล้าน แต่ขนาดรอยเท้าพารามิเตอร์รวม (Total Parameter Footprint) จะไม่เคยมีมาก่อนสำหรับโมเดลแบบ Open-Weight R
DeepSeek-V4-Pro เป็นโมเดล Open-Weight เรือธงของ DeepSeek ที่เปิดตัวเมื่อวันที่ 23 เมษายน 2026 D เปรียบเทียบสเปกสำคัญ:
อย่างไรก็ตาม บทวิเคราะห์ส่วนใหญ่ชี้ว่า MiniMax M3 และ DeepSeek V4-Pro "แทบจะไม่ใช่คู่แข่งโดยตรง" — พวกมันถูกปรับให้เหมาะสมกับงานคนละประเภท: M3 สำหรับงาน Coding แบบ Agentic, มัลติโมดัล และงานที่ต้องการบริบทยาว ในขณะที่ V4-Pro สำหรับงาน Coding แบบ Pure-Text เชิงอัลกอริทึมที่เน้นปริมาณงานสูงในต้นทุนที่ต่ำกว่า DD
ค่าย AI จีนต่างเร่งปล่อยโมเดล Open-Weight ที่ทรงพลังออกมาอย่างต่อเนื่องในช่วงปี 2025–2026:
กลยุทธ์นี้สะท้อนความตั้งใจของค่าย AI จีนในการปล่อยโมเดลแบบ Open-Weight (มักใช้สัญญาอนุญาต Apache 2.0 หรือ MIT) ซึ่งตรงกันข้ามกับค่ายตะวันตกอย่าง OpenAI, Anthropic และ Google ที่มักเก็บเทคโนโลยีโมเดลระดับแนวหน้าไว้เป็นความลับ RPD
การนำโมเดล Open-Weight ขนาด 2.7T มาใช้งานจริงจะเผชิญกับอุปสรรคใหญ่:
อย่างไรก็ตาม MiniMax มีประวัติด้านวิศวกรรมประสิทธิภาพ — M1 ถูกฝึกโดยใช้ทรัพยากรคอมพิวเตอร์น้อยกว่า DeepSeek R1 ถึง 70% ในขณะที่มีผลงานเทียบเคียง PW และ M3 ใช้กลไก Sparse Attention B พวกเขาอาจใช้เทคโนโลยีที่เป็นนวัตกรรมคล้ายกันสำหรับโมเดล 2.7T นี้
โมเดล Open-Weight จากจีนได้รับการยอมรับเพิ่มขึ้นทั่วโลกด้วยสาเหตุหลายประการ:
แนวโน้มนี้ส่งสัญญาณว่า จีนไม่ได้เป็นแค่ผู้ตามที่ขาดแคลนฮาร์ดแวร์อีกต่อไป แต่กำลังเป็นผู้นำในการปล่อยโมเดล Open-Weight โดยใช้กลยุทธ์การเปิดกว้างเป็นปราการแข่งขันกับผู้นำตะวันตกที่ปิดกั้นโมเดล โมเดล 2.7T ที่วางแผนไว้ หากเป็นจริง จะเป็นข้อความที่แข็งแกร่งที่สุดในทิศทางนั้น