MiniMax telah menunjukkan perkembangan yang sangat pesat dalam lini modelnya:
Lompatan dari M3 (~428B) ke model baru (2.700B) merupakan peningkatan ~6,3 kali lipat dalam jumlah total parameter . Jika MiniMax tetap menggunakan arsitektur MoE (Mixture-of-Experts) seperti pada M1 dan M3, jumlah parameter aktif per forward pass bisa tetap berada di kisaran puluhan hingga ratusan miliar, tetapi jejak total parameternya akan menjadi sesuatu yang belum pernah terjadi sebelumnya untuk sebuah rilis open-weight
.
Berikut adalah perbandingan antara model terbaru MiniMax dan pesaing utamanya, DeepSeek V4 Pro:
Sebagian besar analis mencatat bahwa MiniMax M3 dan DeepSeek V4-Pro "hampir tidak bersaing secara langsung" — mereka dioptimalkan untuk beban kerja yang berbeda: M3 untuk coding multimodal agen dan tugas konteks panjang, V4-Pro untuk throughput coding algoritmik teks murni dengan biaya lebih rendah .
Peluncuran model raksasa ini adalah bagian dari gelombang besar model open-weight dari laboratorium AI China pada 2025–2026. Berikut beberapa pemain utamanya:
Ini adalah strategi yang disengaja oleh laboratorium AI China untuk merilis model sebagai open-weight (seringkali dengan lisensi Apache 2.0 atau MIT), berbeda dengan banyak laboratorium Barat yang menjaga model frontier mereka tetap tertutup .
Munculnya model raksasa MiniMax menandakan beberapa hal dalam lanskap AI global:
Tren ini menegaskan bahwa China bukan lagi sekadar pengikut yang terkendala perangkat keras — ia adalah pemimpin dalam rilis model open-weight, menggunakan keterbukaan sebagai benteng kompetitif melawan pemimpin model tertutup Barat .
Model-model AI China telah mendapatkan daya tarik global yang signifikan karena beberapa alasan:
Model 2,7T yang direncanakan, jika terwujud, akan menjadi pernyataan terkuat dalam arah tersebut.
Sebuah model open-weight dengan 2,7T parameter akan menghadirkan tantangan penerapan yang ekstrem:
Meskipun demikian, MiniMax telah menunjukkan keahlian rekayasa efisiensi yang kuat. M1 dilatih dengan komputasi 70% lebih sedikit daripada DeepSeek R1 , dan M3 menggunakan mekanisme sparse attention
. Mereka kemungkinan akan menerapkan inovasi serupa untuk model 2,7T.