Model ini juga menggunakan objektif Multi-Token Prediction (MTP) selama fase pre-training dan mid-training .
Setelah melalui tahap pelatihan ekstensi konteks panjang, Instella-MoE mampu mendukung jendela konteks hingga 64K token .
AMD mempublikasikan secara lengkap jalur pelatihan model ini yang terdiri dari enam tahap berurutan :
Model dasar Instella-MoE-16B-A3B berhasil mencapai skor rata-rata 76,7 pada benchmark standar. Skor ini menempatkannya di jajaran teratas model open-source dengan skala serupa . Model ini dilaporkan mampu mengungguli SmolLM3-3B dan OLMo-3-7B, serta bersaing dengan model yang lebih besar meskipun hanya mengaktifkan 2,8 miliar parameter per token
.
Semua artefak ini tersedia di Hugging Face di bawah namespace amd/Instella-MoE-16B-A3B dengan lisensi Research RAIL (Responsible AI License) untuk keperluan akademis dan riset .
Instella-MoE bukan sekadar rilis model — ini adalah bukti langsung bahwa tumpukan perangkat lunak ROCm dan GPU Instinct dari AMD mampu mendukung pengembangan AI skala frontier, dari pre-training hingga RL, menggunakan infrastruktur yang sepenuhnya terbuka. Dengan menghadirkan performa benchmark yang kompetitif melawan model open-source terkemuka yang dilatih di perangkat keras Nvidia, AMD memposisikan ekosistemnya sebagai alternatif yang layak bagi ekosistem CUDA milik Nvidia untuk riset dan pengembangan AI skala besar .