Instella-MoE menggunakan konfigurasi pakar kongsi dan laluan (shared-plus-routed experts) dengan 2 pakar kongsi yang sentiasa aktif dan 6 pakar laluan yang dipilih daripada kumpulan 58 pakar lain bagi setiap token . Model ini terdiri daripada 27 lapisan dekoder dengan saiz tersembunyi 2,048 . Dua inovasi seni bina yang menonjol:
Model ini juga menggunakan objektif Multi-Token Prediction (MTP) semasa fasa pra-latihan dan latihan pertengahan .
Selepas peringkat latihan lanjutan konteks khas, Instella-MoE menyokong tetingkap konteks sehingga 64K token .
AMD menerbitkan keseluruhan saluran paip latihan yang terdiri daripada enam peringkat berturut-turut :
Model asas Instella-MoE-16B-A3B mencapai skor purata 76.7 dalam penanda aras standard, meletakkannya antara model terbuka terbaik pada skala tersebut . Ia dilaporkan mengatasi SmolLM3-3B dan OLMo-3-7B, serta mampu bersaing dengan model yang lebih besar walaupun hanya mengaktifkan 2.8 bilion parameter setiap token .
Selari dengan komitmen terhadap AI terbuka, AMD mengeluarkan semua artifak latihan secara terbuka :
Kesemua artifak boleh didapati di Hugging Face di bawah ruang nama amd/Instella-MoE-16B-A3B, dilesenkan di bawah Research RAIL (Responsible AI License) untuk tujuan akademik dan penyelidikan .
Instella-MoE bukan sekadar pelancaran model — ia adalah bukti langsung bahawa timbunan perisian ROCm dan perkakasan GPU Instinct AMD mampu menyokong pembangunan AI berskala besar, dari pra-latihan hingga RL, menggunakan infrastruktur terbuka sepenuhnya. Dengan menyampaikan penanda aras yang kompetitif berbanding model sumber terbuka terkemuka yang dilatih pada perkakasan Nvidia, AMD meletakkan ekosistemnya sebagai alternatif yang berdaya maju kepada CUDA Nvidia untuk penyelidikan dan pembangunan AI berskala besar .