Instella-MoE 採用共享加路由專家配置,內含 2 個永遠啟動的共享專家,並從 64 個專家中為每個 Token 選取 6 個路由專家 。模型由 27 個解碼器層組成,每個層的隱藏維度為 2,048 。兩項架構創新尤為突出:
此模型在預訓練與中期訓練階段也使用了多 Token 預測(Multi-Token Prediction, MTP) 目標 。
經過專門的長上下文擴展訓練後,Instella-MoE 支援 64K Token 的上下文長度 。
AMD 公開了完整的訓練管線,共包含六個循序階段 :
Instella-MoE-16B-A3B 基礎模型在標準基準測試中取得了 平均 76.7 分,在同等規模的完全開源模型中名列前茅 。據報導,它超越了 SmolLM3-3B 與 OLMo-3-7B,儘管每個 Token 僅激活 28 億參數,仍能與更大的模型競爭 。
秉持開放 AI 的承諾,AMD 開放了所有訓練成果 :
所有成果均可在 Hugging Face 的 amd/Instella-MoE-16B-A3B 命名空間下取得,並採用 Research RAIL(Responsible AI License) 授權,僅供學術與研究用途 。
Instella-MoE 不只是一次模型發佈,更是AMD 的 ROCm 軟體堆疊與 Instinct GPU 硬體能夠支撐前沿規模 AI 開發的直接實證——從預訓練到強化學習,全部使用完全開放的基礎設施。透過在基準測試中與基於 NVIDIA 硬體訓練的頂尖開源模型一較高下,AMD 將自身生態系定位為大規模 AI 研究與開發中,NVIDIA CUDA 的可行替代方案 。