Instella-MoE采用共享+路由专家配置,包含2个始终激活的共享专家,并从64个候选专家中为每个Token选择6个路由专家。模型由27个解码器层组成,每层隐藏维度为2048。两大架构创新引人注目:
模型在预训练和中期训练阶段还使用了多Token预测(MTP)目标。
经过专门的长上下文扩展训练后,Instella-MoE支持64K Token上下文。
AMD公开了完整的训练流水线,包含六个连续阶段:
Instella-MoE-16B-A3B基础模型在标准基准测试中取得了平均76.7分的成绩,在其规模的全开源模型中位居前列。据报道,它超越了SmolLM3-3B和OLMo-3-7B等模型,尽管每个Token仅激活28亿参数,仍能与更大规模的模型一较高下。
秉承对开放AI的承诺,AMD公开发布了所有训练产物:
所有产物均可在Hugging Face的amd/Instella-MoE-16B-A3B命名空间下获取,并采用Research RAIL(负责任AI许可证) 仅供学术和研究目的使用。
Instella-MoE不仅仅是一个模型发布——它直接证明了AMD的ROCm软件栈和Instinct GPU硬件能够支撑从预训练到强化学习的前沿AI开发,且全部基于开放基础设施。通过在与NVIDIA硬件上训练的主流开源模型的竞争中交出有竞争力的成绩单,AMD将其生态系统定位为大规模AI研究与开发中NVIDIA CUDA的可行替代方案。