Instella-MoE는 '공유+라우팅 전문가(Shared-plus-Routed Expert)' 구조를 사용합니다. 모든 토큰이 접근하는 2개의 '공유 전문가'와 64개의 '라우팅 전문가' 풀에서 각 토큰이 가장 관련성 높은 6개를 선택하는 방식입니다. 모델은 총 27개의 디코더 레이어로 구성되며, 각 레이어의 은닉 상태 크기는 2,048입니다.
특히 두 가지 주요 아키텍처 혁신이 도입되었습니다:
또한, 모델은 사전 학습 및 중간 학습 단계에서 미래의 여러 토큰을 동시에 예측하는 다중 토큰 예측(Multi-Token Prediction, MTP) 목적 함수도 사용했습니다.
전용 장기 컨텍스트 확장 학습 단계를 거친 후, Instella-MoE는 최대 64K(약 6만 4천) 토큰의 컨텍스트를 지원합니다. AMD는 모델의 완전한 투명성을 위해 6단계로 구성된 전체 학습 파이프라인을 공개했습니다:
Instella-MoE의 기본 모델(Instella-MoE-16B-A3B)은 다양한 표준 벤치마크에서 평균 76.7점을 기록하며, 동급 규모의 완전 오픈 모델 중 최상위권에 올랐습니다. 특히 활성 파라미터가 28억 개에 불과함에도 불구하고, SmolLM3-3B 및 OLMo-3-7B와 같은 모델을 능가했으며, 더 큰 규모의 모델들과도 경쟁할 수 있는 성능을 보여주었습니다.
'완전 오픈'이라는 약속에 걸맞게, AMD는 모든 학습 산출물을 투명하게 공개했습니다:
이 모든 자료는 허깅페이스(Hugging Face)의 amd/Instella-MoE-16B-A3B 네임스페이스에서 확인할 수 있으며, 라이선스는 학술 및 연구 목적을 위한 **Research RAIL(Responsible AI License)**이 적용됩니다.
Instella-MoE는 단순한 모델 출시 그 이상입니다. 이는 AMD의 ROCm 소프트웨어 스택과 Instinct GPU 하드웨어가 사전 학습부터 강화 학습에 이르기까지 프론티어급 AI 개발의 전 과정을 완전한 오픈 인프라로 지원할 수 있다는 강력한 증거입니다. 엔비디아 하드웨어로 학습된 최고 수준의 오픈소스 모델들과 경쟁력 있는 벤치마크 결과를 내놓음으로써, AMD는 엔비디아 CUDA 생태계에 대한 실질적인 대안으로서 자사 생태계(ROCm + MI300X/MI325X)의 위상을 확고히 하고 있습니다.