Instella-MoE sử dụng cấu hình shared-plus-routed expert với 2 chuyên gia chia sẻ luôn hoạt động và 6 chuyên gia định tuyến được chọn từ tổng số 64 chuyên gia mỗi token . Mô hình bao gồm 27 tầng giải mã, mỗi tầng có kích thước ẩn là 2.048 . Hai cải tiến kiến trúc nổi bật gồm:
Mô hình cũng áp dụng mục tiêu Multi-Token Prediction (MTP) trong các giai đoạn tiền huấn luyện và huấn luyện giữa kỳ .
Sau một giai đoạn huấn luyện mở rộng ngữ cảnh chuyên biệt, Instella-MoE hỗ trợ lên tới 64K token .
AMD đã công bố toàn bộ quy trình huấn luyện, bao gồm 6 giai đoạn tuần tự :
Mô hình Instella-MoE-16B-A3B base đạt điểm trung bình 76,7 trên các benchmark tiêu chuẩn, đưa nó vào nhóm các mô hình mã nguồn mở hàng đầu ở quy mô này . Theo công bố, nó vượt qua SmolLM3-3B và OLMo-3-7B, và cạnh tranh tốt với các mô hình lớn hơn dù chỉ kích hoạt 2,8 tỷ tham số mỗi token .
Đúng với cam kết về AI mở, AMD đã công bố tất cả các tạo phẩm huấn luyện :
Toàn bộ đều có sẵn trên Hugging Face trong không gian tên amd/Instella-MoE-16B-A3B, được cấp phép theo Research RAIL (Responsible AI License) cho mục đích học thuật và nghiên cứu .
Instella-MoE không chỉ đơn thuần là một bản phát hành mô hình. Nó là một minh chứng trực tiếp rằng phần cứng GPU Instinct và phần mềm ROCm của AMD có thể hỗ trợ phát triển AI ở quy mô tiên tiến, từ tiền huấn luyện đến học tăng cường, sử dụng cơ sở hạ tầng mã nguồn mở hoàn toàn. Bằng cách đạt được các benchmark cạnh tranh so với các mô hình nguồn mở hàng đầu được huấn luyện trên Nvidia, AMD định vị hệ sinh thái của mình như một giải pháp thay thế khả thi cho CUDA của Nvidia cho nghiên cứu và phát triển AI quy mô lớn .