Ngày 24/7/2026, AMD chính thức phát hành Instella MoE, mô hình ngôn ngữ lớn mã nguồn mở với 16 tỷ tham số, sử dụng kiến trúc MoE (Mixture of Experts) chỉ kích hoạt 2,8 tỷ tham số mỗi token, được huấn luyện từ đầu trên... Mô hình tích hợp các cải tiến kiến trúc như Gated Multi head Latent Attention (Gated MLA) và Far...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
Ngày 24 tháng 7 năm 2026, AMD chính thức công bố Instella-MoE, một mô hình ngôn ngữ lớn mã nguồn mở với 16 tỷ tham số, sử dụng kiến trúc hỗn hợp chuyên gia (Mixture-of-Experts - MoE) . Điểm đặc biệt là mô hình này được huấn luyện hoàn toàn từ đầu trên chính các GPU AMD Instinct MI300X và MI325X, sử dụng bộ phần mềm mã nguồn mở ROCm
. Với chỉ 2,8 tỷ tham số được kích hoạt cho mỗi token, Instella-MoE đạt được hiệu suất tính toán ấn tượng mà vẫn cạnh tranh được với các mô hình lớn hơn
. Đây được xem là một cột mốc chiến lược, chứng minh hệ thống phần cứng và phần mềm mã nguồn mở của AMD có thể hỗ trợ phát triển AI quy mô lớn, từ tiền huấn luyện đến tăng cường học, cạnh tranh trực tiếp với hệ sinh thái Nvidia CUDA thống trị
.
Instella-MoE sử dụng cấu hình shared-plus-routed expert với 2 chuyên gia chia sẻ luôn hoạt động và 6 chuyên gia định tuyến được chọn từ tổng số 64 chuyên gia mỗi token . Mô hình bao gồm 27 tầng giải mã, mỗi tầng có kích thước ẩn là 2.048
. Hai cải tiến kiến trúc nổi bật gồm:
Mô hình cũng áp dụng mục tiêu Multi-Token Prediction (MTP) trong các giai đoạn tiền huấn luyện và huấn luyện giữa kỳ .
Sau một giai đoạn huấn luyện mở rộng ngữ cảnh chuyên biệt, Instella-MoE hỗ trợ lên tới 64K token .
AMD đã công bố toàn bộ quy trình huấn luyện, bao gồm 6 giai đoạn tuần tự :
Mô hình Instella-MoE-16B-A3B base đạt điểm trung bình 76,7 trên các benchmark tiêu chuẩn, đưa nó vào nhóm các mô hình mã nguồn mở hàng đầu ở quy mô này . Theo công bố, nó vượt qua SmolLM3-3B và OLMo-3-7B, và cạnh tranh tốt với các mô hình lớn hơn dù chỉ kích hoạt 2,8 tỷ tham số mỗi token
.
Đúng với cam kết về AI mở, AMD đã công bố tất cả các tạo phẩm huấn luyện :
Toàn bộ đều có sẵn trên Hugging Face trong không gian tên amd/Instella-MoE-16B-A3B, được cấp phép theo Research RAIL (Responsible AI License) cho mục đích học thuật và nghiên cứu .
Instella-MoE không chỉ đơn thuần là một bản phát hành mô hình. Nó là một minh chứng trực tiếp rằng phần cứng GPU Instinct và phần mềm ROCm của AMD có thể hỗ trợ phát triển AI ở quy mô tiên tiến, từ tiền huấn luyện đến học tăng cường, sử dụng cơ sở hạ tầng mã nguồn mở hoàn toàn. Bằng cách đạt được các benchmark cạnh tranh so với các mô hình nguồn mở hàng đầu được huấn luyện trên Nvidia, AMD định vị hệ sinh thái của mình như một giải pháp thay thế khả thi cho CUDA của Nvidia cho nghiên cứu và phát triển AI quy mô lớn .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Ngày 24/7/2026, AMD chính thức phát hành Instella MoE, mô hình ngôn ngữ lớn mã nguồn mở với 16 tỷ tham số, sử dụng kiến trúc MoE (Mixture of Experts) chỉ kích hoạt 2,8 tỷ tham số mỗi token, được huấn luyện từ đầu trên...
Ngày 24/7/2026, AMD chính thức phát hành Instella MoE, mô hình ngôn ngữ lớn mã nguồn mở với 16 tỷ tham số, sử dụng kiến trúc MoE (Mixture of Experts) chỉ kích hoạt 2,8 tỷ tham số mỗi token, được huấn luyện từ đầu trên... Mô hình tích hợp các cải tiến kiến trúc như Gated Multi head Latent Attention (Gated MLA) và FarSkip Collective, giúp tăng tốc độ tiền huấn luyện lên 12,7%.
Tất cả dữ liệu huấn luyện, trọng số mô hình, mã nguồn suy luận đều được công bố công khai trên Hugging Face với giấy phép Research RAIL, khẳng định tham vọng của AMD trong việc thay thế CUDA của Nvidia cho nghiên cứu...