AMD 於 2026 年 7 月 24 日發佈 Instella MoE,這是一款完全開源的 160 億參數混合專家(MoE)語言模型,每個 Token 僅激活 28 億參數,從零開始在 AMD Instinct MI300X 與 MI325X GPU 上訓練完成。 模型導入多項架構創新:Gated Multi head Latent Attention(門控多頭潛在注意力)與 FarSkip Collective(遠跳躍集體通訊),後者在預訓練階段加速了 12.7%。完整的六階段訓練管線涵蓋預訓練、長上下文擴展至 64K Token、監督微調、直接偏好最佳化與強化學習。

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
2026 年 7 月 24 日,AMD 正式發佈 Instella-MoE,這是一款完全開源的 160 億參數混合專家(Mixture-of-Experts, MoE)語言模型,從頭到尾都在 AMD Instinct MI300X 與 MI325X GPU 上,使用 ROCm 軟體堆疊訓練而成 。此模型每個 Token 僅激活 28 億參數,在維持高效能的同時,交出極具競爭力的基準測試成績。此次發佈是 AMD 的戰略里程碑,證明其硬體與開源軟體堆疊能夠支撐從預訓練到強化學習的大規模 AI 開發,足以挑戰主流的 NVIDIA CUDA 生態系
。
Instella-MoE 採用共享加路由專家配置,內含 2 個永遠啟動的共享專家,並從 64 個專家中為每個 Token 選取 6 個路由專家 。模型由 27 個解碼器層組成,每個層的隱藏維度為 2,048
。兩項架構創新尤為突出:
此模型在預訓練與中期訓練階段也使用了多 Token 預測(Multi-Token Prediction, MTP) 目標 。
經過專門的長上下文擴展訓練後,Instella-MoE 支援 64K Token 的上下文長度 。
Instella-MoE-16B-A3B 基礎模型在標準基準測試中取得了 平均 76.7 分,在同等規模的完全開源模型中名列前茅 。據報導,它超越了 SmolLM3-3B 與 OLMo-3-7B,儘管每個 Token 僅激活 28 億參數,仍能與更大的模型競爭
。
所有成果均可在 Hugging Face 的 amd/Instella-MoE-16B-A3B 命名空間下取得,並採用 Research RAIL(Responsible AI License) 授權,僅供學術與研究用途 。
Instella-MoE 不只是一次模型發佈,更是AMD 的 ROCm 軟體堆疊與 Instinct GPU 硬體能夠支撐前沿規模 AI 開發的直接實證——從預訓練到強化學習,全部使用完全開放的基礎設施。透過在基準測試中與基於 NVIDIA 硬體訓練的頂尖開源模型一較高下,AMD 將自身生態系定位為大規模 AI 研究與開發中,NVIDIA CUDA 的可行替代方案 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD 於 2026 年 7 月 24 日發佈 Instella MoE,這是一款完全開源的 160 億參數混合專家(MoE)語言模型,每個 Token 僅激活 28 億參數,從零開始在 AMD Instinct MI300X 與 MI325X GPU 上訓練完成。
AMD 於 2026 年 7 月 24 日發佈 Instella MoE,這是一款完全開源的 160 億參數混合專家(MoE)語言模型,每個 Token 僅激活 28 億參數,從零開始在 AMD Instinct MI300X 與 MI325X GPU 上訓練完成。 模型導入多項架構創新:Gated Multi head Latent Attention(門控多頭潛在注意力)與 FarSkip Collective(遠跳躍集體通訊),後者在預訓練階段加速了 12.7%。完整的六階段訓練管線涵蓋預訓練、長上下文擴展至 64K Token、監督微調、直接偏好最佳化與強化學習。
所有訓練階段產出的模型權重、訓練配置、中間檢查點與推論程式碼,均以 Research RAIL 授權在 Hugging Face 上完全公開,是 AMD 展示其 ROCm 軟體堆疊與 Instinct GPU 能勝任大規模 AI 開發的關鍵里程碑。