Naive N0.5 Flash 是面向程式開發與 AI 研發的開放權重模型,總參數量為 3090 億、每個 Token 啟用 155 億參數;官方稱支援原生百萬 Token 上下文。[2][4] 模型以滑動視窗注意力(SWA)搭配 DeepSeek 稀疏注意力(DSA),不採用全注意力層;NaiveAI 描述其配置大致為 5:1 的 SWA 與 DSA。[2][7] 模型以小米 MiMo V2.5 為基礎繼續訓練;配套推論系統 NaiveRT 使用大型核心融合、PDL 與投機解碼等技術。[1][2]
發布者使用 GPT-6 Luna 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is NaiveAI’s MIT-licensed, open-weight Naive-N0.5-Flash model, and how do its 309B-total/15.5B-active MoE architecture, native one-mill. Article summary: Naive-N0.5-Flash is NaiveAI’s MIT-licensed, open-weight model aimed at coding and AI research and development. The release pairs a large but sparsely activated model with a claimed native one-million-token context and a . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Naive-N0.5-Flash 是 NaiveAI 推出的開放權重模型,定位在程式開發與 AI 研究開發(R&D)。它的主要賣點包括:總參數量 3090 億、每個 Token 啟用 155 億參數、官方宣稱原生支援百萬 Token 上下文,以及配套的推論系統 NaiveRT。2
4
理解這款模型時,先要分清「總參數量」與「啟用參數量」:155 億指每個 Token 計算時會啟用的參數,不代表整個模型只有 155 億參數。NaiveAI 表示,模型權重與推論程式碼採 MIT 授權。4
7
Naive-N0.5-Flash 採用混合專家(MoE)架構,模型總參數量為 3090 億,但每個 Token 僅啟用其中 155 億參數。2 換句話說,總參數量呈現模型的整體規模,啟用參數量則反映處理單一 Token 時參與運算的部分。
NaiveAI 將這款模型定位於程式開發和 AI 研發。它並非完全從零開始打造,而是以小米的 MiMo-V2.5 為基礎繼續訓練。1
2
NaiveAI 表示,模型透過滑動視窗注意力(SWA)與輕量化 DeepSeek 稀疏注意力(DSA)的混合設計,支援原生百萬 Token 上下文,並且不使用全注意力層。模型資料將這種配置描述為以約 5:1 的比例交錯使用 SWA 與 DSA。2
7
簡單來說,SWA 著重處理局部範圍內的資訊,DSA 則提供稀疏的注意力機制來處理較長距離的脈絡。這種設計旨在支援長上下文,而不依賴全注意力層。不過,百萬 Token 是官方公布的模型能力,不代表所有長文本任務都能同樣有效地處理。
NaiveRT 是與模型一同推出的推論系統。NaiveAI 列出的技術包括大型核心融合(mega-kernel fusion)、Programmatic Dependent Launch(PDL)與投機解碼。官方公布的數字為:Standard 模式每位使用者每秒 50 個 Token,Ultrafast 模式最高每秒 2000 個 Token。2
這些是廠商公布的推論速度,不保證每種硬體配置或工作負載都能達到。官方分別列出 Standard 的「每位使用者」速度與 Ultrafast 的「最高」速度,兩者不應視為相同條件下的測量結果,也不宜直接當成一般使用者可預期的單一速度。2
Naive-N0.5-Flash 的看點,在於它把開放權重與 MIT 授權、3090 億參數的稀疏啟用 MoE 架構、無全注意力層的原生百萬 Token 上下文,以及專屬推論系統放在同一個版本中。2
4
7
評估時,仍要把規格與實際表現分開看:目前引用的發布資料提供了模型能力與速度宣稱,但光憑這些資訊,還不足以判定它在特定程式開發或研究流程中的效果與部署速度。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Naive N0.5 Flash 是面向程式開發與 AI 研發的開放權重模型,總參數量為 3090 億、每個 Token 啟用 155 億參數;官方稱支援原生百萬 Token 上下文。[2][4]
Naive N0.5 Flash 是面向程式開發與 AI 研發的開放權重模型,總參數量為 3090 億、每個 Token 啟用 155 億參數;官方稱支援原生百萬 Token 上下文。[2][4] 模型以滑動視窗注意力(SWA)搭配 DeepSeek 稀疏注意力(DSA),不採用全注意力層;NaiveAI 描述其配置大致為 5:1 的 SWA 與 DSA。[2][7]
模型以小米 MiMo V2.5 為基礎繼續訓練;配套推論系統 NaiveRT 使用大型核心融合、PDL 與投機解碼等技術。[1][2]