Naive N0.5 Flash是面向編程及AI研發的開放權重模型,總參數3090億,每個Token啟動155億參數;模型權重和推理程式碼採用MIT授權。[2][4][7] 模型聲稱原生支援100萬Token上下文,結合滑動視窗注意力(SWA)及DeepSeek稀疏注意力(DSA),不設完整注意力層;NaiveAI形容兩者比例大致以5:1為主。[2][7] 模型以小米MiMo V2.5為基礎繼續訓練;配套推理系統NaiveRT採用多種運算及解碼優化,廠方公布Standard模式每位用戶每秒50個Token,Ultrafast模式最高每秒2000個Token。[1][2]
發布者使用 GPT-6 Luna 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is NaiveAI’s MIT-licensed, open-weight Naive-N0.5-Flash model, and how do its 309B-total/15.5B-active MoE architecture, native one-mill. Article summary: Naive-N0.5-Flash is NaiveAI’s MIT-licensed, open-weight model aimed at coding and AI research and development. The release pairs a large but sparsely activated model with a claimed native one-million-token context and a . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Naive-N0.5-Flash是NaiveAI推出、面向編程及人工智能研發(AI R&D)的開放權重模型。它最受注目的賣點,是3090億總參數的混合專家模型(MoE)、每個Token只啟動155億參數,以及聲稱原生支援100萬Token上下文;NaiveAI亦同時推出自家推理系統NaiveRT。2
4
先分清兩個數字:3090億是模型的總參數量,155億則是每個Token運算時啟動的參數量。後者不代表整個模型只有155億參數。NaiveAI的發布資料稱,模型權重及推理程式碼採用MIT授權。4
7
MoE模型會按需要啟動部分參數,而非每次處理都動用全部模型。Naive-N0.5-Flash的模型卡列出3090億總參數、每個Token啟動155億參數;這個設計講的是運算時的稀疏啟動,不是模型的總規模。2
NaiveAI將模型定位為編程和AI研發用途。它並非從零開始訓練,而是以小米的MiMo-V2.5為基礎繼續訓練。1
2
NaiveAI稱,模型原生支援100萬Token上下文,並以滑動視窗注意力(SWA)配合輕量級DeepSeek稀疏注意力(DSA),不設完整注意力層。模型資料形容,SWA與DSA的配置大致以5:1為主。2
7
簡單來說,SWA着重處理附近的內容,DSA則以稀疏方式保留較長距離的上下文資訊。這種設計旨在支援長上下文,同時避免依賴完整注意力層。不過,聲稱支援100萬Token,並不等於所有長文本任務都必然同樣準確或有效。
NaiveRT是隨模型推出的推理系統。NaiveAI列出的技術包括mega-kernel fusion、Programmatic Dependent Launch(PDL)及投機解碼(speculative decoding)。廠方公布的數字是:Standard模式每位用戶每秒50個Token;Ultrafast模式最高每秒2000個Token。2
這些是廠方公布的服務速度,不代表每個硬件配置、使用情境或任務都能達到。兩個數字分別對應Standard模式的每用戶速度,以及Ultrafast模式的最高速度,不應當成同一種測量,亦不宜視為一般用戶必定得到的速度。2
Naive-N0.5-Flash的主要看點,是MIT授權的開放權重、3090億參數MoE架構、原生百萬Token上下文,以及配套推理系統。2
4
7 評估時,最好將這些規格與實際任務表現、部署速度分開考慮:現有發布資料提供的是模型能力描述及廠方速度數字,單憑這些資料,未足以判斷它在某個編程或研究工作流程中的實際效果。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Naive N0.5 Flash是面向編程及AI研發的開放權重模型,總參數3090億,每個Token啟動155億參數;模型權重和推理程式碼採用MIT授權。[2][4][7]
Naive N0.5 Flash是面向編程及AI研發的開放權重模型,總參數3090億,每個Token啟動155億參數;模型權重和推理程式碼採用MIT授權。[2][4][7] 模型聲稱原生支援100萬Token上下文,結合滑動視窗注意力(SWA)及DeepSeek稀疏注意力(DSA),不設完整注意力層;NaiveAI形容兩者比例大致以5:1為主。[2][7]
模型以小米MiMo V2.5為基礎繼續訓練;配套推理系統NaiveRT採用多種運算及解碼優化,廠方公布Standard模式每位用戶每秒50個Token,Ultrafast模式最高每秒2000個Token。[1][2]