DeepSeek V4.1 Flash 於 2026 年 9 月 10 日發布,是目前以 deepseek flash 呼叫的原生多模態 Flash 模型。[15][17] 舊版 V4 Flash 與 V4 Flash Vision Exp 已退役,但舊識別碼暫時仍可使用,實際會轉送至 V4.1 Flash 並按 Flash 費率計費。[15][23] 模型採 5,520 億參數 MoE 架構,輸入預填階段啟用 80 億參數、輸出解碼階段啟用 160 億參數,並支援最高 100 萬 token 上下文。[17][35]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash 於 2026 年 9 月 10 日推出。它的重點不只是 5,520 億參數,而是將稀疏啟用、原生多模態與大幅縮小的 KV Cache 結合,試圖讓超長上下文推論更容易部署。 17
35
在 DeepSeek API 中,V4.1 Flash 是目前的 Flash 版本,建議以 deepseek-flash 呼叫,支援文字與原生視覺理解。 15
17
先前的 V4 Flash 與實驗性 V4 Flash Vision Exp 已退役。為維持相容性,deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 目前仍會被接受,但請求會實際由 V4.1 Flash 處理,並按 Flash 費率計費。換言之,這些舊名稱應視為過渡路由,而非可長期依賴的版本釘選方式。 15
23
V4 Pro 則是另一回事。 早期的過渡資訊曾稱,V4 Pro 流量將在 V4.1 Pro 推出前轉送至 V4.1 Flash;不過 DeepSeek 後續 API 更新紀錄指出,因應使用者需求,V4 Pro API 在 2026 年 9 月 14 日後仍會繼續提供,計費方式不變。若應用需要可重現的輸出,應採用目前文件所列的模型識別碼,並進行回歸測試,不宜假設舊路由必然對應 V4.1 Flash。 15
23
V4.1 Flash 是 **Mixture-of-Experts(MoE,混合專家)**模型,骨幹規模為 5,520 億參數。MoE 的概念是:模型面對不同 token 時,只選擇部分「專家」參數參與運算,而不是每一步都啟用整個模型。
DeepSeek 表示,V4.1 Flash 在處理輸入提示詞的預填(prefill)階段會啟用 80 億參數;生成輸出的解碼(decoding)階段則啟用 160 億參數。它採用名為 Causal Encoder–Decoder 的架構,針對讀取長提示詞與持續生成長答案這兩種成本不同的工作分別設計。 17
35
不過,稀疏啟用不代表所有情境都必然更便宜或更快。實際吞吐量仍取決於硬體、批次處理、量化方式、推論服務軟體、上下文長度及請求組成;但這確實是 V4.1 Flash 主打的效率基礎。
V4.1 Flash 的上下文窗口最高可達 100 萬 token。 35
真正限制超長上下文服務成本的,往往是 Key-Value Cache(KV Cache):模型每產生一個新 token 時,為了保留先前注意力狀態而需持有的記憶體資料。提示詞和輸出愈長,這塊記憶體負擔就愈顯著。
DeepSeek 的模型卡指出,其 Causal Encoder–Decoder 設計會由最終編碼器隱藏狀態投影出解碼器的全域 KV Cache,而不是由每一個解碼器層各自建立。再配合 Compressed Sparse Attention 2(CSA2)與 FP4 KV 快取,DeepSeek 稱全域 KV Cache 約為 每 token 890 位元組,約是 V4 Flash 對應用量的四分之一。 35
39
這並不表示任何百萬 token 任務都會便宜,也不保證模型能在整段上下文中穩定檢索、推理或遵循指令。處理大型程式碼庫、文件集合或長期 Agent 軌跡的團隊,仍應以真實工作負載測試檢索正確率、延遲與總成本。
DeepSeek 已在 Hugging Face 釋出 V4.1 Flash 權重,採 MIT 授權。這讓組織可依授權條款下載、評估與自行部署,而不必只依賴 API。 35
自架的價值在於可掌控服務堆疊、資料流與效能最佳化;但 5,520 億參數的骨幹規模也意味著,硬體資源、推論框架與營運仍是實際門檻。開放權重提供的是部署選項,不是免成本的本地運行保證。
DeepSeek 表示,新預訓練方法與更大規模的強化學習後訓練,使 V4.1 Flash 在其基準測試中超越包括 V4 Pro 在內的旗艦模型;公司也援引多方測試,稱其在效能、成本、速度與端到端耗時上領先 V4 Pro。 17
這些結果值得關注,但仍主要是供應商提出的比較,不能直接推論它在所有任務中全面勝出。基準成績會受任務選取、提示詞寫法、工具設定、評分方法和受測版本影響。遷移正式服務前,最好以自身關鍵指標比較兩者:複雜推理、程式碼驗收率、工具呼叫、視覺任務準確性、穩定性、安全控制、延遲與總成本。
V4.1 Flash 發布時,DeepSeek 與其他中國模型供應商已在模型路由平台累積可觀流量。OpenRouter 的榜單是以經其 API 處理的提示詞與完成 token 總量排序。9 月 13 日的榜單中,DeepSeek V4.1 Flash 為 4.94 兆 token、標示為新模型;DeepSeek V4 Flash 0731 為 11.6 兆、V4 Flash 0423 為 4.36 兆,小米 MiMo-V2.5 則為 7.77 兆。 57
更早的 8 月榜單也反映此類排名變化很快:當時 V4 Flash 週用量為 7.1 兆 token,該榜前十名中有九款是中國模型。 50
但範圍必須說清楚:OpenRouter 的 token 數字只代表經由 OpenRouter 路由的流量,並不等於全球 AI 使用量、企業導入規模、營收或模型品質。它可作為開發者平台需求的訊號,不能作為誰已贏得整體市場的證據。
V4.1 Flash 最值得評估的組合,是原生多模態、100 萬 token 上下文、MIT 開放權重,以及為降低長上下文記憶體成本而設計的架構。 17
35
實務上的遷移順序可考慮如下:
deepseek-flash。V4.1 Flash 的技術主張相當明確,尤其是每 token 890 位元組的全域 KV Cache 與稀疏啟用設計。它的真正意義,仍取決於這些設計能否在開發者實際執行的工作負載中,轉化為可靠且負擔得起的效能。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4.1 Flash 於 2026 年 9 月 10 日發布,是目前以 deepseek flash 呼叫的原生多模態 Flash 模型。[15][17]
DeepSeek V4.1 Flash 於 2026 年 9 月 10 日發布,是目前以 deepseek flash 呼叫的原生多模態 Flash 模型。[15][17] 舊版 V4 Flash 與 V4 Flash Vision Exp 已退役,但舊識別碼暫時仍可使用,實際會轉送至 V4.1 Flash 並按 Flash 費率計費。[15][23]
模型採 5,520 億參數 MoE 架構,輸入預填階段啟用 80 億參數、輸出解碼階段啟用 160 億參數,並支援最高 100 萬 token 上下文。[17][35]