DeepSeek V4.1 Flash 在 2026 年 9 月 10 日推出,現時 API 建議使用 deepseek flash,並原生支援圖像理解。[15][17] 舊有 V4 Flash 及 V4 Flash Vision Exp 已退役;舊型號 ID 暫時仍可用,但實際會轉去 V4.1 Flash,並按 Flash 收費。[15][23] 模型採用 552B 參數 MoE,輸入預填時啟用 8B 參數、生成輸出時啟用 16B;支援最長 100 萬 Token 上下文。[17][35]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash 喺 2026 年 9 月 10 日推出。今次焦點唔只係模型大:DeepSeek 將一個 5,520 億參數嘅 Mixture-of-Experts(MoE,混合專家)模型,配合稀疏啟動同大幅壓縮嘅 KV Cache,目標係令超長上下文推理更可行。17
35
對開發者而言,最直接嘅改變係:Flash 系列而家有咗原生圖像理解,而舊 Flash API 路線正逐步退場。
現時要喺 DeepSeek API 使用最新 Flash,建議型號名稱係 deepseek-flash;佢對應 DeepSeek-V4.1-Flash,支援文字同原生多模態視覺理解。15
17
舊有 V4 Flash 同實驗性質嘅 V4 Flash Vision Exp 已經退役。為咗兼容現有程式,deepseek-v4-flash 同 deepseek-v4-flash-vision-exp 暫時仍會被接受,但請求實際由 V4.1 Flash 處理,收費亦按 Flash 計。15
23
V4 Pro 就唔同。 早期轉換消息曾指 V4 Pro 流量會先導去 V4.1 Flash,等 V4.1 Pro 推出;但 DeepSeek 之後喺官方 API 更新紀錄表示,因應用戶需求,會喺 2026 年 9 月 14 日後繼續提供 V4 Pro API,而且收費方式不變。15
23
所以,如果你嘅應用需要可重現結果,唔好單靠舊路由名稱估計背後模型;應按現行文件使用型號 ID,並做回歸測試。
V4.1 Flash 係一個擁有 5,520 億個骨幹參數嘅 MoE 模型。簡單講,MoE 並非每個 Token 都運行全部參數,而係按需要揀部分「專家」參與處理。
DeepSeek 指,模型喺處理輸入、即 prefill 階段,會啟用 80 億參數;到生成輸出、即 decoding 階段,會啟用 160 億參數。其採用名為 Causal Encoder–Decoder 嘅架構,反映長提示詞與長輸出喺推理成本上本身就係兩回事。17
35
不過,稀疏啟動唔等於任何環境之下都必然又平又快。真正吞吐量仍受 GPU 或其他硬件、批次處理、量化方式、推理服務軟件、上下文長度同請求組合影響;但呢個設計確實係 V4.1 Flash 效率定位嘅核心。
V4.1 Flash 支援最長 100 萬 Token 上下文。35
但長上下文真正難題,往往唔係宣傳頁上個數字,而係 KV Cache。呢個可以理解為模型持續生成下一個 Token 時要保留嘅注意力狀態;對話、文件或程式碼愈長,所需記憶體就愈容易成為服務成本同併發量嘅樽頸。
按 DeepSeek 模型卡,Causal Encoder–Decoder 設計會由最終 encoder 隱藏狀態投影出 decoder 嘅全域 KV Cache,而唔係每一層 decoder 都各自衍生一份。再配合 Compressed Sparse Attention 2(CSA2)及 FP4 KV Cache,DeepSeek 指全域 KV Cache 可壓到約 每 Token 890 bytes,大約只係舊 V4 Flash 對應用量嘅四分一。35
39
呢個數字令 100 萬 Token 變得更值得考慮,但唔代表任何塞滿 100 萬 Token 嘅任務都會又平、又快、又準。上下文容量唔等於模型一定可以喺整段內容準確檢索、推理同跟足指令。處理大型程式碼庫、文件庫或 agent 歷史紀錄嘅團隊,仍應以真實工作負載測試召回率、延遲同成本。
DeepSeek 已喺 Hugging Face 發布 V4.1 Flash 權重,採用 MIT 授權。換句話講,機構可以按授權條款下載及部署呢套開放權重。35
相對純 API 模型,呢個選擇畀團隊有機會用自己基建評估模型、掌控服務堆疊,亦可以作更深入優化。不過,5,520 億骨幹參數並唔代表部署會變得簡單;自託管仍涉及相當高嘅硬件、工程同營運門檻。
DeepSeek 表示,新預訓練方法以及更大規模嘅強化學習後訓練,令 V4.1 Flash 喺其基準測試中領先包括 V4 Pro 在內嘅旗艦模型;公司亦稱多方測試顯示,V4.1 Flash 喺效能、成本、速度同端到端執行時間方面領先 V4 Pro。17
呢啲係值得留意嘅供應商結果,但唔可以直接當成所有場景下嘅定論。基準結果會受任務選擇、提示詞、工具設定、評分方法,以及實際測試版本影響。
真係要遷移生產工作流,最好比較你自己最重視嘅指標:複雜推理、程式碼驗收率、工具調用、多模態準確度、可靠性、安全控制、延遲同總成本。
V4.1 Flash 推出時,DeepSeek 同其他中國模型供應商已經喺 OpenRouter 呢類模型路由平台有相當使用量。OpenRouter 嘅排名按經其 API 處理嘅 prompt 與 completion Token 計算。
喺 2026 年 9 月 13 日榜單,DeepSeek V4.1 Flash 錄得 4.94T Token,標示為新上榜;DeepSeek V4 Flash 0731 有 11.6T、V4 Flash 0423 有 4.36T,而小米 MiMo-V2.5 有 7.77T。57
更早前嘅 8 月快照亦反映排名變化可以好快:當時 V4 Flash 一周處理 7.1T Token,並有報道指該榜單頭十名中九個係中國模型。50
要留意範圍:OpenRouter Token 數字只係經 OpenRouter 路由嘅流量,唔係全球 AI 使用量、企業部署規模、收入,亦唔等於模型質素排名。佢較適合作為開發者平台需求嘅一個訊號,而唔係「邊個已經贏晒市場」嘅證據。
V4.1 Flash 最值得評估嘅地方,係原生多模態、100 萬 Token 上下文、MIT 開放權重,以及針對長上下文記憶體成本而設計嘅架構,幾樣嘢一次過結合。17
35
可以考慮以下做法:
deepseek-flash。V4.1 Flash 最吸引嘅技術主張,正正係每 Token 約 890 bytes 嘅全域 KV Cache,以及稀疏啟動設計。但呢啲優勢最終有冇轉化成穩定、負擔得起嘅實際效能,仍然要由開發者喺自己真正會跑嘅工作負載上驗證。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek V4.1 Flash 在 2026 年 9 月 10 日推出,現時 API 建議使用 deepseek flash,並原生支援圖像理解。[15][17]
DeepSeek V4.1 Flash 在 2026 年 9 月 10 日推出,現時 API 建議使用 deepseek flash,並原生支援圖像理解。[15][17] 舊有 V4 Flash 及 V4 Flash Vision Exp 已退役;舊型號 ID 暫時仍可用,但實際會轉去 V4.1 Flash,並按 Flash 收費。[15][23]
模型採用 552B 參數 MoE,輸入預填時啟用 8B 參數、生成輸出時啟用 16B;支援最長 100 萬 Token 上下文。[17][35]