DeepSeek V4 Flash 係 DeepSeek V4 家族嘅效率型號,專為高流量、對延遲敏感嘅工作負載而設。佢用 MoE 架構,總共有 2840 億參數,但係每個 token 只係激活 130 億個 。即係話個模型有大量專門嘅專家知識庫,但推論仍然快過癮同抵玩。
| 特點 | 數值 |
|---|---|
| 總參數 | 284B(連 DSpark 草案模塊就 304B) |
| 激活參數 | 每個 token 13B |
| 架構 | 混合專家(MoE) |
| 上下文長度 | 100 萬 token |
| 最大輸出 | 384K token |
| 精度 | FP4 + FP8 混合 |
| 授權 | MIT |
| 下載大小 | ~160 GB |
來源:
V4 Flash 同佢大佬 V4 Pro 都係用寬鬆嘅 MIT 授權,即係可以無限商用、修改同分發,唔使畀版權費 。權重喺 Hugging Face 有得下載,你可以用自己嘅基建嚟 hosting。DeepSeek V4 係同級別中唯一一個用 MIT 授權、支援 100 萬 token 上下文嘅開放權重模型 。
V4 Flash 之所以做到 100 萬 token 嘅上下文,係因為用咗混合注意力架構,結合咗兩種新機制:
模型喺 CSA 同 HCA 層之間交替:從第 2 層開始嘅偶數層用 CSA(4:1 壓縮),從第 3 層開始嘅奇數層用 HCA(128:1 壓縮)。最後 128 個原始 token 嘅滑動窗口分支就永遠存在,用嚟捕捉近期資訊 。
模型 checkpoint 用混合精度量化嚟縮細記憶體佔用:
nvidia/DeepSeek-V4-Flash-NVFP4)。行 FP8 嘅時候,成個 284B 模型嘅權重大約要 284 GB。如果要自己 hosting 並用到完整 100 萬 token 上下文,建議最低配置係 4 張 NVIDIA H200 SXM5(總共 564 GB VRAM)。
DeepSeek V4 Flash 有個 可設定嘅 reasoning_effort 參數,等開發者可以揀模型嘅推論模式:
呢個參數令開發者可以喺回應速度同推理深度之間取捨,令模型可以適應由簡單分類到高級程式碼生成同多步驟規劃等唔同用途 。
DeepSeek V4 Flash 嘅定價係 每 100 萬輸入 token $0.14(cache miss)同 每 100 萬輸出 token $0.28 。如果係 cached 輸入(重複嘅系統提示或者常用前綴),價格會跌到 每 100 萬 token $0.0028——即係平咗 98% 。
比較吓,V4 Flash 嘅輸出價比 Sonnet 4.6($15/M)平 54 倍,比 GPT-5.5($30/M)更加 平 107 倍 。多個來源都話佢係「最平嘅前沿級 API」。
7 月 31 日嘅生產版本(V4-Flash-0731)透過重新 post-training,而唔係改架構,喺 Agent 同編程方面有重大提升 。官方更新日誌顯示:
更新說明話個模型而家「喺 Agent 同編程基準測試方面嘅表現同佢大佬 V4-Pro 差唔多」。呢個對於 Agent 工作負載嚟講,實質上打破咗傳統 Pro/Flash 嘅表現等級 。
DeepSeek 喺 Agent AI 方面嘅攻勢都好猛烈。2026 年 8 月 1 日,公司開始招募開源開發者參加 DeepSeek Harness 嘅封閉 beta 。呢個框架係用嚟將 LLM 變成可以自動執行任務、管理上下文同呼叫工具嘅 AI Agent 。
呢個名第一次出現係喺 7 月 31 日嘅 V4-Flash-0731 changelog 入面,備註寫住「即將推出」。Harness 嘅工程團隊係 2026 年 3 月成立,當時崔天毅加入 DeepSeek 由零開始建立團隊 。
要參加 beta,開發者必須有 Agent Harness 相關嘅項目經驗,仲要提交 GitHub ID 同代表作 。
DeepSeek 喺 CEO 梁文鋒帶領下嘅策略,係以建立平價而強大嘅模型作為達致 AGI 嘅路徑 。V4 Flash 嘅定價——$0.14/$0.28 每百萬 token——同 MIT 開放權重策略,就係呢個哲學最清楚嘅營運證據。有來源指出「V4-Flash 嘅 $0.28/M 輸出比 GPT-5.5 大約平 107 倍」。
DeepSeek 喺國內要面對阿里巴巴(Qwen 系列)、字節跳動(豆包)、Moonshot AI、MiniMax 同 Z.AI 嘅競爭,但 V4 家族係同級別中唯一用 MIT 授權開放權重嘅模型系列 。多個來源亦提及 DeepSeek 傳緊會 IPO,不過確實日期同承銷商就未有確認 。
雖然搜集到嘅資料已經好全面,但以下幾點未能獨立核實:
呢啲細節可能喺更廣泛嘅行業報導中有提及,可以透過額外嘅針對性搜尋嚟確認。