DeepSeek V4 Flash 是 DeepSeek V4 系列中的高效能版本,專為高流量、低延遲的工作負載設計。它採用 MoE 架構,總參數達 2840 億,但每次 Token 僅啟動 130 億參數 。這意味著模型擁有龐大的專家知識庫,同時能保持推論速度與成本效益。
| 屬性 | 數值 |
|---|---|
| 總參數 | 284B(含 DSpark 草稿模組為 304B) |
| 活躍參數 | 13B(每次 Token) |
| 架構 | 混合專家(MoE) |
| 上下文視窗 | 100 萬 Token |
| 最大輸出 | 384K Token |
| 精度 | FP4 + FP8 混合 |
| 授權 | MIT |
| 下載大小 | 約 160 GB |
來源:
V4 Flash 及其更大規模的 V4 Pro 均採用寬鬆的 MIT 授權,允許無限制的商業使用、修改與再發布,無需支付權利金 。權重檔案可在 Hugging Face 上取得,並可自行託管於私有基礎設施。DeepSeek V4 是同級別中唯一在寬鬆 MIT 授權下提供 100 萬 Token 上下文視窗的開放權重模型系列 。
V4 Flash 透過結合兩種新穎機制的混合注意力架構,實現了龐大的 100 萬 Token 上下文視窗:
模型在 CSA 與 HCA 層之間交替:從第 2 層開始的偶數層使用 CSA(4:1 壓縮),而從第 3 層開始的奇數層使用 HCA(128:1 壓縮)。模型中始終包含一個針對最後 128 個原始 Token 的滑動視窗分支,以確保近期資訊的優先性 。
模型檢查點使用混合精度量化來縮小記憶體佔用:
nvidia/DeepSeek-V4-Flash-NVFP4)。在 FP8 精度下,完整的 284B 模型權重約需 284 GB。若要自行託管並支援完整的 100 萬 Token 上下文,建議的最低配置為 4 張 NVIDIA H200 SXM5(總計 564 GB VRAM)。
DeepSeek V4 Flash 提供了一個 可配置的 reasoning_effort 參數,讓開發者選擇模型的推論模式:
此參數讓開發者能夠在回應時間與推理深度之間取得平衡,使模型能適應從簡單分類到進階程式碼生成與多步驟規劃等各種應用場景 。
DeepSeek V4 Flash 的定價為 每百萬輸入 Token $0.14(快取未命中)以及 每百萬輸出 Token $0.28 。對於已快取的輸入(重複的系統提示詞或常見前綴),價格降至 每百萬 Token $0.0028 — 降幅達 98% 。
相比之下,V4 Flash 的輸出價格比 Sonnet 4.6($15/M)便宜 54 倍,比 GPT-5.5($30/M)便宜 107 倍 。多個來源將其描述為「目前可用的最便宜前沿級 API」。
7 月 31 日的生產版本(V4-Flash-0731)透過重新訓練而非架構變更,在代理任務與程式碼生成方面取得了重大進展 。官方更新日誌顯示:
發布說明指出,該模型現在「在代理任務與程式碼生成基準測試中的表現可與其較大的兄弟模型 V4-Pro 相媲美」。這實際上打破了傳統的 Pro/Flash 性能階層 。
DeepSeek 同時也在積極進軍代理式 AI。2026 年 8 月 1 日,該公司開始為 DeepSeek Harness 的封閉測試招募開源開發者 。該框架旨在將大型語言模型轉變為能夠自主執行任務、管理上下文並呼叫工具的 AI 代理 。
這個名稱首次出現在 7 月 31 日的 V4-Flash-0731 更新日誌中,備註為「即將發布」。Harness 工程團隊於 2026 年 3 月由崔天毅加入 DeepSeek 時成立,並從零開始組建團隊 。
要參與測試,開發者必須具備 Agent Harness 相關專案經驗,並提交其 GitHub ID 與代表性作品 。
DeepSeek 在 CEO 梁文鋒的領導下,其核心策略是打造便宜且功能強大的模型,以此作為通往通用人工智慧(AGI)的路徑 。V4 Flash 的定價策略(每百萬 Token $0.14/$0.28)與 MIT 開放權重策略,是此理念最明確的營運證據。正如一個來源指出,「V4-Flash 每百萬 Token 輸出 $0.28 的價格,大約是 GPT-5.5 的 1/107」。
在國內市場,DeepSeek 面臨來自阿里巴巴(通義千問系列)、字節跳動(豆包)、月之暗面、MiniMax 與 Z.AI 的競爭,但 V4 系列是同級別中唯一以寬鬆 MIT 授權提供的開放權重模型 。多個來源也提及 DeepSeek 已傳出準備 IPO 的消息,但具體日期或承銷商尚未確認 。
儘管收集到的來源描繪了相當完整的圖像,但以下部分主張未能在搜尋到的文章中獨立驗證:
這些細節可能出現在更廣泛的行業報導中,並可透過進一步的定向搜尋來確認。
DeepSeek V4 Flash 的正式發布,再次證明 DeepSeek 在「低成本、高效能」路線上的執行力。MIT 授權、極具競爭力的 API 定價、以及與 DeepSeek Harness 框架的結合,讓開發者與企業能以極低的門檻探索並部署大型語言模型。雖然部分細節仍有待進一步確認,但整體而言,這代表了開源 AI 領域的一次重要推進。