DeepSeek V4 Flash 是 DeepSeek V4 模型家族中主打高效率的版本,专为高并发、低延迟的业务场景设计。它采用 MoE 架构,总参数高达 2840亿,但每次推理仅激活其中 130亿 参数。这意味着模型既拥有海量专业知识储备,又能保持快速的推理速度和低廉的运算成本。
| 属性 | 数值 |
|---|---|
| 总参数 | 284B(含 DSpark 推测解码模块为 304B) |
| 激活参数 | 13B/Token |
| 架构 | 混合专家(MoE) |
| 上下文窗口 | 100万 Token |
| 最大输出 | 384,000 Token |
| 精度 | FP4 + FP8 混合 |
| 许可证 | MIT |
| 下载大小 | ~160 GB |
来源:
V4 Flash 及其更大规模的兄弟模型 V4 Pro 均采用宽松的 MIT 开源许可协议,允许不受限制的商业使用、修改和分发,无需支付版税。模型权重已在 Hugging Face 平台发布,开发者可将模型部署在自有基础设施上。DeepSeek V4 是目前该层级中唯一支持百万Token上下文窗口并采用 MIT 许可的开放权重模型系列。
V4 Flash 之所以能支持百万Token的超长上下文,得益于其结合了两种新型机制的混合注意力架构:
模型在 CSA 和 HCA 层之间交替排布:从第2层起的偶数层使用 CSA(4:1压缩),从第3层起的奇数层使用 HCA(128:1压缩)。同时,始终保留一个覆盖最后128个原始 Token 的滑动窗口分支,以确保对近期信息的敏感性。
模型检查点采用混合精度量化,以最大限度地减少显存占用:
nvidia/DeepSeek-V4-Flash-NVFP4 的 NVFP4 变体版本。在 FP8 精度下,整个 284B 模型仅权重就需要约 284 GB 显存。要实现完整的百万 Token 上下文自托管,推荐的最低配置为 4块 NVIDIA H200 SXM5(总计 564 GB 显存)。
DeepSeek V4 Flash 提供了一个 reasoning_effort 参数,允许开发者灵活选择模型的推理模式:
这个参数让开发者可以在响应速度和推理深度之间进行权衡,使模型能够适应从简单分类到高级代码生成和多步骤规划等各类应用场景。
DeepSeek V4 Flash 的定价为 每百万输入 Token 0.14美元(缓存未命中)和 每百万输出 Token 0.28美元。对于缓存命中的输入(例如重复的系统提示或常见前缀),价格可降至 每百万 Token 0.0028美元,降幅高达 98%。
对比来看,V4 Flash 的输出价格比 Sonnet 4.6(15美元/百万Token)便宜54倍,比 GPT-5.5(30美元/百万Token)便宜107倍。多个信息来源将其描述为“性价比最高的前沿模型 API”。
7月31日发布的生产版本(V4-Flash-0731)主要通过 重新进行后期训练(re-post-training) 实现了 智能体能力和编程能力的重大提升,而非对架构本身进行改动。官方更新日志显示:
发布说明指出,该模型“在智能体和编程基准测试上,已能达到其更大规模的兄弟模型 V4 Pro 的水平”。这实际上意味着,在智能体任务上,传统的 Pro/Flash 性能层级差异已不再明显。
在模型发布的同时,DeepSeek 也在智能体 AI 领域积极布局。2026年8月1日,该公司开始为 DeepSeek Harness 的封闭内测招募开源开发者。该框架旨在将大语言模型转变为能够自主执行任务、管理上下文并调用工具的 AI 智能体。
“Harness”首次出现在官方文档中,是在7月31日 V4-Flash-0731 的更新日志里,附带的说明为“即将发布”。DeepSeek 于 2026年3月成立了 Harness 工程团队,由崔天翼加入并负责从零组建。
要参与内测,开发者需要具备 Agent Harness 相关项目经验,并提交其 GitHub ID 和代表性作品。
在 CEO 梁文锋的领导下,DeepSeek 的核心战略是构建廉价且强大的模型,作为通往通用人工智能(AGI)的路径。V4 Flash 的定价策略(0.14/0.28美元每百万Token)和 MIT 开放权重策略,正是这一理念最清晰的体现。正如一份资料所指出的:“V4-Flash 每百万Token输出仅0.28美元,比 GPT-5.5 便宜约107倍”。
在国内市场,DeepSeek 面临着来自阿里巴巴(Qwen 系列)、字节跳动(豆包)、月之暗面、MiniMax 和智谱 AI 等对手的竞争。但 DeepSeek V4 系列是目前该层级中唯一采用 MIT 许可的开放权重模型系列。此外,多个信息来源也提及 DeepSeek 已传出筹备 IPO 的消息,但具体的上市日期或承销商尚未得到确认。
尽管现有资料描绘了一幅相当全面的图景,但仍有一些信息未能得到独立验证:
这些细节可能在更广泛的行业报道中有所涉及,需要通过更具针对性的补充搜索来进行确认。