DeepSeek-V4.1-Flash 于 2026 年 9 月 10 日发布。它是一款开放权重、原生多模态模型,重点不只是 5520 亿参数的规模,而是通过稀疏激活与大幅压缩 KV Cache,让超长上下文推理在部署层面更可行。
17
35
产品线怎么变了:Flash 已更新,Pro 仍保留
对 API 开发者而言,V4.1 Flash 是当前的 Flash 系列模型,推荐使用的模型名为 deepseek-flash。它同时支持文本与原生视觉理解。
15
17
此前的 V4 Flash 和实验性 V4 Flash Vision Exp 已退役。不过,为兼容既有应用,deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 两个旧名称仍会在过渡期内被接受;请求实际由 V4.1 Flash 处理,并按 Flash 价格计费。
15
23
V4 Pro 的情况不同。 早期的迁移信息曾称,在 V4.1 Pro 推出前,V4 Pro 流量会转至 V4.1 Flash;但 DeepSeek 后续的官方 API 更新说明表示,因应用户需求,V4 Pro API 会在 2026 年 9 月 14 日后继续提供服务,计费方式不变。
15
23
因此,若业务对结果可复现性要求较高,不宜假定旧路由一定映射到 V4.1 Flash。应使用当前文档列出的模型 ID,并在迁移前完成回归测试。
552B MoE:每个 Token 实际只激活一小部分参数
V4.1 Flash 采用混合专家模型(Mixture of Experts,MoE)架构,骨干参数规模为 5520 亿。MoE 的特点是:处理某个 Token 时,并不会让全量参数都参与计算,而是只选择部分“专家”参数工作。
DeepSeek 表示,V4.1 Flash 在输入处理阶段(prefill)激活约 80 亿参数,在输出生成阶段(decoding)激活约 160 亿参数。其采用名为“因果编码器—解码器”(Causal Encoder–Decoder,CED)的新架构;输入长提示词与持续生成长输出,面临的推理成本并不相同,这一区分正是其设计重点。
17
35
不过,稀疏激活不等于任何环境下都必然更便宜或更快。实际吞吐量仍取决于硬件、批处理方式、量化、推理服务软件、上下文长度和请求类型等因素。
100 万 Token 上下文,关键在于 KV Cache 缩小
V4.1 Flash 支持最长 100 万 Token 的上下文窗口。
35
超长上下文的实际难点在于 键值缓存(KV Cache):模型生成下一个 Token 时,需要保存并读取先前注意力计算的状态。提示词与回答越长,KV Cache 的内存占用越可能成为推理服务的瓶颈。
根据模型卡,CED 架构会从最终编码器隐藏状态投影出解码器的全局 KV Cache,而不是让每个解码器层各自独立生成。再结合压缩稀疏注意力 2(CSA2)与 FP4 KV Cache,DeepSeek 称其全局 KV Cache 可降至约 每 Token 890 字节,约为 V4 Flash 对应占用的四分之一。
35
39
这不代表所有 100 万 Token 任务都会既便宜又准确。上下文容量不等于模型能够在整段内容中稳定检索、推理或遵循指令。处理大型代码库、文档集合或智能体历史记录的团队,仍应以真实工作负载测试召回率、延迟与成本。
MIT 开放权重:可自托管,但部署并不轻松
DeepSeek 已在 Hugging Face 发布 V4.1 Flash 权重,采用 MIT 许可证。该模型以开放权重形式提供,组织可在许可证条款范围内下载和部署。
35
与仅提供 API 的模型相比,这给企业带来一条自托管与深度优化的路径。不过,552B 骨干参数的模型并不会因此变得容易部署;硬件资源、推理引擎和服务优化仍是现实门槛。
它真的胜过 V4 Pro 吗?应把厂商结论和生产验证分开看
DeepSeek 称,借助新的预训练方法与更大规模的强化学习后训练,V4.1 Flash 在其发布的基准测试中领先包括 V4 Pro 在内的旗舰模型;公司还称,多方测试显示其在性能、成本、速度和总运行时间方面领先 V4 Pro。
17
这些结论值得关注,但不构成对所有场景的普遍判定。基准结果会受到任务选择、提示词写法、工具配置、评分方法和测试版本的影响。生产迁移前,应围绕自身关键指标对比两者:高难推理、代码验收率、工具调用、多模态准确性、可靠性、安全控制、延迟及总成本。
OpenRouter 早期用量:热度信号,不是整个 AI 市场的全景
OpenRouter 按经由其 API 处理的提示词与生成 Token 数量进行模型排名。其 2026 年 9 月 13 日榜单中,DeepSeek V4.1 Flash 处理量为 4.94 万亿 Token,标记为新模型;同期 DeepSeek V4 Flash 0731 为 11.6 万亿、V4 Flash 0423 为 4.36 万亿,小米 MiMo-V2.5 为 7.77 万亿。
57
更早的 8 月数据也反映出排名变化很快:当时 V4 Flash 的周 Token 使用量为 7.1 万亿,榜单前十中有九个模型来自中国厂商。
50
需要强调的是,OpenRouter 的统计仅覆盖通过 OpenRouter 路由的流量,不能代表全球 AI 使用量、企业部署规模、收入或模型质量。它可以作为开发者平台需求的观察指标,却不能据此断言某一模型已赢得整个市场。
对开发者意味着什么:迁移,但别盲迁
V4.1 Flash 最值得评估的组合优势,是原生多模态、100 万 Token 上下文、MIT 开放权重,以及为降低长上下文推理内存成本而设计的架构。
17
35
较稳妥的迁移路径是:
- 新的 Flash 集成使用
deepseek-flash。
- 将旧版 Flash 和 Vision Exp 的 ID 视为兼容路由,而不是稳定的模型版本锁定方式。
- 在自己的提示词、任务和成功标准下,将 V4.1 Flash 与 V4 Pro 做对比测试。
- 将长上下文检索能力与端到端延迟分开测量,不要只看“100 万 Token”这一规格。
- 将 OpenRouter 排名视为需求信号,而非替代生产评估的依据。
V4.1 Flash 的技术指标相当突出,尤其是每 Token 890 字节的全局 KV Cache 与稀疏激活设计。它能否真正改变开发者的默认选择,仍要看这些架构收益能否在实际业务中转化为稳定、可靠且成本可控的表现。