API定价最终定为:输入每百万token 0.14美元,输出每百万token 0.28美元,缓存命中时输入价格更是低至 每百万token 0.028美元。这使得V4-Flash成为市面上最便宜的高性能推理API之一——作为对比,Google Gemini 2.5 Flash的输入/输出价格分别为0.30美元和2.50美元每百万token 。
2026年7月31日,DeepSeek发布了经过重新训练的“0731版本”,这是该模型的官方公开公测版。据称,该版本在智能体(Agent)基准测试中甚至超越了更大规模的V4-Pro-Preview:在Terminal Bench 2.1上得分82.7,在Cybergym上得分76.7。该模型支持可配置的推理模式(标准、高、最大思考投入),也支持非推理模式,适用于高吞吐量的流水线任务。
MiniMax于 2026年7月31日 正式发布H3模型。它被定位为一款全能多模态生成模型,能够在统一的上下文中处理文本、图像、视频和音频。它可以在一次推理中直接生成最长 15秒、2K分辨率(2560×1440)、24帧/秒 的视频,并且带有原生立体声音频——无需额外的音频处理管线。
H3最多可接受 9张图片 + 3个视频片段 + 3条音轨 作为参考输入。MiniMax承诺将在数日内发布模型权重,延续中国AI公司在视频生成领域走向开源的趋势,而这一领域的大多数主流竞争对手仍然保持闭源。MiniMax官方声称,H3在2K分辨率下的每秒生成成本“不到主流竞争对手的三分之一”。
字节跳动在 2026年6月23日 的火山引擎FORCE大会上正式宣布了Seedance 2.5,并于 2026年7月16日 向公众开放了API访问。
核心升级:单次生成30秒视频——一次连续生成生成完整短片,无需拼接多个短视频。分辨率最高达到 4K(3840×2160),支持10位色深。模型最多可接受 50个多模态参考输入——包括图像、音频片段、3D白模、风格帧和场景指导——相比上一版本的12个大幅提升。
字节跳动还发布了区域级编辑功能,允许用户修改生成视频中的某个特定区域,而无需重新生成整个序列。其应用场景覆盖电影制作、广告、教育、工业制造乃至自动驾驶模拟。
这三款模型在2026年7月底的集中发布,反映出中国AI行业的几个共同战略主题:
原文将这三款模型的发布时间定为2024年12月26日,并提到了“中国开源模型占全球下载量的41%”以及“美国指控模型蒸馏”等广泛背景。根据现有的搜索结果,无法证实2024年12月这个日期或上述具体统计数据。这些信息可能源自更早的DeepSeek-V3或通义千问的相关报道,但本分析无法通过提供的资料进行验证。
| 模型 | 发布时间 | 关键规格 |
|---|---|---|
| DeepSeek V4-Flash | 预览版:2026年4月24日<br>公测版:2026年7月31日 | 2840亿参数MoE(130亿激活),100万token上下文,输入$0.14/百万token |
| MiniMax H3 | 2026年7月31日 | 15秒2K视频,原生立体声,承诺开源权重 |
| 字节跳动 Seedance 2.5 | 宣布:2026年6月23日<br>API上线:2026年7月16日 | 30秒单次生成,4K分辨率,50个多模态参考输入 |
这三款模型——DeepSeek V4-Flash、MiniMax H3和字节跳动Seedance 2.5——共同代表了2026年年中中国AI领域的协调性加速,其核心特征为:更低的成本、开放的分发模式,以及大幅提升的长时生成能力。