MiniMax 在 2026 年 8 月于 Hugging Face 发布的内容,更准确地说是 H3-Base 的开放权重,即 H3 视频系统中的基础生成阶段;它并没有开放复现官方完整托管工作流所需的全部模型。
这一区别很重要:H3-Base 可生成 768p 的同步音视频,而负责复杂上下文处理的模块,以及面向 2K 输出的再生成阶段,仍是独立且未开放的部分。
1
5
这次究竟发布了什么?
MiniMax 于 2026 年 8 月 3 日将 H3 权重发布至 Hugging Face,重点是 H3-Base,公开信息显示其中包括 FL2VA 和 Ref2VA 两组任务权重。
1
13
其生成核心是 H3-Omni-Transformer:一个拥有 330 亿参数的密集型、单流 Transformer。它不是先生成画面、再把声音后期拼上去,而是在同一生成过程中联合去噪视频与音频,实现声画同步生成。完整 H3 系统可接收文本、图片、视频与音频构成的统一上下文,并输出带原生立体声的视频。
5
10
不过,“330 亿参数”指的是 Omni-Transformer 这一生成核心,并不代表完整部署时只需加载一个 330 亿参数模型。整条管线还涉及 H3 编码器、VisualVAE 和 AudioVAE 等组件。
10
13
H3 的三段式工作流:开放的只是中间一段
MiniMax 将 H3 描述为由三个模块组成的系统:
- H3-Context-IR:理解并整理复杂的多模态指令与参考素材,将其转化为适合生成的“上下文中间表示”(Context Intermediate Representation)。MiniMax 明确表示,这一步对最终质量至关重要。
5
- H3-Base:根据处理后的上下文生成 768p 的同步音视频。这正是此次开放权重所覆盖的核心组件。
5
13
- H3-Regenerate-2K:在基础结果之上执行再生成,用于获得 2K 输出;它不在本次开放权重之列。
5
9
因此,本地运行 H3-Base 不能直接等同于拥有官方展示的完整 2K H3 产品。完整系统最高可输出 2K、单条最长 15 秒,但下载到的基础生成器对应的是 768p 阶段。
5
9
架构重点:声音和画面走同一条生成流
H3 的主要特点,是把视频与音频放进同一条多模态生成流中处理。330 亿参数的 H3-Omni-Transformer 采用密集型 Transformer 架构;MiniMax 的代码库称,其中约 130 亿参数位于 AdaLN 相关分支,这些分支的输出可以预计算并缓存。
10
底层表示管线则包含编码器、视觉 VAE 与音频 VAE。公开技术资料称,视觉 VAE 会对视频进行 16 倍空间压缩和 4 倍时间压缩;其分词设计实现了有效的 32 倍空间降采样。这类压缩是让视频生成在计算上可行的基础,也说明仅看“330 亿参数”并不足以判断整个系统的体积和运行资源需求。
1
14
H3 能做什么,开放版本又缺少什么?
完整 H3 系统面向混合输入设计:提示词中可以同时包含文本、静态图片、视频片段和音频。它最高可生成 2K、最长 15 秒、带原生立体声的视频。
5
10
对开发者而言,H3-Base 的开放权重意味着可以尝试本地推理、量化、适配器、微调方案,以及自定义创作工具。但 H3-Base 不包含 MiniMax 的 Context-IR 系统和 2K 再生成模型。
这意味着两点:
- 使用复杂参考素材的团队,可能需要自行构建提示词与上下文预处理层;
- 对 2K 成片有刚性需求的团队,不能假定 H3-Base 单独运行就能复刻官方托管服务的效果。
5
9
API 价格与本地部署:该怎样理解这些宣传数字?
公开报道显示,H3 的 2K API 价格曾为 0.8 元/秒;在相应服务方案下,音频参考输入免费,前五张图片参考输入免费。
14
27 这应被视为特定时间点、特定服务与地区下的公开报价,而非永久或全球统一价目表。
MiniMax 与 SGLang 的宣传材料还称,在某项对比中,H3 的成本约为字节跳动 Seedance 2.0 的三分之一;并称其可在 两张 RTX 5090 或 一张 RTX 6000 上本地运行。
28
31
但这些都不应被理解为普遍适用的最低硬件门槛。实际部署成本取决于推理软件、量化精度、卸载策略和工作负载;除 330 亿参数 Transformer 外,编码器和 VAE 组件同样占用资源。
13
对生产团队意味着什么?
更适合敏感素材的受控工作流
自托管可以让产品图片、未公开素材、声音资产和提示词留在组织内部,而非发送给第三方生成 API。对于处理机密资产的团队,这提供了更强的数据控制能力。
不过,本地部署并不会自动解决治理问题。访问权限、输入素材权利核验、输出审核和内部使用规范仍然不可或缺。
可作为定制化生产管线的起点
开放权重让技术团队有机会把生成模型接入素材管理库、创意审核系统、渲染工具与后期流程,并探索量化和任务适配。
但在投入前应先审阅许可证。第三方报道指出,该社区许可证对美国、欧盟、英国和韩国的本地使用设有地域限制。
4 对于涉及这些地区的团队,许可证合规性可能比模型能否运行更先决定项目是否可行。
最适合高频迭代的短视频创作
H3-Base 的现实适配场景,主要是需要大量短视频变体的工作:广告创意、电商商品短片、概念验证、分镜预演和社交内容实验。对于已经具备相应 GPU 能力的团队,集成音频的 768p 本地生成器能降低早期创意迭代的摩擦。
但它并不是所有视频生产需求的一站式替代品。开放版本缺少完整的上下文处理与 2K 阶段;短视频生成结果也仍需要人工审核、剪辑和素材权利管理。
结论
MiniMax 开放的是 H3 中相当关键、但并非全部的一层:H3-Base。它由 330 亿参数的单流 Transformer 驱动,可从多模态输入中联合生成视频与原生立体声音频。
不过,完整产品所依赖的 Context-IR 和 H3-Regenerate-2K 依旧未开放。因此,H3-Base 更适合被看作一个可定制的 768p 声画生成基础,而不是一套完整开源的 2K H3 系统。
5
9