与早期将视频和音频视为独立任务的模型不同,H3 将文本、图像、视频和音频作为一个创意上下文进行联合解读。 部分托管界面允许单次生成请求中上传最多 9 张图片、3 段视频片段和 3 条音频轨道。模型会从你提供的所有素材中读取角色形象、表演、镜头运动、构图、声场和剪辑节奏等信息。
像 minimaxh3.org、minimax-h3.app 这类在线生成器本质上是基于浏览器的前端界面:它们负责收集你的提示词和上传的参考素材,将其发送至托管的 H3 推理服务,最后展示生成的成品。这些网站本身并不运行模型。
这是核心创新所在。H3 生成的是“原生立体声”——声音是模型生成输出的一部分,而非事后自动附加上去的音轨。 这意味着对白、脚步声、环境氛围音和音乐都是根据视觉动作生成并与剪辑节奏同步的。
MiniMax 将其描述为“语音、音效和音乐的统一建模”,表明该模型能在单次生成过程中同时处理拟音、环境音乃至原创配乐。
模型支持以下规格:
个别第三方界面可能提供额外的分辨率、画面比例或时长控制选项。
网页界面会返回已嵌入立体声的视频文件。托管生成器所宣传的功能包括画面比例控制、灵活的时长选择、参考素材上传以及支持文字生成视频、图片动画和多模态提示的工作流程。
MiniMax-H3)、fal.ai 等托管推理平台获取,同时也在 Hugging Face 上开放了权重,支持本地部署。“原生立体声”是一个明确的能力声明,但公开资料并未披露确保帧-音频同步的具体神经网络架构。现有来源确认了输入输出行为和能力,但没有提供足够的实现细节来精确解释模型内部是如何实现这种精度的——无论是通过特定的扩散调度、音频编码器标记化、联合训练的 Transformer 还是其他方法。
可以确定的是:该模型能够在单次生成中输出连贯且同步的音频和视频。实现这一点的工程设计,目前仍存在于 MiniMax 的技术文档中。