與過去將影片和音訊視為不同任務的模型不同,H3 會將文字、圖片、影片和音訊視為一個統一的創作脈絡進行聯合解讀。 部分線上介面允許你在單次生成請求中,最多傳入 9 張圖片、3 個影片片段和 3 個音軌。模型會從你提供的素材中,讀取角色身份、表演、運鏡、構圖、聲景以及剪輯節奏。
像 minimaxh3.org、minimax-h3.app 這類線上生成器,本質上是基於瀏覽器的前端介面:它們收集你的提示詞和上傳的參考素材,然後發送給雲端的 H3 推理服務,最後呈現生成的媒體結果。這些網站本身並不運行模型。
這是 H3 的核心創新。它能產生「原生立體聲」——聲音是模型生成輸出的一部分,而非事後自動附加的音軌。 這意味著對話、腳步聲、環境氛圍音和音樂,都是根據視覺動作生成,並與剪輯點精準同步。
MiniMax 將其描述為「語音、音效、音樂的統一建模」,暗示該模型能在單次生成過程中,同時處理擬音(foley)、空間感以及原創配樂。
該模型支援以下規格:
部分第三方介面可能會提供額外的解析度、長寬比或時長控制選項。
網頁介面會回傳內嵌立體聲的影片檔案。由線上生成器所提供的功能包括長寬比控制、彈性時長選擇、參考素材上傳,以及文字轉影片、圖片動畫化、多模態提示等流程。
MiniMax-H3)、fal.ai 等託管推理平台取得,並在 Hugging Face 上提供開放權重,可供自行部署。「原生立體聲」是一個明確的功能宣稱,但公開資料並未揭露確保影音同步的具體神經網路架構。這些來源確實確認了輸入/輸出的行為與能力,但並未揭露足夠的實作細節來解釋模型內部是如何達成此精準同步的——無論是透過特定的擴散排程、音訊編碼標記化、聯合訓練的 Transformer,或是其他方法。
可以確定的是:該模型能夠在單次生成中,輸出連貫且同步的影音內容。而實現此創舉的工程技術細節,目前仍保留在 MiniMax 的技術文件中。