同之前嗰啲將影片同聲音分開處理嘅模型唔同,H3 會將文字、圖片、影片同聲音當做一個完整嘅創作背景嚟理解。 有啲網上平台 allow 你喺一個生成請求入面上傳最多 9 張圖片、3 段影片同 3 個音頻檔案。模型會從你畀嘅材料入面讀取角色、演繹、鏡頭移動、構圖、聲景同剪接節奏。
市面上嘅網上生成器(例如 minimaxh3.org、minimax-h3.app 等)其實係瀏覽器前端介面:佢哋收集你嘅提示同上傳嘅參考材料,送去畀 Hosted H3 推理服務處理,然後將結果顯示俾你。呢啲網站本身並唔係營運個模型。
呢個係最核心嘅突破。H3 產生「原生立體聲」——聲音係模型生成輸出嘅一部分,唔係事後先黐上去嘅音軌。 即係話,對白、腳步聲、環境氣氛聲同音樂全部係跟住畫面動作嚟生成,時間點同剪接位夾到實。
MiniMax 自己形容呢個係「聲音、音效同音樂嘅統一建模」,即係模型喺一次生成過程中,就處理好 Foley 效果、空間感同原創配樂。
個模型支援:
留意,唔同嘅第三方網站界面可能會提供額外嘅解像度、畫面比例或長度控制選項。
網頁界面會直接傳返一段已嵌入立體聲嘅影片檔案。網上生成器標榜嘅功能包括畫面比例控制、彈性長度選擇、參考材料上傳,以及文字轉影片、圖片動畫同多模態提示等工作流程。
MiniMax-H3)、fal.ai 等托管推理平台使用,亦都可以係 Hugging Face 下載開源權重自己部署。「原生立體聲」係好清楚嘅能力宣稱,但公開資料冇透露入面係用咩神經網絡架構嚟做到 frame-audio 同步。啲來源確認咗輸入輸出嘅行為同能力,但冇公開足夠嘅實作細節去解釋模型內部點樣做到咁精準嘅同步——係用某種擴散排程、音頻編碼 tokenization、一個共同訓練嘅 Transformer,定係其他方法。
可以肯定嘅係:模型喺一次生成入面就輸出到同步嘅聲音同影片。但背後嘅工程秘密,暫時仲留喺 MiniMax 嘅技術文件入面。