MiniMax 於 2026 年 8 月 3 日在 Hugging Face 釋出的是 H3 Base 權重:一個可同步生成影片與原生立體聲音訊的 33B 密集式單串流模型。 完整 H3 系統由 Context IR、H3 Base 與 Regenerate 2K 組成;本次開放的是 768p 生成階段,並非可完整重現官方 2K 工作流的全部模型。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did MiniMax’s August 2026 open-weight release of H3-Base on Hugging Face include—covering H3’s 33B-parameter dense single-stream H3-Omn. Article summary: MiniMax’s August 3, 2026 Hugging Face release made the **H3-Base generation weights** available, not the entire three-stage H3 system. It brought a large multimodal, audio-native video model into local and customizable w. Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
MiniMax 在 2026 年 8 月於 Hugging Face 推出的 H3,較精確的說法是:開放了 H3-Base 的模型權重,而不是整套 H3 影片生成產品。
這個差異直接影響採用判斷。H3-Base 可產生帶有同步音訊的 768p 影片;但負責理解複雜多模態指令的 Context-IR,以及用於輸出 2K 成果的再生成階段,仍是分開且未開放的元件。1
5
MiniMax 於 2026 年 8 月 3 日在 Hugging Face 發布 H3 權重,核心是 H3-Base,包括公開報導所提到的 FL2VA 與 Ref2VA 任務權重。1
13
H3-Base 的生成核心是 H3-Omni-Transformer:一個有 330 億參數的密集式、單串流 Transformer。它不把聲音當成影片完成後再外掛的步驟,而是在同一個生成/去噪流程中,聯合生成影像與音訊。H3 系統可接收文字、圖片、影片與音訊混合而成的多模態上下文,目標輸出則是帶有原生立體聲的影片。5
10
不過,「33B」只是在描述 Omni-Transformer 這個生成核心,並不等於整個部署管線只需載入一個 33B checkpoint。完整管線還涉及 H3 編碼器、VisualVAE 與 AudioVAE 等元件。10
13
MiniMax 將完整 H3 系統劃分為三個模組:
換句話說,將 H3-Base 跑在本地,不應與官方展示的完整 2K 流程畫上等號。完整 H3 系統標示可支援最高 2K、最長 15 秒的原生立體聲影片,但此次可下載的 Base 生成器是 768p 階段。5
9
H3 的核心設計,是讓影像與音訊共用一條生成序列。33B H3-Omni-Transformer 採密集式 Transformer 架構;MiniMax 的程式庫說明,其中約有 130 億參數位於 AdaLN 相關分支,而這些調制輸出可預先計算並快取。10
支援這套生成流程的表徵管線包含編碼器、視覺 VAE 與音訊 VAE。技術說明指出,視覺 VAE 對影片進行 16 倍空間壓縮與 4 倍時間壓縮,其 token 化設計可達到等效 32 倍空間縮減。1
14
這類壓縮是讓影片生成在運算上可行的關鍵,也說明了為什麼只看「330 億參數」不足以估計完整系統的權重規模、記憶體占用與實際部署成本。
完整 H3 的定位,是接受混合式的文字提示、靜態圖片、影片片段與音訊素材,生成最長 15 秒、最高 2K 的原生立體聲影片。5
10
對開發團隊而言,H3-Base 開放權重帶來幾種實際可能:
但它並沒有附上 MiniMax 的 Context-IR 系統,也沒有 2K 再生成模型。若團隊依賴複雜的參考素材與指令控制,便需要自行建立提示詞/上下文準備層;若交付規格要求 2K,也不能預設 H3-Base 單獨就能重現官方代管服務的效果。5
9
公開報導曾列出 H3 的 2K API 費率為每秒 0.8 元人民幣,並稱音訊參考輸入及前 5 張圖片參考輸入免費。14
27 這類價格屬於特定時間點、特定服務條件下的公開資訊,實際計費仍可能隨服務、地區與方案而異,不應視為永久的全球定價。
MiniMax 與 SGLang 的宣傳資訊也曾將 H3 描述為在特定比較下,成本約為 Seedance 2.0 的三分之一,並表示可在 2 張 RTX 5090 或 1 張 RTX 6000 上本地執行。28
31
這些硬體說法應理解為特定軟體堆疊、量化精度與卸載設定下的部署主張,而不是通用的最低硬體門檻。除了 33B Transformer,本地工作負載還包括編碼器和 VAE 元件。13
自架流程可讓產品圖、未公開毛片、聲音資產與提示詞留在組織內部,而不是傳送到第三方生成 API。對處理保密素材的團隊,這是一項明顯優勢。
但「在地端」不代表免除治理工作。存取權限、輸入素材權利、輸出審核與內部使用規範仍不可少。
開放權重讓技術團隊有機會把生成能力接入既有的素材庫、創意審核系統、渲染工具與後製流程,也能研究量化或針對特定任務的調整方式。
不過,在投入前仍應仔細檢視授權條款。第三方報導指出,社群授權對美國、歐盟、英國與南韓的本地使用設有限制。4
H3-Base 的實務契合點,較可能在於需要大量產生短片變體的工作:例如廣告素材、電商商品短片、概念提案、動態分鏡,以及社群內容測試。
如果團隊已有合適 GPU 資源,768p 的本地聲畫生成可降低前期創意迭代阻力;但它不是所有影片製作需求的一鍵替代方案。開放版本少了完整的上下文處理與 2K 階段,而短片生成結果仍需要人工挑選、剪輯與權利審查。
MiniMax 這次開放的是 H3 中相當重要、但範圍明確的一塊:以 330 億參數單串流 Transformer 為核心的 H3-Base,可聯合生成 768p 影片與原生立體聲音訊。
然而,H3-Context-IR 與 H3-Regenerate-2K 仍未開放。因此,H3-Base 更適合被看作一個可客製、可自架的 768p 聲畫生成基礎,而不是一套完整開放的 2K 影片製作系統。5
9
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
MiniMax 於 2026 年 8 月 3 日在 Hugging Face 釋出的是 H3 Base 權重:一個可同步生成影片與原生立體聲音訊的 33B 密集式單串流模型。
MiniMax 於 2026 年 8 月 3 日在 Hugging Face 釋出的是 H3 Base 權重:一個可同步生成影片與原生立體聲音訊的 33B 密集式單串流模型。 完整 H3 系統由 Context IR、H3 Base 與 Regenerate 2K 組成;本次開放的是 768p 生成階段,並非可完整重現官方 2K 工作流的全部模型。
開放權重讓團隊可嘗試自架、量化、微調與整合既有製作流程,但仍須確認社群授權、GPU 配置,以及缺少 Context IR 和 2K 再生成器帶來的限制。