従来のモデルが動画と音声を別々のタスクとして扱うのに対し、H3はテキスト、画像、動画、音声を一つのクリエイティブコンテキストとして共同で解釈します。 一部のホスト型インターフェースでは、1回の生成リクエストで最大9枚の画像、3つの動画クリップ、3つの音声トラックを渡すことができます。モデルは、与えられたすべての情報から、キャラクターのアイデンティティ、パフォーマンス、カメラの動き、構図、サウンドスケープ、編集リズムを読み取ります。
オンラインジェネレーター(minimaxh3.org、minimax-h3.appなど)はブラウザベースのフロントエンドとして機能します。プロンプトとアップロードされた参照データを収集し、ホストされたH3推論サービスに送信し、結果のメディアを表示します。これらのサイト自体がモデルを運用しているわけではありません。
ここが中核的な革新です。H3は「ネイティブステレオ音声」を生成します。つまり、音声はモデルの生成出力の一部であり、後から自動的に貼り付けられる音声トラックではありません。 これにより、セリフ、足音、環境音、音楽が、映像のアクションと関連づけて生成され、カットに合わせたタイミングで出力されます。
MiniMaxはこれを「音声、効果音、音楽の統一モデリング」と説明しており、モデルがフォーリー、ルームトーン、さらにはオリジナルのスコアまでを単一の生成パスで処理することを示唆しています。
モデルがサポートする仕様は以下の通りです。
個々のサードパーティ製インターフェースによっては、追加の解像度、アスペクト比、長さの制御が可能な場合もあります。
ウェブインターフェースは、生成された動画をステレオ音声が埋め込まれた状態で返します。ホスト型ジェネレーターが宣伝する機能には、アスペクト比の制御、柔軟な長さの選択、参照データのアップロード、テキスト・画像・マルチモーダル入力による生成ワークフローなどが含まれます。
MiniMax-H3)、fal.aiなどのホスト型推論プラットフォーム、そしてHugging Face上のオープンウェイト(セルフホストデプロイ用)として利用可能です。「ネイティブステレオ音声」は明確な機能の主張ですが、公開資料ではフレームと音声の同期を保証する正確なニューラルアーキテクチャについては開示されていません。特定の拡散スケジュール、オーディオコーデックのトークン化、共同学習されたトランスフォーマー、あるいはその他のアプローチのいずれによって内部でその精度を達成しているのか、その実装の詳細は明らかにされていません。
確かなことは、このモデルが単一の生成パスで、首尾一貫し同期された音声と動画を出力するということです。それを可能にしているエンジニアリングの詳細は、現時点ではMiniMaxの技術文書の中に留まっています。