オンラインジェネレーター(minimaxh3.org、minimax-h3.appなど)はブラウザベースのフロントエンドとして機能します。プロンプトとアップロードされた参照データを収集し、ホストされたH3推論サービスに送信し、結果のメディアを表示します。これらのサイト自体がモデルを運用しているわけではありません。
ここが中核的な革新です。H3は「ネイティブステレオ音声」を生成します。つまり、音声はモデルの生成出力の一部であり、後から自動的に貼り付けられる音声トラックではありません。 これにより、セリフ、足音、環境音、音楽が、映像のアクションと関連づけて生成され、カットに合わせたタイミングで出力されます。
モデルがサポートする仕様は以下の通りです。
ウェブインターフェースは、生成された動画をステレオ音声が埋め込まれた状態で返します。ホスト型ジェネレーターが宣伝する機能には、アスペクト比の制御、柔軟な長さの選択、参照データのアップロード、テキスト・画像・マルチモーダル入力による生成ワークフローなどが含まれます。
MiniMax-H3)、fal.aiなどのホスト型推論プラットフォーム、そしてHugging Face上のオープンウェイト(セルフホストデプロイ用)として利用可能です。「ネイティブステレオ音声」は明確な機能の主張ですが、公開資料ではフレームと音声の同期を保証する正確なニューラルアーキテクチャについては開示されていません。特定の拡散スケジュール、オーディオコーデックのトークン化、共同学習されたトランスフォーマー、あるいはその他のアプローチのいずれによって内部でその精度を達成しているのか、その実装の詳細は明らかにされていません。
確かなことは、このモデルが単一の生成パスで、首尾一貫し同期された音声と動画を出力するということです。それを可能にしているエンジニアリングの詳細は、現時点ではMiniMaxの技術文書の中に留まっています。