Tidak seperti model terdahulu yang menganggap video dan audio sebagai tugas berasingan, H3 mentafsir teks, imej, video, dan audio sebagai satu konteks kreatif secara bersama. Sesetengah antara muka yang dihoskan membolehkan anda menghantar sehingga 9 imej, 3 klip video, dan 3 trek audio dalam satu permintaan penjanaan. Model membaca identiti, persembahan, pergerakan kamera, komposisi, landskap bunyi, dan irama suntingan daripada apa sahaja yang anda berikan.
Penjana dalam talian (minimaxh3.org, minimax-h3.app, dan lain-lain) bertindak sebagai antara muka hadapan berasaskan pelayar: mereka mengumpul gesaan dan rujukan yang dimuat naik, menghantarnya ke perkhidmatan inferens H3 yang dihoskan, dan mempersembahkan media yang terhasil. Laman-laman ini tidak mengendalikan model itu sendiri.
Inilah inovasi teras. H3 menghasilkan "audio stereo asli" — bunyi adalah sebahagian daripada output penjanaan model, bukan trek audio yang dilampirkan secara automatik selepas itu. Ini bermakna dialog, bunyi tapak kaki, suasana persekitaran, dan muzik dijana berhubung dengan aksi visual dan dimasa mengikut potongan.
MiniMax menerangkannya sebagai "pemodelan bersatu suara, kesan bunyi, dan muzik," menunjukkan model mengendalikan foley, nada bilik, dan juga skor asli dalam satu laluan penjanaan.
Model menyokong:
Antara muka pihak ketiga individu mungkin mendedahkan kawalan resolusi, nisbah aspek, atau tempoh tambahan.
Antara muka web mengembalikan video yang dijana dengan audio stereo yang terbenam dalam fail yang sama. Ciri-ciri yang diiklankan oleh penjana yang dihoskan termasuk kawalan nisbah aspek, pemilihan tempoh yang fleksibel, muat naik rujukan, dan aliran kerja untuk teks-ke-video, animasi imej, dan gesaan multimodal.
MiniMax-H3), platform inferens yang dihoskan seperti fal.ai, dan sebagai pemberat terbuka di Hugging Face untuk penggunaan sendiri. "Audio stereo asli" adalah tuntutan keupayaan yang jelas, tetapi bahan awam tidak mendedahkan seni bina neural tepat yang menguatkuasakan penyegerakan bingkai-audio. Sumber mengesahkan tingkah laku input/output dan keupayaan, tetapi mereka tidak mendedahkan butiran pelaksanaan yang mencukupi untuk menjelaskan bagaimana model secara dalaman mencapai ketepatan itu — sama ada melalui jadual resapan tertentu, tokenisasi codec audio, transformer yang dilatih bersama, atau pendekatan lain.
Apa yang pasti: model mengeluarkan audio dan video yang koheren dan disegerakkan dalam satu laluan penjanaan. Kejuruteraan yang memungkinkannya kekal — buat masa ini — di dalam dokumentasi teknikal MiniMax.