Tidak seperti model sebelumnya yang memperlakukan video dan audio sebagai tugas terpisah, H3 menafsirkan teks, gambar, video, dan audio secara bersamaan sebagai satu konteks kreatif. Beberapa antarmuka yang di-host memungkinkan Anda untuk mengirimkan hingga 9 gambar, 3 klip video, dan 3 trek audio dalam satu permintaan generasi. Model ini membaca identitas, performa, pergerakan kamera, komposisi, lanskap suara, dan ritme pengeditan dari apa pun yang Anda berikan.
Generator online (minimaxh3.org, minimax-h3.app, dan lainnya) berfungsi sebagai antarmuka berbasis browser: mereka mengumpulkan prompt dan referensi yang Anda unggah, mengirimkannya ke layanan inferensi H3 yang di-host, dan menampilkan media yang dihasilkan. Situs-situs ini tidak mengoperasikan model itu sendiri.
Inilah inovasi intinya. H3 menghasilkan "audio stereo asli" — suara adalah bagian dari output generasi model, bukan trek audio yang ditempel secara otomatis setelahnya. Ini berarti dialog, suara langkah kaki, suara ambient lingkungan, dan musik dihasilkan dalam kaitannya dengan aksi visual dan diatur waktunya sesuai dengan potongan gambar.
MiniMax menggambarkannya sebagai "pemodelan terpadu suara, efek suara, dan musik," yang menyiratkan model ini menangani efek foley, suara ruangan, dan bahkan skor orisinal dalam satu kali proses generasi.
Model ini mendukung:
Antarmuka pihak ketiga mungkin menawarkan kontrol tambahan untuk resolusi, rasio aspek, atau durasi.
Antarmuka web mengembalikan video yang dihasilkan dengan audio stereo yang tertanam dalam file yang sama. Fitur-fitur yang diiklankan oleh generator yang di-host mencakup kontrol rasio aspek, pemilihan durasi yang fleksibel, unggahan referensi, dan alur kerja untuk teks-ke-video, animasi gambar, dan prompting multimodal.
MiniMax-H3), platform inferensi yang di-host seperti fal.ai, dan sebagai bobot terbuka di Hugging Face untuk deployment mandiri. "Audio stereo asli" adalah klaim kemampuan yang jelas, tetapi materi publik tidak mengungkapkan arsitektur neural pasti yang memaksa sinkronisasi frame-audio. Sumber-sumber mengonfirmasi perilaku input/output dan kemampuannya, tetapi mereka tidak mengungkapkan detail implementasi yang cukup untuk menjelaskan secara tepat bagaimana model secara internal mencapai presisi tersebut — apakah melalui jadwal difusi tertentu, tokenisasi codec audio, transformer yang dilatih bersama, atau pendekatan lainnya.
Yang pasti: model ini menghasilkan output audio dan video yang koheren dan tersinkronisasi dalam satu kali proses generasi. Rekayasa yang memungkinkan hal itu — untuk saat ini — masih berada di dalam dokumentasi teknis MiniMax.