MiniMax merilis bobot terbuka H3 pada 3 Agustus 2026. Model ini memadukan teks, gambar, video, dan audio, lalu dapat menghasilkan video hingga sekitar 15 detik dengan audio stereo bawaan.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 adalah model generasi video open-weight dan omni-modal yang dirilis pada 3 Agustus 2026. Gagasan utamanya adalah menempatkan teks, gambar, video, dan audio dalam konteks yang sama, kemudian menghasilkan video sekaligus suara stereo bawaan—alih-alih memaksa kreator merangkai setiap elemen melalui alat yang terpisah. 1
2
Namun, H3 bukan pengganti penyuntingan, pengarahan kreatif, atau proses peninjauan. Perubahan terbesarnya ada pada alur kerja: kreator dapat lebih cepat menjelaskan tujuan, memasukkan referensi, membuat beberapa variasi, lalu memilih hasil yang paling kuat.
H3 mendukung pembuatan video dari prompt teks, keyframe, serta berbagai referensi multimodal. Dokumentasi ComfyUI menyebutkan dukungan output hingga resolusi 2K, 24 frame per detik, dan durasi sekitar 15 detik. Suara, musik, dan efek bunyi dihasilkan sebagai audio stereo bawaan dalam proses yang sama. 2
Integrasi audio ini penting karena menyasar salah satu sumber kerepotan terbesar dalam produksi video berbasis AI: visual dan suara tidak lagi harus dimulai sebagai dua pekerjaan yang sepenuhnya terpisah. H3 memodelkan hasil audiovisual secara bersama-sama, meski pekerjaan profesional tetap mungkin memerlukan penyuntingan, pembersihan audio, dan penyesuaian akhir.
Rilis terbuka H3-Base mencakup dua varian utama.
FL2VA dirancang untuk text-to-video serta pengondisian frame pertama, frame terakhir, atau keduanya. Varian ini cocok ketika kreator ingin memulai dari prompt, menetapkan titik awal atau akhir visual, maupun mengarahkan transisi di antara frame yang sudah disediakan. 1
5
8
Ref2VA merupakan jalur berbasis referensi. Varian ini dapat menggunakan kombinasi gambar, video, dan audio sebagai konteks. Dengan begitu, identitas karakter, gaya visual, gerakan, perilaku kamera, atau suara dapat dijadikan referensi dalam satu pengaturan generasi. 1
2
8
Secara praktis, FL2VA lebih sesuai untuk pekerjaan yang dipimpin prompt dan keyframe. Ref2VA ditujukan untuk proyek yang perlu menggabungkan beberapa aset media agar hasilnya mengikuti referensi yang lebih spesifik.
Dalam alur kerja tradisional berbasis beberapa alat AI, sebuah klip pendek mungkin membutuhkan langkah terpisah untuk:
H3 memadatkan sejumlah langkah tersebut menjadi satu interaksi dengan model. Kreator dapat memasukkan prompt, frame awal atau akhir, referensi gerakan, dan referensi audio, lalu meminta kandidat audiovisual tanpa harus mengelola setiap aset secara terpisah. 2
8
Hasilnya belum tentu menjadi film yang siap tayang. Perubahan yang lebih penting adalah pergeseran fokus kreatif: lebih sedikit waktu untuk mengumpulkan seluruh komponen mentah, dan lebih banyak waktu untuk menentukan batasan, membandingkan variasi, menyempurnakan prompt, serta menyunting hasil pilihan.
Desain multimodal H3 tidak menjamin karakter selalu konsisten, timing sempurna, dialog tanpa cacat, atau audio dengan kualitas siap siar.
Ini adalah catatan paling penting bagi siapa pun yang sedang mengevaluasi H3.
Rilis yang dapat diunduh mencakup H3-Base, termasuk FL2VA dan Ref2VA. Panduan lokal serta dokumentasi model melaporkan bahwa checkpoint Base menghasilkan video 768p. Sementara itu, tahap H3-Regenerate-2K belum bersifat open-source dan tersedia melalui layanan hosted milik MiniMax. 6
9
12
Jadi, klaim “H3 mendukung 2K” dan “bobot terbuka H3 dapat menjalankan pipeline 2K lengkap secara lokal” adalah dua hal berbeda. Klaim pertama menggambarkan penawaran hosted secara lebih luas; klaim kedua melebih-lebihkan cakupan rilis terbuka.
Bisa, tetapi penggunaannya lebih mirip proyek rekayasa yang penuh kompromi daripada instalasi desktop sekali klik.
Menurut laporan komunitas, bobot terkuantisasi, penggunaan RAM sistem, dan teknik layer offloading dapat membuat sebagian workflow H3 berjalan pada GPU dengan VRAM sekitar 12 GB. Kombinasi kerja terkecil dilaporkan membutuhkan sekitar 42,5 GB ruang berkas, sehingga kapasitas penyimpanan dan RAM sistem sama pentingnya dengan VRAM. 7
10
43
Perlu diluruskan, RTX 5070 Ti memiliki VRAM 16 GB, bukan 12 GB. Kuantisasi eksperimental H3 telah diuji pada GPU tersebut, tetapi konfigurasi yang digunakan, resolusi, jumlah langkah, strategi offloading, dan workflow sangat memengaruhi keberhasilan serta waktu generasi. 33
34
39
Karena itu, angka waktu yang beredar sebaiknya diperlakukan sebagai laporan anekdotal yang bergantung pada konfigurasi, bukan benchmark umum untuk H3. Salah satu uji komunitas melaporkan sekitar 160 detik untuk klip 480p berdurasi 5 detik dan sekitar 560 detik pada 720p di sistem RTX 5070 Ti. Laporan lain menunjukkan hasil berbeda dan secara eksplisit menyebut belum adanya pengukuran waktu yang terverifikasi untuk kartu tersebut. 45
34
38
Bagi kreator yang lebih mengutamakan kecepatan daripada kendali lokal, API hosted menghilangkan kebutuhan mengunduh model dan menjalankan workflow besar dengan offloading. ComfyUI juga mendukung workflow API hosted H3, sehingga pilihannya tidak terbatas pada menjalankan semuanya secara lokal atau berpindah ke aplikasi kreatif lain. 48
ComfyUI menambahkan dukungan native untuk H3 ketika bobot terbuka dirilis, termasuk workflow text-to-video, pengondisian gambar atau frame, serta reference-to-video. 1
2
Akses berbasis node ini juga memudahkan H3 dihubungkan dengan skrip dan otomasi kreatif. Secara teori, agen pemrograman dapat mengirim banyak prompt pendek dengan seed atau kombinasi referensi berbeda, mengatur berkas hasil, membuat lembar kontak, lalu membantu manusia meninjau kandidat.
Bobot terbuka membuat orkestrasi lokal dan berbasis skrip semacam ini lebih memungkinkan. Namun, generasi paralel dan evaluasi tersebut adalah kemampuan sistem otomasi di sekitarnya, bukan fitur H3 yang secara mandiri dapat menentukan klip terbaik. Peninjauan manusia tetap penting untuk kontinuitas, komposisi, kualitas dialog, dan kepantasan hasil.
Dokumentasi resmi pay-as-you-go MiniMax mencantumkan harga H3 sebesar US$0,08 per detik untuk output 768p dan US$0,13 per detik untuk output 2K. Dokumentasi yang sama mencantumkan regenerasi dari 768p ke 2K dengan harga US$0,05 per detik. 17
Dengan tarif tersebut, satu video berdurasi 10 detik berharga:
Klaim yang sering diulang bahwa klip 2K standar berdurasi 10 detik dimulai dari sekitar US$0,60 tidak didukung oleh kartu tarif resmi yang tersedia dalam konteks ini. Angka tersebut mungkin merujuk pada promosi, perhitungan kredit langganan, atau layanan lain, tetapi tidak seharusnya disebut sebagai harga API standar MiniMax tanpa bukti yang lebih kuat.
MiniMax Design juga merupakan produk yang berbeda dari bobot H3 yang dapat diunduh. Laporan pihak ketiga menggambarkannya sebagai produk kreatif tertutup yang dibangun di atas atau di sekitar H3, dengan sistem kredit dan penawarannya sendiri. Produk itu tidak sama dengan menjalankan H3-Base secara lokal. 18
Signifikansi MiniMax H3 bukan karena model ini menghapus seluruh tahapan produksi video, melainkan karena ia menyatukan input yang sebelumnya tersebar di berbagai alat. Teks dapat menjelaskan adegan, gambar menetapkan tampilan, video mengarahkan gerakan, dan audio memengaruhi suara atau bunyi—sementara model menghasilkan kandidat audiovisual yang sudah disinkronkan. 2
Bagi kreator, pendekatan ini dapat membuat proses mencari ide untuk konten pendek menjadi lebih iteratif dan berbasis referensi. Bagi pengembang, bobot terbuka dan dukungan ComfyUI menyediakan fondasi untuk pipeline khusus, generasi massal, serta peninjauan yang dibantu agen.
Bagi calon pengguna, pertanyaan praktisnya adalah: apakah kendali lokal dan ruang eksperimen sepadan dengan kebutuhan hardware serta biaya setup yang besar, atau apakah generasi 2K hosted menawarkan kompromi yang lebih masuk akal?
Ringkasan paling akuratnya sederhana: H3 mengurangi fragmentasi pada tahap generasi, tetapi tidak menghilangkan kebutuhan akan penilaian produksi. Selain itu, rilis open-weight H3 baru mencakup sebagian dari sistem hosted 2K secara keseluruhan.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
MiniMax merilis bobot terbuka H3 pada 3 Agustus 2026. Model ini memadukan teks, gambar, video, dan audio, lalu dapat menghasilkan video hingga sekitar 15 detik dengan audio stereo bawaan.
MiniMax merilis bobot terbuka H3 pada 3 Agustus 2026. Model ini memadukan teks, gambar, video, dan audio, lalu dapat menghasilkan video hingga sekitar 15 detik dengan audio stereo bawaan. FL2VA ditujukan untuk text to video dan pengondisian frame awal atau akhir, sedangkan Ref2VA menggunakan referensi gambar, video, dan audio untuk menghasilkan video yang lebih terarah.
Harga resmi API pay as you go adalah US$0,08 per detik untuk 768p dan US$0,13 per detik untuk 2K—setara US$0,80 dan US$1,30 untuk video berdurasi 10 detik, sebelum biaya tambahan yang berlaku.