MiniMax H3 dilancarkan dengan open weights pada 3 Ogos 2026. Model ini menggabungkan teks, imej, video dan audio, serta boleh menghasilkan klip sehingga kira kira 15 saat dengan audio stereo asli.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 ialah model penjanaan video open-weight dan omni-modal yang dilancarkan pada 3 Ogos 2026. Idea utamanya mudah tetapi penting: teks, imej, video dan audio boleh diletakkan dalam konteks yang sama, sebelum model menghasilkan video bersama audio stereo asli—bukan memaksa pencipta mengurus setiap elemen melalui alat berasingan. 1
2
Ini tidak bermakna H3 boleh menggantikan kerja penyuntingan, pengarahan atau semakan manusia. Namun, ia mengalihkan sebahagian besar proses daripada mencari aset mentah dan menyelaraskan trek kepada menerangkan niat, menyediakan rujukan, menjana beberapa variasi dan memilih hasil yang paling kuat.
H3 menyokong penciptaan video daripada arahan teks, bingkai utama dan rujukan multimodal. Dokumentasi ComfyUI menyatakan outputnya boleh mencapai resolusi sehingga 2K, 24 bingkai sesaat dan kira-kira 15 saat, dengan suara, muzik serta kesan bunyi dijana sebagai audio stereo asli dalam proses yang sama. 2
Integrasi audio ini penting kerana ia menyelesaikan salah satu masalah biasa dalam produksi video AI: visual dan bunyi tidak lagi perlu dimulakan sebagai dua tugasan yang sepenuhnya berasingan. H3 memodelkan hasil audiovisual secara bersama, walaupun kerja penyuntingan dan pembersihan audio masih diperlukan untuk produksi profesional.
Pelepasan terbuka H3 merangkumi dua varian utama H3-Base.
FL2VA direka untuk text-to-video serta kawalan menggunakan bingkai pertama, bingkai terakhir atau kedua-duanya. Ia lebih sesuai apabila pencipta mahu bermula dengan arahan teks, menetapkan rupa pada titik mula atau akhir, atau mengawal peralihan antara bingkai yang dibekalkan. 1
5
8
Ref2VA pula berorientasikan rujukan. Ia boleh menggunakan gabungan imej, video dan audio sebagai konteks, membolehkan rupa watak, pergerakan, identiti, gaya atau suara dipengaruhi dalam satu persediaan penjanaan. 1
2
8
Secara praktikal, FL2VA lebih sesuai untuk aliran kerja berasaskan arahan dan keyframe, manakala Ref2VA ditujukan kepada projek yang memerlukan beberapa aset media sedia ada sebagai panduan.
Sebelum wujudnya aliran kerja omni-modal, klip pendek mungkin memerlukan langkah berasingan untuk:
H3 memampatkan beberapa langkah tersebut ke dalam satu interaksi dengan model. Pencipta boleh memberikan arahan, bingkai permulaan atau penamat, rujukan gerakan dan rujukan audio, kemudian meminta satu calon audiovisual—bukannya mengurus setiap aset secara berasingan. 2
8
Hasilnya tidak semestinya filem yang terus boleh diterbitkan. Perubahan yang lebih besar ialah pada tempat usaha kreatif digunakan: kurang masa dihabiskan untuk mendapatkan setiap komponen mentah, manakala lebih banyak masa digunakan untuk menetapkan batasan, membandingkan variasi, memperhalus arahan dan menyunting hasil terpilih.
Itulah kesan reka bentuk multimodal H3, bukan jaminan bahawa setiap klip akan mempunyai watak yang konsisten, pemasaan yang sempurna atau audio bertaraf siaran.
Ini ialah perkara paling penting untuk difahami sebelum menilai H3.
Pelepasan yang boleh dimuat turun meliputi H3-Base, termasuk FL2VA dan Ref2VA. Panduan lokal serta dokumentasi model melaporkan bahawa checkpoint Base menghasilkan video pada 768p, manakala peringkat H3-Regenerate-2K tidak dibuka kepada umum dan hanya tersedia melalui perkhidmatan hos MiniMax. 6
9
12
Jadi, dakwaan bahawa “H3 menyokong 2K” dan dakwaan bahawa “open weights H3 boleh menghasilkan keseluruhan saluran paip 2K secara lokal” ialah dua perkara berbeza. Dakwaan pertama merujuk kepada tawaran H3 yang lebih luas, termasuk versi hos. Dakwaan kedua melebih-lebihkan apa yang sebenarnya dilepaskan.
Boleh, tetapi penggunaannya lebih menyerupai projek kejuruteraan yang mempunyai banyak batasan berbanding pemasangan desktop yang mudah.
Berat terkuantum, penggunaan RAM sistem dan teknik pemindahan lapisan boleh menjadikan sesetengah aliran kerja H3 boleh dicapai pada GPU dalam julat 12 GB, menurut laporan komuniti. Namun, kombinasi kerja terkecil dilaporkan memerlukan kira-kira 42.5 GB ruang fail, jadi kapasiti storan dan memori sistem juga penting selain VRAM. 7
10
43
RTX 5070 Ti mempunyai 16 GB VRAM, bukannya 12 GB. Kuantisasi eksperimen H3 telah diuji pada GPU tersebut, tetapi laporan yang diterbitkan menekankan bahawa konfigurasi, resolusi, bilangan langkah, strategi offloading dan aliran kerja semuanya mempengaruhi sama ada proses berjaya serta tempoh yang diperlukan. 33
34
39
Oleh itu, angka masa yang dilaporkan secara lokal perlu dianggap sebagai pengalaman khusus konfigurasi, bukannya penanda aras umum H3. Satu ujian komuniti melaporkan kira-kira 160 saat untuk klip 480p berdurasi lima saat dan sekitar 560 saat pada 720p menggunakan sistem RTX 5070 Ti. Laporan lain menunjukkan keputusan yang berbeza dan secara jelas menyatakan bahawa masa yang disahkan untuk kad tersebut belum tersedia. 45
34
38
Bagi pencipta yang lebih mengutamakan kelajuan berbanding kawalan lokal, API hos mengelakkan keperluan memuat turun model dan menjalankan aliran kerja besar dengan offloading. ComfyUI juga menyokong aliran kerja API H3 yang dihoskan, jadi pilihan pengguna tidak terhad kepada sama ada pemasangan sepenuhnya lokal atau aplikasi kreatif yang berasingan. 48
ComfyUI menambah sokongan asli untuk H3 ketika open weights dikeluarkan, termasuk aliran kerja text-to-video, kawalan imej atau bingkai, dan reference-to-video. 1
2
Akses berasaskan nod ini juga memudahkan H3 disambungkan kepada skrip dan automasi kreatif. Secara prinsip, ejen pengekodan boleh menghantar banyak arahan pendek dengan seed atau kombinasi rujukan yang berbeza, menyusun fail yang terhasil, menghasilkan helaian pratonton dan membantu manusia menilai calon.
Perbezaannya perlu jelas: penjanaan selari dan penilaian tersebut ialah keupayaan sistem automasi di sekeliling H3, bukan ciri H3 yang secara sendiri menentukan klip terbaik. Semakan manusia masih penting untuk kesinambungan, komposisi, mutu dialog dan kesesuaian kandungan.
Dokumentasi rasmi pay-as-you-go MiniMax menyenaraikan harga H3 pada AS$0.08 bagi setiap saat output 768p dan AS$0.13 bagi setiap saat output 2K. Dokumentasi yang sama menyenaraikan penjanaan semula daripada 768p ke 2K pada AS$0.05 sesaat. 17
Maka, anggaran untuk klip 10 saat ialah:
Dakwaan yang sering diulang bahawa klip 2K standard berdurasi 10 saat bermula pada sekitar AS$0.60 tidak disokong oleh kadar rasmi yang tersedia dalam sumber ini. Ia mungkin merujuk kepada promosi, pengiraan kredit langganan atau perkhidmatan lain, tetapi tidak wajar dipersembahkan sebagai harga API standard MiniMax tanpa bukti yang lebih kukuh.
MiniMax Design juga ialah produk yang berbeza daripada H3 weights yang boleh dimuat turun. Laporan pihak ketiga menggambarkannya sebagai produk kreatif tertutup yang dibina menggunakan atau sekitar H3, dengan sistem kredit dan tawaran tersendiri. Ia tidak patut disamakan dengan menjalankan H3-Base secara lokal. 18
Kepentingan MiniMax H3 bukan kerana ia menghapuskan setiap langkah produksi video, tetapi kerana ia menyatukan input yang sebelum ini hidup dalam alat berasingan. Teks boleh menerangkan adegan, imej menetapkan penampilan, video membimbing gerakan dan audio mempengaruhi suara atau bunyi—sementara model menghasilkan calon audiovisual yang disegerakkan. 2
Bagi pencipta, pendekatan ini boleh menjadikan proses mencipta idea video pendek lebih pantas dan berulang. Bagi pembangun, open weights dan sokongan ComfyUI menyediakan asas untuk saluran paip tersuai, penjanaan kelompok dan semakan berbantukan ejen.
Bagi pembeli pula, persoalan praktikalnya ialah sama ada kawalan lokal dan ruang eksperimen berbaloi dengan kos perkakasan serta persediaan yang besar, atau sama ada penjanaan 2K melalui hos menawarkan pertukaran yang lebih munasabah.
Ringkasan paling tepat ialah ini: H3 mengurangkan pemecahan pada peringkat penjanaan, tetapi tidak menghapuskan keperluan terhadap pertimbangan produksi—dan pelepasan open-weight-nya hanyalah sebahagian daripada sistem 2K hos yang lengkap.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MiniMax H3 dilancarkan dengan open weights pada 3 Ogos 2026. Model ini menggabungkan teks, imej, video dan audio, serta boleh menghasilkan klip sehingga kira kira 15 saat dengan audio stereo asli.
MiniMax H3 dilancarkan dengan open weights pada 3 Ogos 2026. Model ini menggabungkan teks, imej, video dan audio, serta boleh menghasilkan klip sehingga kira kira 15 saat dengan audio stereo asli. FL2VA sesuai untuk text to video dan kawalan bingkai pertama atau terakhir, manakala Ref2VA menggunakan rujukan imej, video dan audio untuk kawalan yang lebih terperinci.
Harga rasmi API ialah AS$0.08 sesaat untuk output 768p dan AS$0.13 sesaat untuk 2K—bersamaan kira kira AS$0.80 atau AS$1.30 bagi klip 10 saat, sebelum caj tambahan yang berkenaan.