Pada 3 Agustus 2026, MiniMax merilis bobot H3 Base di Hugging Face, termasuk bobot tugas FL2VA dan Ref2VA; ini bukan rilis lengkap seluruh sistem H3. Inti H3 Base adalah H3 Omni Transformer dense 33B satu aliran yang membuat video dan audio stereo tersinkronisasi secara bersama sama pada tahap 768p.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did MiniMax’s August 2026 open-weight release of H3-Base on Hugging Face include—covering H3’s 33B-parameter dense single-stream H3-Omn. Article summary: MiniMax’s August 3, 2026 Hugging Face release made the **H3-Base generation weights** available, not the entire three-stage H3 system. It brought a large multimodal, audio-native video model into local and customizable w. Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
Rilis MiniMax di Hugging Face pada Agustus 2026 sebaiknya dipahami sebagai pembukaan bobot H3-Base—tahap generasi dari sistem video H3—bukan pelepasan seluruh model yang diperlukan untuk mereplikasi layanan H3 terkelola secara utuh. Perbedaannya penting: H3-Base menghasilkan video dan audio tersinkronisasi pada 768p, sedangkan tahap pemrosesan konteks dan regenerasi 2K tetap dipisahkan. 1
5
MiniMax menerbitkan bobot H3 di Hugging Face pada 3 Agustus 2026. Rilis yang tersedia berfokus pada H3-Base, termasuk bobot tugas FL2VA dan Ref2VA yang dilaporkan tersedia. 1
13
Pusat sistemnya adalah H3-Omni-Transformer, Transformer dense satu aliran dengan 33 miliar parameter. Model ini tidak memperlakukan suara sebagai tambahan setelah video jadi: video dan audio didenoise bersama dalam satu proses generatif. Sistem H3 yang lebih luas menerima konteks gabungan berupa teks, gambar, video, dan audio, lalu dirancang menghasilkan video dengan suara stereo native. 5
10
Namun, angka 33B merujuk pada inti generatif Omni-Transformer, bukan berarti seluruh pipeline lengkap hanya memuat satu komponen 33B. Pipeline juga memakai encoder H3, VisualVAE, dan AudioVAE. 10
13
MiniMax menjelaskan H3 sebagai sistem dengan tiga modul:
Artinya, pemasangan H3-Base secara lokal tidak boleh disamakan dengan seluruh produk H3 yang dipamerkan dalam demo 2K. Sistem lengkap mendukung keluaran hingga 2K dan durasi hingga 15 detik, tetapi generator dasar yang dibuka adalah tahap 768p. 5
9
Ciri utama H3 adalah aliran generatif tunggal untuk video dan audio. H3-Omni-Transformer 33B menggunakan arsitektur Transformer dense. Repositori MiniMax menyebut sekitar 13B parameter berada pada cabang terkait AdaLN; keluarannya dapat dipraproses dan disimpan dalam cache. 10
Pipeline representasinya mencakup encoder, visual VAE, dan audio VAE. Deskripsi teknis yang dipublikasikan menyebut visual VAE mengompresi video 16× secara spasial dan 4× secara temporal; rancangan tokenisasinya menghasilkan pengurangan spasial efektif 32×. Kompresi tersebut membantu membuat generasi video lebih layak dijalankan, tetapi sekaligus menunjukkan bahwa angka 33B bukan ukuran lengkap kebutuhan memori maupun komputasi seluruh pipeline. 1
14
Sistem H3 lengkap dibuat untuk menerima prompt dan referensi yang memadukan teks, gambar diam, klip video, serta audio. Sistem ini dapat menghasilkan klip dengan audio stereo native pada resolusi hingga 2K dan durasi hingga 15 detik. 5
10
Bagi pengembang, bobot H3-Base memungkinkan eksperimen inferensi lokal, kuantisasi, adaptor, pendekatan fine-tuning, dan perangkat kreatif kustom. Namun, rilis tersebut tidak mencakup Context-IR MiniMax maupun model regenerasi 2K. Tim yang memakai referensi rumit mungkin perlu membangun lapisan persiapan prompt/konteks sendiri. Sementara itu, tim yang membutuhkan keluaran 2K tidak dapat menganggap H3-Base saja akan mereplikasi hasil layanan terkelola. 5
9
Liputan yang dipublikasikan menyebut tarif API video 2K sebesar 0,8 yuan per detik. Dalam penawaran yang dirujuk, input audio serta lima referensi gambar pertama disebut gratis. 14
27 Harga layanan dapat berubah menurut waktu, wilayah, dan skema produk, sehingga angka tersebut lebih tepat dibaca sebagai tarif API pada saat dipublikasikan, bukan daftar harga global yang permanen.
Materi promosi MiniMax dan SGLang juga menyatakan H3 berbiaya sekitar sepertiga Seedance 2.0 dalam perbandingan tertentu, serta dapat dijalankan secara lokal pada dua GPU RTX 5090 atau satu RTX 6000. 28
31 Itu adalah klaim penerapan untuk kombinasi perangkat lunak, presisi, dan strategi offloading tertentu—bukan spesifikasi minimum universal. Beban kerja total tetap mencakup encoder dan komponen VAE di luar Transformer 33B.
13
Workflow yang dihosting sendiri berpotensi membuat gambar produk, rekaman yang belum dirilis, aset suara, dan prompt tetap berada di dalam organisasi, alih-alih dikirim ke API generatif pihak ketiga. Ini dapat menarik bagi tim yang menangani aset rahasia. Namun, penggunaan lokal tidak menghapus kebutuhan akan kontrol akses, pemeriksaan hak atas materi masukan, peninjauan hasil, dan tata kelola internal.
Bobot terbuka memberi tim teknis jalur untuk menyambungkan generasi video ke perpustakaan manajemen aset, sistem peninjauan kreatif, alat rendering, dan alur pascaproduksi. Mereka juga dapat mengevaluasi kuantisasi maupun adaptasi khusus tugas.
Sebelum berinvestasi, organisasi perlu menelaah lisensinya. Pelaporan pihak ketiga menyebut ada pembatasan geografis yang memengaruhi penggunaan lokal di Amerika Serikat, Uni Eropa, Inggris, dan Korea Selatan. 4
Kegunaan praktisnya paling jelas bagi tim yang membuat banyak variasi video pendek: materi iklan, klip produk e-commerce, eksplorasi konsep, animatik, dan eksperimen konten media sosial. Generator lokal 768p dengan audio terintegrasi dapat mengurangi hambatan pada tahap iterasi kreatif awal, terutama bagi tim yang sudah memiliki kapasitas GPU yang memadai.
H3-Base bukan pengganti siap-pakai untuk setiap kebutuhan produksi video. Rilis terbukanya tidak mencakup tahap konteks penuh dan 2K, sementara model klip pendek tetap memerlukan penyuntingan, peninjauan manusia, serta pengelolaan hak. Nilai utamanya bukan sekadar karena H3 dapat diunduh, melainkan karena tahap generasi audio-video yang cukup mumpuni dapat dimasukkan ke workflow yang lebih terkendali—selama lisensi dan perangkat keras mengizinkannya.
MiniMax membuka bagian penting dari H3, yaitu H3-Base: fondasi generasi 768p yang ditenagai Transformer satu aliran dense 33B untuk membuat video dan audio stereo native secara bersamaan dari input multimodal. Namun, rilis itu sengaja lebih sempit daripada produk H3 lengkap. Context-IR dan regenerasi 2K tetap tertutup, sehingga H3-Base adalah fondasi generasi 768p yang dapat dikustomisasi, bukan sistem 2K terbuka yang lengkap. 5
9
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Pada 3 Agustus 2026, MiniMax merilis bobot H3 Base di Hugging Face, termasuk bobot tugas FL2VA dan Ref2VA; ini bukan rilis lengkap seluruh sistem H3.
Pada 3 Agustus 2026, MiniMax merilis bobot H3 Base di Hugging Face, termasuk bobot tugas FL2VA dan Ref2VA; ini bukan rilis lengkap seluruh sistem H3. Inti H3 Base adalah H3 Omni Transformer dense 33B satu aliran yang membuat video dan audio stereo tersinkronisasi secara bersama sama pada tahap 768p.
H3 Context IR untuk pemrosesan konteks kompleks dan H3 Regenerate 2K untuk keluaran 2K tetap tertutup, sehingga H3 Base tidak otomatis menyamai hasil 2K layanan terkelola.