MiniMax ने 3 अगस्त 2026 को Hugging Face पर H3 Base वेट्स जारी किए—33B डेंस, सिंगल स्ट्रीम मॉडल जो 768p वीडियो और समकालिक स्टीरियो ऑडियो बनाता है। पूरा H3 सिस्टम टेक्स्ट, इमेज, वीडियो और ऑडियो के मिश्रित संदर्भ को समझ सकता है तथा 15 सेकंड तक, 2K तक आउटपुट दे सकता है; लेकिन ओपन रिलीज़ केवल 768p बेस जनरेशन स्टेज की है।...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did MiniMax’s August 2026 open-weight release of H3-Base on Hugging Face include—covering H3’s 33B-parameter dense single-stream H3-Omn. Article summary: MiniMax’s August 3, 2026 Hugging Face release made the **H3-Base generation weights** available, not the entire three-stage H3 system. It brought a large multimodal, audio-native video model into local and customizable w. Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
MiniMax की अगस्त 2026 की Hugging Face रिलीज़ को सही तरह से समझने का सबसे आसान तरीका यह है: कंपनी ने अपने H3 वीडियो सिस्टम का H3-Base जनरेशन स्टेज ओपन वेट्स के रूप में जारी किया है, पूरी होस्टेड H3 वर्कफ़्लो नहीं। H3-Base 768p पर वीडियो और उसके साथ सिंक्रोनाइज़्ड ऑडियो बना सकता है, जबकि जटिल संदर्भ को तैयार करने वाला और 2K आउटपुट के लिए रीजनरेशन करने वाला हिस्सा अलग रहा। 1
5
MiniMax ने 3 अगस्त 2026 को H3 वेट्स Hugging Face पर प्रकाशित किए। उपलब्ध रिलीज़ का केंद्र H3-Base था, जिसमें FL2VA और Ref2VA कार्यों के लिए रिपोर्ट किए गए वेट्स शामिल हैं। 1
13
इसका मुख्य जनरेशन इंजन H3-Omni-Transformer है—33 अरब पैरामीटर वाला डेंस, सिंगल-स्ट्रीम Transformer। इसमें ऑडियो को बाद में जोड़ा जाने वाला अलग तत्व नहीं माना गया है: मॉडल एक साझा जनरेशन प्रक्रिया में वीडियो और ऑडियो को साथ में डीनॉइज़ करता है। व्यापक H3 सिस्टम टेक्स्ट, इमेज, वीडियो और ऑडियो से बने संयुक्त संदर्भ को ले सकता है और मूल स्टीरियो साउंड वाला वीडियो लौटा सकता है। 5
10
यहां एक अहम बारीकी है: 33B संख्या Omni-Transformer जनरेशन कोर की है, जरूरी नहीं कि पूरे डिप्लॉयमेंट में लोड होने वाले हर घटक की। पाइपलाइन में H3 एन्कोडर के साथ VisualVAE और AudioVAE भी शामिल हैं। 10
13
MiniMax के अनुसार H3 तीन मॉड्यूलों में बंटा है:
यानी, लोकल H3-Base इंस्टॉलेशन को उन 2K डेमो वाले पूरे H3 उत्पाद के बराबर नहीं समझना चाहिए। पूर्ण सिस्टम 2K तक और 15 सेकंड तक के आउटपुट का समर्थन करता है, लेकिन जारी बेस जनरेटर 768p चरण है। 5
9
H3 की मुख्य डिजाइन पसंद वीडियो और ऑडियो जनरेशन के लिए एक ही स्ट्रीम का उपयोग है। 33B H3-Omni-Transformer एक डेंस Transformer आर्किटेक्चर है। MiniMax के रिपॉजिटरी के मुताबिक, इसके करीब 13B पैरामीटर AdaLN-संबंधित शाखाओं में हैं, जिनके आउटपुट को पहले से गणना कर कैश किया जा सकता है। 10
रिप्रेज़ेंटेशन पाइपलाइन में एन्कोडर, विज़ुअल VAE और ऑडियो VAE शामिल हैं। प्रकाशित तकनीकी विवरणों के अनुसार, विज़ुअल VAE वीडियो को स्थानिक रूप से 16× और समय के आयाम में 4× कंप्रेस करता है; टोकनाइज़ेशन डिजाइन से प्रभावी स्थानिक कमी 32× तक पहुंचती है। यह कंप्रेशन वीडियो जनरेशन को व्यावहारिक बनाने के लिए जरूरी है, लेकिन यह भी दिखाता है कि केवल 33B पैरामीटर संख्या से पूरी पाइपलाइन का आकार या रनटाइम जरूरत नहीं समझी जा सकती। 1
14
पूरा H3 सिस्टम ऐसे प्रॉम्प्ट और रेफरेंस के लिए बनाया गया है जिनमें टेक्स्ट, स्थिर इमेज, वीडियो क्लिप और ऑडियो का मिश्रण हो। यह मूल स्टीरियो ऑडियो के साथ 2K तक रेज़ोल्यूशन और 15 सेकंड तक की क्लिप बना सकता है। 5
10
डेवलपर्स के लिए, H3-Base के ओपन वेट्स लोकल इन्फरेंस, क्वांटाइज़ेशन, अडैप्टर, फाइन-ट्यूनिंग तरीकों और कस्टम क्रिएटिव टूलिंग के प्रयोग का रास्ता खोलते हैं। लेकिन इसमें MiniMax का Context-IR सिस्टम या 2K रीजनरेशन मॉडल शामिल नहीं है। इसलिए जटिल रेफरेंस इस्तेमाल करने वाली टीमों को अपना प्रॉम्प्ट/कॉन्टेक्स्ट तैयारी स्तर बनाना पड़ सकता है। और जिन्हें 2K आउटपुट चाहिए, वे यह नहीं मान सकतीं कि सिर्फ H3-Base से होस्टेड परिणाम दोहराया जा सकेगा। 5
9
प्रकाशित रिपोर्टों में 2K API कीमत 0.8 युआन प्रति सेकंड बताई गई। संबंधित ऑफर में ऑडियो रेफरेंस और शुरुआती पांच इमेज रेफरेंस मुफ्त होने की भी बात कही गई। 14
27 कीमत सेवा, क्षेत्र और समय के अनुसार बदल सकती है, इसलिए इसे स्थायी वैश्विक मूल्य सूची नहीं, बल्कि उस समय की प्रकाशित API दर के रूप में देखना चाहिए।
MiniMax और SGLang से जुड़े प्रचार सामग्री में एक खास तुलना में H3 की लागत को Seedance 2.0 के लगभग एक-तिहाई के रूप में बताया गया। साथ ही, इसे दो RTX 5090 GPU या एक RTX 6000 पर लोकल चलाने का दावा किया गया। 28
31 ये किसी खास सॉफ्टवेयर स्टैक, प्रिसीजन और ऑफलोडिंग कॉन्फ़िगरेशन के लिए डिप्लॉयमेंट दावे हैं—सार्वभौमिक न्यूनतम हार्डवेयर आवश्यकता नहीं। 33B Transformer के अलावा एन्कोडर और VAE घटकों का भी संसाधन भार होता है।
13
सेल्फ-होस्टेड वर्कफ़्लो में प्रोडक्ट इमेजरी, रिलीज़ न हुई फुटेज, वॉइस एसेट और प्रॉम्प्ट को किसी तीसरे पक्ष की जनरेशन API पर भेजने के बजाय संगठन के अंदर रखा जा सकता है। गोपनीय एसेट के साथ काम करने वाली टीमों के लिए यह उपयोगी हो सकता है। फिर भी, एक्सेस कंट्रोल, इनपुट के अधिकारों की समीक्षा, आउटपुट रिव्यू और आंतरिक गवर्नेंस की जरूरत खत्म नहीं होती।
ओपन वेट्स तकनीकी टीमों को जनरेशन को एसेट-मैनेजमेंट लाइब्रेरी, क्रिएटिव-रिव्यू सिस्टम, रेंडरिंग टूल और पोस्ट-प्रोडक्शन वर्कफ़्लो से जोड़ने का विकल्प देते हैं। वे क्वांटाइज़ेशन और कार्य-विशिष्ट अनुकूलन भी आजमा सकती हैं। हालांकि, डिप्लॉयमेंट से पहले लाइसेंस की समीक्षा जरूरी है: थर्ड-पार्टी रिपोर्टिंग के मुताबिक, अमेरिका, यूरोपीय संघ, ब्रिटेन और दक्षिण कोरिया में लोकल उपयोग पर भौगोलिक प्रतिबंध हैं। 4
इसका व्यावहारिक उपयोग उन टीमों में सबसे स्पष्ट है जिन्हें छोटी क्लिप के कई संस्करण बनाने होते हैं—जैसे विज्ञापन क्रिएटिव, ई-कॉमर्स प्रोडक्ट वीडियो, कॉन्सेप्ट वर्क, एनिमैटिक्स और सोशल-कंटेंट प्रयोग। इंटीग्रेटेड ऑडियो वाला 768p लोकल जनरेटर शुरुआती रचनात्मक पुनरावृत्ति की रुकावट कम कर सकता है, खासकर उन टीमों में जिनके पास उपयुक्त GPU क्षमता पहले से मौजूद है।
फिर भी इसे हर वीडियो-प्रोडक्शन जरूरत का तैयार विकल्प नहीं कहना चाहिए। ओपन रिलीज़ में पूरा कॉन्टेक्स्ट और 2K चरण नहीं है; छोटे क्लिप वाला मॉडल भी मानवीय समीक्षा, एडिटिंग और अधिकार प्रबंधन से लाभ पाता है। असली मूल्य सिर्फ डाउनलोड होने में नहीं, बल्कि एक सक्षम ऑडियो-वीडियो जनरेशन स्टेज को नियंत्रित वर्कफ़्लो में जोड़ पाने में है—जहां लाइसेंस और हार्डवेयर इसकी अनुमति दें।
MiniMax ने H3 का एक महत्वपूर्ण हिस्सा खोला है: H3-Base। इसका 33B सिंगल-स्ट्रीम Transformer मल्टीमॉडल इनपुट के आधार पर वीडियो और मूल स्टीरियो ऑडियो को साथ में जनरेट करता है। लेकिन रिलीज़ जानबूझकर पूरे उत्पाद से सीमित है। Context-IR और 2K रीजनरेशन बंद ही रहे, इसलिए H3-Base को पूर्ण ओपन 2K सिस्टम नहीं, बल्कि कस्टमाइज़ किया जा सकने वाला 768p जनरेशन आधार समझना चाहिए। 5
9
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
MiniMax ने 3 अगस्त 2026 को Hugging Face पर H3 Base वेट्स जारी किए—33B डेंस, सिंगल स्ट्रीम मॉडल जो 768p वीडियो और समकालिक स्टीरियो ऑडियो बनाता है।
MiniMax ने 3 अगस्त 2026 को Hugging Face पर H3 Base वेट्स जारी किए—33B डेंस, सिंगल स्ट्रीम मॉडल जो 768p वीडियो और समकालिक स्टीरियो ऑडियो बनाता है। पूरा H3 सिस्टम टेक्स्ट, इमेज, वीडियो और ऑडियो के मिश्रित संदर्भ को समझ सकता है तथा 15 सेकंड तक, 2K तक आउटपुट दे सकता है; लेकिन ओपन रिलीज़ केवल 768p बेस जनरेशन स्टेज की है।
लोकल होस्टिंग और कस्टम पाइपलाइन के अवसर हैं, पर लाइसेंस, GPU संसाधन और बंद रखे गए Context IR व 2K रीजनरेशन घटकों की जांच जरूरी है।