أصدرت MiniMax في 3 أغسطس 2026 أوزان H3 Base على Hugging Face، وهي مرحلة التوليد بدقة 768p من منظومة H3. يعتمد النموذج على H3 Omni Transformer كثيف أحادي المسار من 33 مليار معامل، ويولّد الفيديو والصوت الستيريو معاً.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did MiniMax’s August 2026 open-weight release of H3-Base on Hugging Face include—covering H3’s 33B-parameter dense single-stream H3-Omn. Article summary: MiniMax’s August 3, 2026 Hugging Face release made the **H3-Base generation weights** available, not the entire three-stage H3 system. It brought a large multimodal, audio-native video model into local and customizable w. Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
إصدار MiniMax على Hugging Face في أغسطس 2026 هو، في جوهره، إتاحة أوزان H3-Base: مرحلة التوليد في نظام الفيديو H3. وليس إتاحة كل النماذج اللازمة لإعادة إنتاج تجربة MiniMax المستضافة كاملة. وهذا فارق جوهري: فـH3-Base يولّد فيديو وصوتاً متزامنين بدقة 768p، فيما بقيت معالجة السياق ومرحلة إعادة التوليد إلى 2K منفصلة وغير مفتوحة. 1
5
نشرت MiniMax أوزان H3 على Hugging Face في 3 أغسطس 2026، وتركّز الإصدار المتاح على H3-Base، بما يشمل أوزان مهام FL2VA وRef2VA المُبلّغ عنها. 1
13
في قلبه يوجد H3-Omni-Transformer: نموذج Transformer كثيف أحادي المسار يضم 33 مليار معامل. وبدلاً من التعامل مع الصوت كإضافة لاحقة إلى الفيديو، ينفّذ النموذج إزالة الضوضاء للفيديو والصوت معاً ضمن عملية توليد مشتركة. وتستقبل منظومة H3 الأوسع سياقاً موحداً من النصوص والصور والفيديو والصوت، وتستهدف إخراج فيديو بصوت ستيريو مدمج أصلياً. 5
10
لكن رقم 33 مليار معامل يصف قلب التوليد Omni-Transformer، ولا يعني بالضرورة أنه كل ما يجب تحميله لتشغيل المسار الكامل. فخط الأنابيب يضم أيضاً مشفّر H3، وVisualVAE، وAudioVAE. 10
13
تصف MiniMax النظام بوصفه ثلاث مراحل:
بالتالي، لا ينبغي الخلط بين تشغيل H3-Base محلياً وبين منتج H3 الكامل الذي تظهر به العروض بدقة 2K. يدعم النظام الكامل فيديوهات تصل إلى 2K ومدتها حتى 15 ثانية، لكن المولّد الأساسي المتاح هو مرحلة 768p. 5
9
الفكرة المحورية في H3 هي استخدام مسار توليدي واحد للفيديو والصوت. وتوضح مستودعات MiniMax أن نحو 13 ملياراً من معاملات النموذج مرتبطة بفروع AdaLN، وأن مخرجات التعديل فيها قابلة للحساب المسبق والتخزين المؤقت. 10
أما تمثيل المدخلات فيتضمن مشفّراً وVisualVAE وAudioVAE. وتشير الأوصاف التقنية المنشورة إلى أن VisualVAE يضغط الفيديو 16 مرة مكانياً و4 مرات زمنياً، فيما ينتج عن تصميم الترميز خفض مكاني فعّال بمقدار 32 مرة. تساعد هذه الضغوط على جعل توليد الفيديو ممكناً حسابياً، لكنها تبيّن أيضاً أن رقم 33 ملياراً لا يكفي وحده لتقدير حجم خط الأنابيب أو متطلبات تشغيله. 1
14
صُممت منظومة H3 الكاملة للتعامل مع مزيج من النصوص والصور الثابتة ومقاطع الفيديو والصوت كتعليمات أو مراجع. وهي قادرة على توليد مقاطع بصوت ستيريو أصلي، بدقة تصل إلى 2K ولمدة تصل إلى 15 ثانية. 5
10
أما أوزان H3-Base المفتوحة، فتتيح للمطورين اختبار الاستدلال المحلي، والتكميم، والمهايئات، وأساليب الضبط الدقيق، وأدوات إبداعية مخصصة. لكن الإصدار لا يتضمن نظام Context-IR الخاص بـMiniMax ولا نموذج إعادة التوليد إلى 2K. لذلك قد تحتاج الفرق التي تستخدم مراجع وتعليمات معقدة إلى بناء طبقة خاصة بها لإعداد السياق، ولا ينبغي لمن يحتاج إلى 2K أن يفترض أن H3-Base وحده يعيد إنتاج نتيجة الخدمة المستضافة. 5
9
ذكرت تغطيات منشورة سعراً لواجهة API يبلغ 0.8 يوان صيني لكل ثانية لتوليد 2K، مع مجانية إدخال الصوت وأول خمس صور مرجعية ضمن العرض المشار إليه. 14
27 هذه أرقام منشورة في وقت محدد وقد تختلف باختلاف الخدمة والمنطقة، لذا لا ينبغي اعتبارها قائمة أسعار عالمية أو دائمة.
كما وصفت مواد ترويجية من MiniMax وSGLang النموذج بأنه يكلف قرابة ثلث تكلفة Seedance 2.0 في مقارنة محددة، وذكرت إمكان تشغيله محلياً على بطاقتي RTX 5090 أو بطاقة RTX 6000 واحدة. 28
31 وهذه مطالبات تشغيل مرتبطة بإعداد معين للبرمجيات والدقة والتفريغ، وليست حداً أدنى عاماً للعتاد. فعبء العمل يشمل المشفّر ومكوّنات VAE إضافة إلى محوّل 33 مليار معامل.
13
يمكن للاستضافة الذاتية أن تُبقي صور المنتجات واللقطات غير المنشورة والأصول الصوتية والمطالبات داخل المؤسسة، بدلاً من إرسالها إلى واجهة توليد خارجية. وقد يكون ذلك مهماً للفرق التي تعمل على مواد سرية. لكنه لا يلغي الحاجة إلى ضوابط الوصول، ومراجعة حقوق المدخلات، ومراجعة المخرجات، والحوكمة الداخلية.
تمنح الأوزان المفتوحة الفرق التقنية مجالاً لربط التوليد بمكتبات الأصول، وأنظمة المراجعة الإبداعية، وأدوات التصيير، ومراحل ما بعد الإنتاج. كما تتيح دراسة التكميم والتكييف لمهام محددة. لكن ينبغي مراجعة الترخيص قبل الالتزام بالنشر: إذ تصف تقارير من أطراف ثالثة قيوداً جغرافية تشمل الاستخدام المحلي في الولايات المتحدة والاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية. 4
تبدو الفائدة العملية أوضح لدى الفرق التي تنتج عدداً كبيراً من النسخ القصيرة: إعلانات المنتجات، ومقاطع التجارة الإلكترونية، والتصورات الأولية، والـanimatics، وتجارب محتوى المنصات الاجتماعية. فمولّد محلي بدقة 768p مع صوت مدمج يمكن أن يقلل الاحتكاك في التكرار الإبداعي المبكر، خصوصاً لمن يملك بالفعل سعة GPU مناسبة.
لكنه ليس بديلاً جاهزاً لكل متطلبات إنتاج الفيديو. فالإصدار المفتوح يفتقد مرحلتي السياق و2K الكاملتين، كما أن نموذج المقاطع القصيرة يبقى بحاجة إلى مراجعة بشرية ومونتاج وإدارة للحقوق. القيمة الفعلية هنا ليست في قابلية تنزيل H3 وحسب، بل في إمكان دمج مرحلة توليد صوت وفيديو قوية ضمن بيئة عمل مضبوطة، حيث يسمح الترخيص والعتاد بذلك.
فتحت MiniMax جزءاً مهماً من H3: H3-Base، المبني حول Transformer أحادي المسار من 33 مليار معامل يولّد الفيديو وصوت الستيريو الأصلي معاً. لكن الإصدار أضيق عمداً من منتج H3 الكامل؛ إذ بقيت Context-IR وإعادة التوليد إلى 2K مغلقتين. لذلك يمثّل H3-Base أساساً قابلاً للتخصيص لتوليد 768p، لا نظام 2K مفتوحاً كاملاً. 5
9
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أصدرت MiniMax في 3 أغسطس 2026 أوزان H3 Base على Hugging Face، وهي مرحلة التوليد بدقة 768p من منظومة H3.
أصدرت MiniMax في 3 أغسطس 2026 أوزان H3 Base على Hugging Face، وهي مرحلة التوليد بدقة 768p من منظومة H3. يعتمد النموذج على H3 Omni Transformer كثيف أحادي المسار من 33 مليار معامل، ويولّد الفيديو والصوت الستيريو معاً.
لم تُفتح مرحلتا H3 Context IR لمعالجة السياق وH3 Regenerate 2K لإعادة التوليد بدقة 2K؛ لذا لا يساوي H3 Base المنظومة الكاملة.