أطلقت MiniMax أوزان H3 المفتوحة في 3 أغسطس 2026، ويجمع النموذج النص والصور والفيديو والصوت في سياق توليد واحد، مع مقاطع تصل إلى نحو 15 ثانية وصوت استيريو أصلي. يُستخدم FL2VA لتحويل النص إلى فيديو ولتوليد المقاطع انطلاقاً من الإطار الأول أو الأخير، بينما يتيح Ref2VA استخدام مراجع متعددة من الصور والفيديو والصوت.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 هو نموذج مفتوح الأوزان لتوليد الفيديو، أطلقته الشركة في 3 أغسطس 2026. فكرته الأساسية أن يتعامل مع النص والصور والفيديو والصوت داخل السياق نفسه، ثم ينتج الفيديو والصوت الاستيريو معاً بدلاً من الاعتماد على أدوات منفصلة لكل عنصر. 1
2
لا يعني ذلك أن H3 يلغي دور المونتير أو المخرج أو المراجعة البشرية. لكنه يغيّر نقطة التركيز في سير العمل: وقت أقل في جمع الأصول الخام ومزامنة المسارات، ووقت أكبر في وصف النية، وتقديم المراجع، وتوليد نسخ متعددة، ثم اختيار النتيجة الأقوى وتنقيحها.
يدعم H3 إنشاء الفيديو من خلال مطالبة نصية، أو إطارات مفتاحية، أو مراجع متعددة الوسائط. وتذكر وثائق ComfyUI أن النموذج يمكنه إنتاج فيديو بدقة تصل إلى 2K، وبمعدل 24 إطاراً في الثانية، ولمدة تقارب 15 ثانية، مع توليد الحوار والموسيقى والمؤثرات الصوتية كصوت استيريو أصلي في العملية نفسها. 2
وتكمن أهمية دمج الصوت في معالجة مشكلة شائعة في إنتاج الفيديو بالذكاء الاصطناعي: لم تعد الصورة والصوت مضطرين إلى البدء كمهمتين منفصلتين تماماً. فالنموذج يحاول بناء النتيجة السمعية والبصرية بصورة مشتركة، مع بقاء الحاجة إلى المونتاج التقليدي والتنظيف النهائي في الأعمال الاحترافية.
يتضمن الإصدار المفتوح نسختين رئيسيتين من H3-Base، ولكل منهما استخدام عملي مختلف.
صُمم FL2VA لتحويل النص إلى فيديو، وكذلك لتوليد الفيديو انطلاقاً من الإطار الأول أو الأخير أو كليهما. وهو الخيار الأنسب عندما يريد المستخدم البدء بوصف نصي، أو تثبيت نقطة بصرية محددة، أو توجيه انتقال بين إطارين يقدمهما مسبقاً. 1
5
8
أما Ref2VA فهو المسار المعتمد على المراجع. ويمكنه استخدام مجموعات من الصور والفيديو والملفات الصوتية كسياق للتوليد، بحيث تؤثر المراجع في عناصر مثل الهوية البصرية، والحركة، والأسلوب، والصوت ضمن إعداد واحد. 1
2
8
باختصار، يناسب FL2VA سير العمل الذي يقوده النص أو الإطار المفتاحي، بينما يناسب Ref2VA المشاريع التي تحتاج إلى الاستناد إلى عدة أصول موجودة مسبقاً.
قبل ظهور سير العمل متعدد الوسائط، كان إنتاج مقطع قصير قد يتطلب خطوات منفصلة من أجل:
يختصر H3 عدداً من هذه المراحل داخل تفاعل واحد. فقد يقدّم المبدع مطالبة نصية، وإطار بداية أو نهاية، ومرجعاً للحركة، ومرجعاً صوتياً، ثم يطلب مقطعاً سمعياً وبصرياً بدلاً من إدارة كل أصل بمعزل عن الآخر. 2
8
لكن النتيجة ليست بالضرورة فيلماً جاهزاً للنشر. التغيير الأكبر يتمثل في انتقال الجهد الإبداعي من الحصول على كل مكوّن خام إلى تحديد القيود، ومقارنة النسخ، وتحسين المطالبات، ومراجعة المخرجات المختارة. وهذا أثر متوقع من تصميم H3 متعدد الوسائط، وليس ضماناً لثبات الشخصيات أو دقة التوقيت أو جودة صوت مناسبة للبث.
هذه هي النقطة الأهم لمن يفكر في تجربة H3 على حاسوبه.
الإصدار القابل للتنزيل يغطي H3-Base، بما في ذلك FL2VA وRef2VA. وتشير أدلة التثبيت ووثائق النماذج إلى أن نقاط التحقق الأساسية تولّد فيديو بدقة 768p محلياً، بينما مرحلة H3-Regenerate-2K الخاصة بالترقية إلى 2K ليست مفتوحة المصدر، وتظل متاحة عبر خدمة MiniMax المستضافة. 6
9
12
لذلك فعبارتا «H3 يدعم 2K» و«الأوزان المفتوحة تشغّل خط إنتاج 2K الكامل محلياً» ليستا الشيء نفسه. الأولى تصف العرض المستضاف الأوسع، أما الثانية فتتجاوز ما أُتيح في الإصدار المفتوح.
نعم، لكن التشغيل المحلي مشروع تقني يحتاج إلى إعدادات وتنازلات، وليس تثبيتاً مكتبياً بسيطاً.
يمكن للأوزان المضغوطة، واستخدام ذاكرة النظام، وتقنيات تفريغ الطبقات أن تجعل بعض إعدادات H3 ممكنة على بطاقات تبدأ من نحو 12 غيغابايت من ذاكرة الفيديو، وفق تقارير مجتمعية. إلا أن أصغر مجموعة تشغيل موصوفة تبلغ نحو 42.5 غيغابايت من الملفات، ما يعني أن مساحة التخزين وذاكرة RAM مهمتان إلى جانب VRAM. 7
10
وتجدر الإشارة إلى أن بطاقة RTX 5070 Ti تأتي بذاكرة فيديو قدرها 16 غيغابايت، لا 12 غيغابايت. وقد اختُبرت عليها نسخ تجريبية مضغوطة من H3، لكن نجاح التشغيل وسرعته يعتمدان على الإعداد الدقيق، والدقة، وعدد الخطوات، واستراتيجية تفريغ الطبقات، وسير العمل المستخدم. 33
34
39
لهذا ينبغي التعامل مع أرقام السرعة المنشورة بوصفها تجارب مرتبطة بإعدادات محددة، لا معايير عامة لأداء H3. فقد أبلغ اختبار مجتمعي عن نحو 160 ثانية لإنشاء مقطع مدته 5 ثوانٍ بدقة 480p، ونحو 560 ثانية عند 720p على نظام يستخدم RTX 5070 Ti، بينما عرضت تقارير أخرى نتائج مختلفة وأكدت عدم وجود توقيت موثق لهذه البطاقة في إعدادات معينة. 45
34
38
أما من يفضل السرعة على التحكم المحلي، فيمكنه استخدام واجهة API المستضافة، التي تتجنب تنزيل النموذج وتشغيل سير عمل كبير يعتمد على تفريغ الطبقات. كما يدعم ComfyUI سير عمل H3 عبر API المستضافة، لذلك لا يقتصر الاختيار على تشغيل محلي كامل أو استخدام تطبيق إبداعي منفصل. 48
أضاف ComfyUI دعماً أصلياً لـ H3 بالتزامن مع إطلاق الأوزان المفتوحة، مع مسارات لتحويل النص إلى فيديو، والتوليد المشروط بصورة أو إطار، والتوليد المعتمد على المراجع. 1
2
ويجعل هذا الوصول القائم على العقد من السهل ربط H3 بالبرمجيات النصية وأدوات الأتمتة الإبداعية. فمن حيث المبدأ، يمكن لوكيل برمجي إرسال عدد كبير من المطالبات القصيرة باستخدام بذور أو مراجع مختلفة، وترتيب الملفات الناتجة، وإنشاء صفحات معاينة، ثم مساعدة الإنسان في مراجعة المرشحين.
لكن يجب التمييز بين الأمرين: التوليد المتوازي والتقييم الآلي قدرات يضيفها نظام الأتمتة المحيط، وليسا ميزة تجعل H3 يقرر وحده أي مقطع هو الأفضل. وتظل المراجعة البشرية ضرورية لفحص الاستمرارية، والتكوين، وجودة الحوار، وملاءمة النتيجة.
تسرد وثائق MiniMax الرسمية للدفع حسب الاستخدام سعر H3 عند 0.08 دولار لكل ثانية من مخرجات 768p، و0.13 دولار لكل ثانية من مخرجات 2K. كما تسرد الوثائق سعراً قدره 0.05 دولار لكل ثانية لترقية فيديو من 768p إلى 2K عبر إعادة التوليد. 17
وعليه، تبلغ تكلفة مقطع مدته 10 ثوانٍ تقريباً:
أما الادعاء المتكرر بأن مقطع 2K مدته 10 ثوانٍ يبدأ من نحو 0.60 دولار، فلا تدعمه بطاقة الأسعار الرسمية المتاحة هنا. وقد يكون الرقم متعلقاً بعرض ترويجي أو بحساب أرصدة ضمن اشتراك أو بخدمة أخرى، لكنه لا ينبغي تقديمه كسعر API قياسي من MiniMax من دون دليل أقوى.
كذلك فإن MiniMax Design منتج إبداعي مغلق منفصل عن أوزان H3 القابلة للتنزيل. وتصف تقارير من جهات خارجية Design بأنه تطبيق يعتمد على H3 أو على تقنياته، مع نظام أرصدة وعروض خاص به؛ لذلك لا ينبغي اعتباره المنتج نفسه الذي يشغّل H3-Base محلياً. 18
لا تكمن أهمية MiniMax H3 في إلغاء كل مراحل إنتاج الفيديو، بل في توحيد المدخلات التي كانت موزعة سابقاً بين أدوات مختلفة. فالنص يصف المشهد، والصورة تحدد المظهر، والفيديو يوجّه الحركة، والصوت يؤثر في الحوار أو الأجواء، بينما ينتج النموذج مرشحاً سمعياً وبصرياً متزامناً. 2
بالنسبة إلى المبدعين، قد يجعل ذلك تطوير الأفكار القصيرة أكثر تكراراً واعتماداً على المراجع. وبالنسبة إلى المطورين، تمنح الأوزان المفتوحة ودعم ComfyUI أساساً لبناء مسارات مخصصة، والتوليد الدفعي، ومراجعة المخرجات بمساعدة الوكلاء. أما المشترون، فعليهم الموازنة بين قيمة التحكم والتجريب محلياً وبين تكلفة العتاد والإعداد، أو اختيار التوليد المستضاف بدقة 2K مقابل دفع تكلفة الاستخدام.
الخلاصة الأدق: يقلل H3 من تشتت الأدوات في مرحلة التوليد، لكنه لا يلغي الحكم الإنتاجي البشري. كما أن الإصدار المفتوح من الأوزان يمثل جزءاً من منظومة MiniMax المستضافة بدقة 2K، وليس المنظومة الكاملة كلها.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت MiniMax أوزان H3 المفتوحة في 3 أغسطس 2026، ويجمع النموذج النص والصور والفيديو والصوت في سياق توليد واحد، مع مقاطع تصل إلى نحو 15 ثانية وصوت استيريو أصلي.
أطلقت MiniMax أوزان H3 المفتوحة في 3 أغسطس 2026، ويجمع النموذج النص والصور والفيديو والصوت في سياق توليد واحد، مع مقاطع تصل إلى نحو 15 ثانية وصوت استيريو أصلي. يُستخدم FL2VA لتحويل النص إلى فيديو ولتوليد المقاطع انطلاقاً من الإطار الأول أو الأخير، بينما يتيح Ref2VA استخدام مراجع متعددة من الصور والفيديو والصوت.
السعر الرسمي بنظام الدفع حسب الاستخدام هو 0.13 دولاراً لكل ثانية عند دقة 2K و0.08 دولاراً لكل ثانية عند 768p؛ أي 1.30 دولار و0.80 دولار لمقطع مدته 10 ثوانٍ قبل أي تكاليف إضافية.