أطلقت MiniMax نموذج H3 لتوليد الفيديو متعدد الوسائط في 31 يوليو 2026، متحدية مباشرة نموذج ByteDance Seedance 2.5 بأوزان مفتوحة وتسعير أقل بشكل كبير وهندسة موحدة متعددة الوسائط. يحتل H3 المركز الأول عالمياً في تحرير الفيديو على منصة Artificial Analysis، والثاني في النص إلى فيديو، والثالث في الصورة إلى فيديو.

Create a landscape editorial hero image for this Studio Global article: How did Chinese AI firm MiniMax's launch of the H3 multimodal video generation model challenge ByteDance, and what were its benchmark rankin. Article summary: MiniMax launched its H3 multimodal video generation model on July 31, 2026, directly challenging ByteDance on the same day ByteDance released its Seedance 2.0/2.5 models. The challenge was multifaceted: H3 shipped with o. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
في 31 يوليو 2026، أطلقت شركة الذكاء الاصطناعي الصينية MiniMax نموذجها H3 متعدد الوسائط لتوليد الفيديو في نفس اليوم الذي أطلقت فيه ByteDance نموذجي Seedance 2.0/2.5. وُصف هذا الإطلاق المزدوج على نطاق واسع بأنه "مواجهة" ، وقد شكلت استراتيجية H3 المتمثلة في الأوزان المفتوحة والتسعير المنخفض تحدياً مباشراً للنماذج مغلقة المصدر في أسرع قطاعات الذكاء الاصطناعي التوليدي نمواً
.
التزمت MiniMax بفتح مصدر H3 بموجب ترخيص مجتمع MiniMax (بحد أقصى للإيرادات التجارية يبلغ 20 مليون دولار أمريكي)، مما قوض بشكل مباشر استراتيجية ByteDance المغلقة لـ Seedance . تم بناء H3 على أساس H3-Omni Transformer من MiniMax وهو إطار عمل موحد يعالج النصوص والصور والفيديو والصوت، بينما يعتمد Seedance 2.5 على نموذج انتشاري يركز على التماسك الزمني الطويل
. ينتج عن هذا الاختلاف المعماري مكاسب في الكفاءة، حيث أن تكلفة H3 في الثانية الواحدة بدقة 2K تقل عن ثلث تكلفة النماذج المنافسة
.
صنفت منصة المقارنة المعيارية المستقلة Artificial Analysis نموذج H3 على النحو التالي :
| الفئة | ترتيب MiniMax H3 | الرائد / ملاحظة |
|---|---|---|
| تحرير الفيديو | المركز الأول عالمياً | الأعلى تقييماً على المنصة |
| نص إلى فيديو | الثاني | خلف Google Gemini Omni Flash |
| صورة إلى فيديو | الثالث | خلف ByteDance Seedance 2.0 و Gemini Omni Flash |
وضعت Artificial Analysis نموذج H3 في المركز الأول في لوحة تحرير الفيديو مع الصوت، حاصداً درجة Elo بلغت 1,130 من 5,043 عينة تفضيل أعمى . كما يحتل H3 المركز الثاني في فئة النص إلى فيديو مع الصوت، بدرجة Elo بلغت 1,242
.
يعتبر تسعير واجهة برمجة التطبيقات (API) لنموذج H3 الأكثر عدوانية بين نماذج فيديو الذكاء الاصطناعي الرائدة :
تكلفة الدقيقة المقارنة: H3 بـ 7.80 دولار، Seedance 2.0 بـ 22.45 دولار، و Kling 3.0 بـ 20.16 دولار . بدقة 2K، تقل تكلفة H3 في الثانية عن ثلث النماذج المنافسة؛ وبدقة 768p، تقل عن نصف تكلفة تسعير دقة 720p للمنافسين
.
يولد H3 مقاطع فيديو تتراوح مدتها بين 4-15 ثانية بدقة 2K أصلية (2,560×1,440 بكسل) وبمعدل 24 إطاراً في الثانية، مع صوت ستيريو يُنتج في نفس مرحلة الاستدلال وليس إضافته لاحقاً . يدعم النموذج النصوص والصور والفيديو والصوت كإدخالات في سياق موحد واحد
. كما يدعم تقنية نقل الحركة من فيديو إلى آخر (V2V Motion Transfer)، مما يسمح بالتحكم الدقيق في السرد القصصي
.
تضع MiniMax نموذج H3 لتوليد محتوى جاهز للإنتاج عبر العديد من الصناعات :
يتوفر H3 حالياً عبر واجهة API تحت معرف النموذج MiniMax-H3 وعلى منصة Hailuo AI الخاصة بـ MiniMax الموجهة للمستهلكين . ووعدت الشركة بإصدار أوزان النموذج في غضون أيام من الإطلاق
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
أطلقت MiniMax نموذج H3 لتوليد الفيديو متعدد الوسائط في 31 يوليو 2026، متحدية مباشرة نموذج ByteDance Seedance 2.5 بأوزان مفتوحة وتسعير أقل بشكل كبير وهندسة موحدة متعددة الوسائط.
أطلقت MiniMax نموذج H3 لتوليد الفيديو متعدد الوسائط في 31 يوليو 2026، متحدية مباشرة نموذج ByteDance Seedance 2.5 بأوزان مفتوحة وتسعير أقل بشكل كبير وهندسة موحدة متعددة الوسائط. يحتل H3 المركز الأول عالمياً في تحرير الفيديو على منصة Artificial Analysis، والثاني في النص إلى فيديو، والثالث في الصورة إلى فيديو.
تضع MiniMax النموذج لتوليد محتوى جاهز للإنتاج في الإعلانات والتجارة الإلكترونية والأفلام وتصميم واجهات المستخدم والألعاب، بمقاطع تتراوح بين 4 15 ثانية بدقة 2K (2,560×1,440) وبـ 24 إطاراً في الثانية مع صوت ستيريو أصلي.