التزمت MiniMax بفتح مصدر H3 بموجب ترخيص مجتمع MiniMax (بحد أقصى للإيرادات التجارية يبلغ 20 مليون دولار أمريكي)، مما قوض بشكل مباشر استراتيجية ByteDance المغلقة لـ Seedance . تم بناء H3 على أساس H3-Omni Transformer من MiniMax وهو إطار عمل موحد يعالج النصوص والصور والفيديو والصوت، بينما يعتمد Seedance 2.5 على نموذج انتشاري يركز على التماسك الزمني الطويل . ينتج عن هذا الاختلاف المعماري مكاسب في الكفاءة، حيث أن تكلفة H3 في الثانية الواحدة بدقة 2K تقل عن ثلث تكلفة النماذج المنافسة .
صنفت منصة المقارنة المعيارية المستقلة Artificial Analysis نموذج H3 على النحو التالي :
| الفئة | ترتيب MiniMax H3 | الرائد / ملاحظة |
|---|---|---|
| تحرير الفيديو | المركز الأول عالمياً | الأعلى تقييماً على المنصة |
| نص إلى فيديو | الثاني | خلف Google Gemini Omni Flash |
| صورة إلى فيديو | الثالث | خلف ByteDance Seedance 2.0 و Gemini Omni Flash |
وضعت Artificial Analysis نموذج H3 في المركز الأول في لوحة تحرير الفيديو مع الصوت، حاصداً درجة Elo بلغت 1,130 من 5,043 عينة تفضيل أعمى . كما يحتل H3 المركز الثاني في فئة النص إلى فيديو مع الصوت، بدرجة Elo بلغت 1,242 .
يعتبر تسعير واجهة برمجة التطبيقات (API) لنموذج H3 الأكثر عدوانية بين نماذج فيديو الذكاء الاصطناعي الرائدة :
تكلفة الدقيقة المقارنة: H3 بـ 7.80 دولار، Seedance 2.0 بـ 22.45 دولار، و Kling 3.0 بـ 20.16 دولار . بدقة 2K، تقل تكلفة H3 في الثانية عن ثلث النماذج المنافسة؛ وبدقة 768p، تقل عن نصف تكلفة تسعير دقة 720p للمنافسين .
يولد H3 مقاطع فيديو تتراوح مدتها بين 4-15 ثانية بدقة 2K أصلية (2,560×1,440 بكسل) وبمعدل 24 إطاراً في الثانية، مع صوت ستيريو يُنتج في نفس مرحلة الاستدلال وليس إضافته لاحقاً . يدعم النموذج النصوص والصور والفيديو والصوت كإدخالات في سياق موحد واحد . كما يدعم تقنية نقل الحركة من فيديو إلى آخر (V2V Motion Transfer)، مما يسمح بالتحكم الدقيق في السرد القصصي .
تضع MiniMax نموذج H3 لتوليد محتوى جاهز للإنتاج عبر العديد من الصناعات :
يتوفر H3 حالياً عبر واجهة API تحت معرف النموذج MiniMax-H3 وعلى منصة Hailuo AI الخاصة بـ MiniMax الموجهة للمستهلكين . ووعدت الشركة بإصدار أوزان النموذج في غضون أيام من الإطلاق .