MiniMax s'est engagé à ouvrir les poids de H3 sous la licence communautaire MiniMax (avec un plafond de revenus de 20 millions de dollars pour un usage commercial), contrant directement la stratégie fermée de ByteDance pour Seedance . H3 repose sur le H3-Omni Transformer de MiniMax — un cadre unique et unifié gérant texte, image, vidéo et audio — tandis que Seedance 2.5 est un modèle basé sur la diffusion, axé sur la cohérence temporelle des séquences longues . Cette différence architecturale se traduit par des gains d'efficacité mesurables, le coût par seconde de H3 étant inférieur au tiers de celui des concurrents traditionnels en résolution 2K .
La plateforme de benchmarking indépendante Artificial Analysis a classé H3 comme suit :
| Catégorie | Classement MiniMax H3 | Leader / Note |
|---|---|---|
| Montage vidéo | #1 mondial | La note la plus élevée sur la plateforme |
| Texte-vers-vidéo | #2 | Derrière Gemini Omni Flash de Google |
| Image-vers-vidéo | #3 | Derrière Seedance 2.0 de ByteDance et Gemini Omni Flash |
Artificial Analysis a placé H3 en première position de son classement de montage vidéo avec audio, avec un score Elo de 1 130 sur 5 043 échantillons de préférences en aveugle . H3 se classe également deuxième en texte-vers-vidéo avec audio, avec un score Elo de 1 242 .
La tarification de l'API de H3 est la plus agressive parmi les principaux modèles vidéo IA :
Coûts comparatifs par minute : H3 à 7,80 $, Seedance 2.0 à 22,45 $ et Kling 3.0 à 20,16 $ . En résolution 2K, le coût par seconde de H3 est inférieur au tiers de celui des concurrents traditionnels ; en 768p, il est inférieur de moitié au prix des concurrents en 720p .
H3 génère des clips vidéo de 4 à 15 secondes en résolution 2K native (2 560 × 1 440 pixels) à 24 images par seconde, avec un audio stéréo produit lors de la même passe d'inférence plutôt que d'être ajouté après . Le modèle accepte en entrée le texte, les images, la vidéo et l'audio dans un contexte unique et unifié . Il prend également en charge le transfert de mouvement vidéo-à-vidéo (V2V), permettant un contrôle narratif précis en transférant les mouvements d'une vidéo à une autre .
MiniMax positionne H3 pour la génération de contenu prêt à l'emploi dans plusieurs secteurs :
H3 est actuellement disponible via l'API sous l'ID de modèle MiniMax-H3 et sur la plateforme grand public Hailuo AI de MiniMax . Les poids du modèle ont été promis pour une sortie dans les jours suivant le lancement .