Publié avec des poids ouverts le 3 août 2026, MiniMax H3 réunit texte, images, vidéo et audio dans un même contexte et peut produire des clips d’environ 15 secondes avec une bande son stéréo native. FL2VA sert à la génération depuis un prompt et au conditionnement par première ou dernière image ; Ref2VA exploite des...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 est un modèle de génération vidéo open weight et multimodal, publié le 3 août 2026. Son principe est de placer le texte, les images, la vidéo et l’audio dans un même contexte, puis de générer simultanément l’image animée et une bande-son stéréo native. 1
2
Cela ne transforme pas H3 en logiciel de montage ou en réalisateur autonome. En revanche, le modèle déplace une partie du travail : au lieu de réunir chaque élément dans des outils séparés, le créateur peut davantage se concentrer sur l’intention, les références, les variantes et la sélection du meilleur résultat.
H3 prend en charge la création vidéo à partir d’un prompt, d’images-clés et de références multimodales. La documentation de ComfyUI indique une sortie pouvant atteindre la 2K, 24 images par seconde et environ 15 secondes, avec voix, musique et effets sonores générés comme un audio stéréo natif lors de la même passe. 2
Cette intégration audio s’attaque à un problème bien connu de la production générative : l’image et le son ne doivent plus nécessairement être conçus comme deux projets sans lien. H3 modélise le résultat audiovisuel de façon conjointe, même si un montage classique et des retouches restent indispensables pour un usage professionnel.
La version open weight comprend deux variantes principales de H3-Base.
FL2VA est conçu pour la génération texte-vers-vidéo ainsi que pour le conditionnement par première image, dernière image, ou les deux. C’est le choix le plus direct lorsqu’il faut partir d’un prompt, fixer un point de départ ou d’arrivée, ou guider une transition entre des images fournies. 1
5
8
Ref2VA adopte une approche davantage fondée sur les références. Il peut utiliser des combinaisons d’images, de vidéos et de fichiers audio afin d’influencer l’apparence, le mouvement, l’identité, le style ou encore la voix dans une même génération. 1
2
8
La différence est donc surtout pratique : FL2VA convient aux workflows pilotés par un prompt ou des images-clés, tandis que Ref2VA s’adresse aux projets où plusieurs médias existants doivent guider le résultat.
Avant l’arrivée de modèles réellement multimodaux, produire une courte séquence pouvait impliquer plusieurs étapes distinctes :
H3 regroupe plusieurs de ces opérations dans une seule interaction. Le créateur peut fournir un prompt, une image de départ ou d’arrivée, une référence de mouvement et une référence audio, puis demander une proposition audiovisuelle au lieu de gérer chaque ressource séparément. 2
8
La vidéo obtenue n’est pas pour autant un film terminé. Le changement principal concerne la répartition de l’effort : moins de temps passé à réunir chaque élément brut, davantage consacré à la définition des contraintes, à la génération de variantes, à l’affinage des prompts et au montage des sorties retenues. C’est une conséquence du design multimodal de H3, pas une garantie de personnages cohérents, de timing parfait ou de son prêt pour la diffusion.
C’est la nuance la plus importante pour évaluer H3.
Le téléchargement concerne H3-Base, avec les variantes FL2VA et Ref2VA. Les guides locaux et la documentation des modèles indiquent que les checkpoints Base génèrent en 768p, tandis que l’étape H3-Regenerate-2K n’est pas open source et reste accessible via le service hébergé de MiniMax. 6
9
12
Autrement dit, « H3 prend en charge la 2K » et « les poids ouverts permettent d’exécuter localement toute la chaîne 2K » sont deux affirmations différentes. La première décrit l’offre hébergée dans son ensemble ; la seconde exagère ce qui a effectivement été publié.
Oui, mais il s’agit davantage d’un projet d’installation et d’optimisation que d’une application à lancer en quelques clics.
La quantification, l’utilisation de la mémoire vive et le déchargement de couches peuvent rendre certains workflows accessibles à des cartes graphiques disposant d’environ 12 Go de VRAM, selon des retours de la communauté. La configuration fonctionnelle la plus légère est toutefois décrite comme représentant environ 42,5 Go de fichiers : l’espace disque et la mémoire système comptent donc autant que la VRAM. 7
10
À noter : une RTX 5070 Ti dispose de 16 Go de VRAM, et non de 12 Go. Des quantifications expérimentales de H3 ont été testées sur cette carte, mais les résultats dépendent fortement de la configuration, de la résolution, du nombre d’itérations, du déchargement et du workflow utilisé. 33
34
39
Les temps de génération publiés doivent donc être lus comme des retours liés à une configuration précise, et non comme des benchmarks universels. Un test communautaire fait état d’environ 160 secondes pour un clip de cinq secondes en 480p et d’environ 560 secondes en 720p sur un système équipé d’une RTX 5070 Ti ; d’autres retours donnent des résultats différents et soulignent l’absence de mesure vérifiée pour cette carte. 45
34
38
Pour les créateurs qui privilégient la rapidité au contrôle local, une API hébergée évite de télécharger le modèle et de gérer un workflow fortement dépendant du déchargement. ComfyUI prend également en charge des workflows H3 via API : le choix ne se limite donc pas à une installation locale ou à l’abandon de l’environnement créatif. 48
ComfyUI a intégré la prise en charge native de H3 lors de la publication des poids ouverts, avec des workflows pour le texte-vers-vidéo, le conditionnement par image ou image-clé et la génération à partir de références. 1
2
Cette approche par nœuds facilite aussi les connexions avec des scripts et des outils d’automatisation créative. En théorie, un agent de programmation pourrait envoyer de nombreux prompts courts avec des graines ou des références différentes, organiser les fichiers produits, créer des planches de contact et aider un humain à comparer les candidats. Les poids ouverts rendent ce type d’orchestration locale et scriptable plus accessible.
Il faut toutefois distinguer les rôles : la génération en parallèle et l’évaluation seraient des capacités du système d’automatisation qui entoure H3, pas une fonction du modèle capable de décider seul quelle vidéo est la meilleure. Une vérification humaine reste nécessaire pour la continuité, la composition, la qualité des dialogues et la pertinence du résultat.
La documentation officielle « Pay as You Go » de MiniMax indique un tarif de 0,08 $ par seconde en 768p et de 0,13 $ par seconde en 2K. La régénération d’une vidéo 768p vers la 2K est facturée 0,05 $ par seconde. 17
Pour un clip de 10 secondes, cela représente :
L’affirmation souvent reprise selon laquelle un clip 2K standard de 10 secondes commencerait à environ 0,60 $ n’est pas étayée par la grille tarifaire officielle fournie ici. Elle peut correspondre à une promotion, à un calcul fondé sur des crédits d’abonnement ou à un autre service, mais ne doit pas être présentée comme le prix API standard de MiniMax sans preuve supplémentaire.
MiniMax Design est par ailleurs distinct des poids H3 téléchargeables. Des sources tierces le décrivent comme un produit créatif fermé construit sur H3 ou autour de H3, avec son propre système de crédits et ses propres offres. Il ne faut donc pas le confondre avec l’exécution locale de H3-Base. 18
L’intérêt de MiniMax H3 ne tient pas à la disparition de toutes les étapes de production vidéo, mais à l’unification d’entrées auparavant dispersées entre plusieurs outils. Le texte peut décrire la scène, les images fixer l’apparence, la vidéo guider le mouvement et l’audio influencer la voix ou l’ambiance, tandis que le modèle produit une proposition audiovisuelle synchronisée. 2
Pour les créateurs, cette approche peut rendre l’idéation de formats courts plus itérative et plus dépendante des références. Pour les développeurs, les poids ouverts et l’intégration à ComfyUI constituent une base pour des pipelines personnalisés, la génération par lots et l’évaluation assistée par agent. Pour les acheteurs, la question concrète est de savoir si le contrôle local et l’expérimentation justifient le matériel et la configuration nécessaires, ou si la génération 2K hébergée offre un meilleur compromis.
Le résumé le plus juste est aussi le plus simple : H3 réduit la fragmentation au stade de la génération, mais ne supprime ni le jugement créatif ni la postproduction ; et sa version open weight ne représente qu’une partie du système 2K hébergé complet.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Publié avec des poids ouverts le 3 août 2026, MiniMax H3 réunit texte, images, vidéo et audio dans un même contexte et peut produire des clips d’environ 15 secondes avec une bande son stéréo native.
Publié avec des poids ouverts le 3 août 2026, MiniMax H3 réunit texte, images, vidéo et audio dans un même contexte et peut produire des clips d’environ 15 secondes avec une bande son stéréo native. FL2VA sert à la génération depuis un prompt et au conditionnement par première ou dernière image ; Ref2VA exploite des références combinant images, vidéos et audio.
Le tarif officiel à l’usage est de 0,13 $ par seconde en 2K et de 0,08 $ en 768p : un clip de 10 secondes coûte donc respectivement 1,30 $ ou 0,80 $, hors éventuels suppléments.