Contrairement aux modèles précédents qui traitent la vidéo et l'audio comme des tâches séparées, H3 interprète conjointement le texte, les images, la vidéo et l'audio comme un seul contexte créatif. Certaines interfaces hébergées permettent de passer jusqu'à 9 images, 3 clips vidéo et 3 pistes audio en une seule requête de génération. Le modèle lit l'identité, la performance, le mouvement de la caméra, la composition, le paysage sonore et le rythme de montage à partir de ce que vous lui donnez.
Les générateurs en ligne (minimaxh3.org, minimax-h3.app, et autres) agissent comme des interfaces web : ils collectent votre prompt et vos références importées, les envoient à un service d'inférence H3 hébergé, et présentent le média résultant. Ces sites n'exploitent pas le modèle eux-mêmes.
C'est l'innovation centrale. H3 produit un « son stéréo natif » — le son fait partie de la sortie de génération du modèle, et non une piste audio ajoutée automatiquement après coup. Cela signifie que les dialogues, les bruits de pas, l'ambiance environnementale et la musique sont générés en relation avec l'action visuelle et calés sur le plan.
MiniMax le décrit comme une « modélisation unifiée de la voix, des effets sonores et de la musique », ce qui implique que le modèle gère le bruitage, l'ambiance de la pièce, et même la partition originale en un seul passage de génération.
Le modèle prend en charge :
Certaines interfaces tierces peuvent exposer des contrôles supplémentaires de résolution, de rapport d'aspect ou de durée.
L'interface web renvoie la vidéo générée avec l'audio stéréo intégré dans le même fichier. Les fonctionnalités annoncées par les générateurs hébergés incluent les contrôles de rapport d'aspect, la sélection flexible de la durée, les importations de référence, et les flux de travail pour le texte vers vidéo, l'animation d'image et le prompting multimodal.
MiniMax-H3), des plateformes d'inférence hébergées comme fal.ai, et en poids ouverts sur Hugging Face pour un déploiement auto-hébergé. Le « son stéréo natif » est une affirmation de capacité claire, mais les documents publics ne divulguent pas l'architecture neuronale exacte qui garantit la synchronisation image-audio. Les sources confirment le comportement d'entrée/sortie et la capacité, mais elles ne révèlent pas suffisamment de détails d'implémentation pour expliquer précisément comment le modèle atteint cette précision en interne — que ce soit via un calendrier de diffusion particulier, une tokenisation par codec audio, un transformateur entraîné conjointement, ou une autre approche.
Ce qui est certain : le modèle produit un audio et une vidéo cohérents et synchronisés en un seul passage de génération. L'ingénierie qui rend cela possible reste — pour l'instant — dans la documentation technique de MiniMax.