Im Gegensatz zu früheren Modellen, die Video und Audio als separate Aufgaben behandeln, interpretiert H3 Text, Bilder, Video und Audio als einen einzigen kreativen Kontext. Einige gehostete Oberflächen erlauben es, bis zu 9 Bilder, 3 Videoclips und 3 Audiospuren in einer einzigen Generierungsanfrage zu übergeben. Das Modell liest Identität, Performance, Kamerabewegung, Komposition, Soundscape und Schnittrhythmus aus den übergebenen Referenzen.
Die Online-Generatoren (minimaxh3.org, minimax-h3.app und andere) fungieren als browserbasierte Frontends: Sie sammeln Ihren Prompt und Ihre hochgeladenen Referenzen, senden sie an einen gehosteten H3-Inferenzdienst und präsentieren die resultierenden Medien. Die Seiten betreiben das Modell nicht selbst.
Dies ist die Kerninnovation. H3 erzeugt „nativen Stereo-Ton“ – der Ton ist Teil der Ausgabe des Modells, nicht eine automatisch nachträglich hinzugefügte Audiospur. Das bedeutet, dass Dialoge, Schritte, Umgebungsgeräusche und Musik in Bezug auf die visuelle Aktion generiert und auf den Schnitt abgestimmt sind.
MiniMax beschreibt es als „einheitliche Modellierung von Stimme, Soundeffekten und Musik“, was impliziert, dass das Modell Foley, Raumklang und sogar Originalmusik in einem einzigen Generierungsdurchgang bewältigt.
Das Modell unterstützt:
Einzelne Drittanbieter-Oberflächen können zusätzliche Steuerelemente für Auflösung, Seitenverhältnis oder Dauer bereitstellen.
Die Weboberfläche gibt das generierte Video mit dem in dieselbe Datei eingebetteten Stereo-Ton zurück. Von gehosteten Generatoren beworbene Funktionen umfassen Steuerelemente für Seitenverhältnis, flexible Dauerauswahl, Referenz-Uploads und Workflows für Text-zu-Video, Bildanimation und multimodale Prompting.
MiniMax-H3), gehostete Inferenzplattformen wie fal.ai und als offene Gewichte auf Hugging Face für den selbst gehosteten Einsatz verfügbar. „Nativer Stereo-Ton“ ist eine klare Fähigkeitsaussage, aber die öffentlichen Materialien legen die genaue neuronale Architektur, die die Bild-Ton-Synchronisation erzwingt, nicht offen. Die Quellen bestätigen das Ein-/Ausgabeverhalten und die Fähigkeit, aber sie geben nicht genug Implementierungsdetails preis, um genau zu erklären, wie das Modell intern diese Präzision erreicht – sei es durch einen bestimmten Diffusionsplan, Audio-Codec-Tokenisierung, einen gemeinsam trainierten Transformer oder einen anderen Ansatz.
Was sicher ist: Das Modell gibt in einem einzigen Generierungsdurchgang kohärentes, synchronisiertes Audio und Video aus. Die Technik, die das ermöglicht, bleibt – vorerst – in der technischen Dokumentation von MiniMax.