In tegenstelling tot eerdere modellen die video en audio als aparte taken behandelen, interpreteert H3 tekst, afbeeldingen, video en audio samen als één creatieve context. Sommige webinterfaces laten je tot 9 afbeeldingen, 3 videoclips en 3 audiosporen in één generatieverzoek meegeven. Het model leest identiteit, uitvoering, cameabeweging, compositie, geluidslandschap en montageritme uit wat je invoert.
De online generatoren (minimaxh3.org, minimax-h3.app en andere) werken als browsergebaseerde front-ends: ze verzamelen je prompt en geüploade referenties, sturen die naar een gehoste H3-inferentiedienst en tonen het resultaat. De sites runnen het model niet zelf.
Dit is de kernvernieuwing. H3 produceert 'native stereogeluid' – het geluid is onderdeel van de output van het model, niet een later toegevoegd audiospoor. Dat betekent dat dialoog, voetstappen, omgevingsgeluid en muziek worden gegenereerd in relatie tot de visuele actie en getimed zijn op de montage.
MiniMax omschrijft het als 'unified modeling of voice, sound effects, and music', wat erop wijst dat het model foley-geluiden, ruimte-echo en zelfs originele muziek in één generatiepas produceert.
Het model ondersteunt:
Individuele externe interfaces kunnen extra resolutie-, beeldverhouding- of duurinstellingen bieden.
De webinterface levert de gegenereerde video met het stereogeluid in hetzelfde bestand. Functies die door gehoste generatoren worden aangeprezen zijn onder meer instelbare beeldverhoudingen, flexibele duur, het uploaden van referenties en workflows voor tekst-naar-video, afbeelding-animatie en multimodale prompts.
MiniMax-H3), gehoste inferentieplatforms zoals fal.ai, en als open gewichten op Hugging Face voor eigen hosting. 'Native stereogeluid' is een duidelijke capaciteitsclaim, maar de openbare materialen geven niet prijs welke neurale architectuur precies de frame-audiosynchronisatie afdwingt. De bronnen bevestigen het input/output-gedrag en de mogelijkheid, maar ze geven niet genoeg implementatiedetails om precies uit te leggen hoe het model intern die precisie bereikt – of dat nu via een bepaald diffusieschema, audio-codec-tokenization, een gezamenlijk getrainde transformer of een andere aanpak is.
Wat zeker is: het model levert coherente, gesynchroniseerde audio en video in één enkele generatiepas. De techniek die dat mogelijk maakt, blijft voorlopig binnen MiniMax' technische documentatie.