I modsætning til tidligere modeller, der behandler video og lyd som separate opgaver, fortolker H3 tekst, billeder, video og lyd som én kreativ kontekst. Nogle hostede grænseflader giver dig mulighed for at sende op til 9 billeder, 3 videoklip og 3 lydspor i én enkelt generationsforespørgsel. Modellen læser identitet, præstation, kamerabevægelse, komposition, lydlandskab og redigeringsrytme ud fra det, du giver den.
Onlinegeneratorerne (minimaxh3.org, minimax-h3.app og andre) fungerer som browserbaserede frontends: De indsamler din prompt og uploadede referencer, sender dem til en hostet H3-inferenstjeneste og præsenterer det resulterende medie. Siderne driver ikke selv modellen.
Dette er den centrale nyskabelse. H3 producerer