Na rozdíl od starších modelů, které zacházejí s videem a zvukem jako se samostatnými úkoly, H3 interpretuje text, obrázky, video i zvuk společně jako jeden kreativní kontext. Některá rozhraní umožňují v jediném požadavku použít až 9 obrázků, 3 videoklipy a 3 zvukové stopy. Model z nich přečte identitu postav, herecký výkon, pohyb kamery, kompozici, zvukovou kulisu i rytmus střihu a vše přenese do výsledku.
Online generátory (minimaxh3.org, minimax-h3.app a další) fungují jako webová rozhraní: sesbírají váš prompt a nahrané reference, odešlou je na hostovanou službu H3 a zobrazí výsledné médium. Samy model neprovozují.
To je jádro inovace. H3 vytváří „nativní stereo audio“ – zvuk je součástí výstupu modelu, nikoli stopa automaticky připojená dodatečně. To znamená, že dialogy, kroky, okolní ruch i hudba vznikají ve vztahu k obrazové akci a jsou přesně načasované na střih.
MiniMax popisuje tuto schopnost jako „jednotné modelování hlasu, zvukových efektů a hudby“ – model tedy v rámci jediného generování zvládá vytvářet ruchy, atmosféru místnosti i původní hudební doprovod.
Model podporuje:
Jednotlivá rozhraní třetích stran mohou nabízet další možnosti nastavení rozlišení, poměru stran nebo délky.
Webové rozhraní vrátí vygenerované video se stereo zvukem přímo v jednom souboru. Funkce, které generátory nabízejí, zahrnují ovládání poměru stran, flexibilní volbu délky, nahrávání referencí a workflow pro text-to-video, animaci obrázků i multimodální zadávání.
MiniMax-H3), hostovaných inferenčních platforem jako fal.ai a jako otevřené váhy na Hugging Face pro vlastní nasazení. „Nativní stereo audio“ je jasně deklarovaná schopnost, ale veřejně dostupné materiály neuvádějí přesnou neurální architekturu, která zajišťuje synchronizaci zvuku s obrazem. Zdroje potvrzují vstupně-výstupní chování a schopnost, ale neodhalují dostatek detailů o implementaci, aby bylo možné přesně vysvětlit, jak model interně dosahuje této preciznosti – zda prostřednictvím konkrétního difuzního schématu, tokenizace audio kodeku, společně trénovaného transformeru nebo jiného přístupu.
Co je jisté: model vytváří soudržné, synchronizované audio a video v jediném generačním kroku. Inženýrství, které to umožňuje, zůstává – zatím – uvnitř technické dokumentace MiniMax.