W przeciwieństwie do wcześniejszych modeli, które traktują wideo i audio jako osobne zadania, H3 wspólnie interpretuje tekst, obrazy, wideo i audio jako jeden kreatywny kontekst. Niektóre hostowane interfejsy umożliwiają przesłanie do 9 obrazów, 3 klipów wideo i 3 ścieżek audio w jednym żądaniu generowania. Model odczytuje tożsamość, sposób odtwarzania, ruch kamery, kompozycję, pejzaż dźwiękowy i rytm montażu z tego, co mu przekażesz.
Generatory online (minimaxh3.org, minimax-h3.app i inne) działają jako front-endy w przeglądarce: zbierają Twój prompt i przesłane referencje, wysyłają je do hostowanego serwisu wnioskowania H3 i prezentują powstałe multimedia. Strony te same nie obsługują modelu.
To jest kluczowa innowacja. H3 wytwarza „natywny dźwięk stereo” – dźwięk jest częścią wyników generowania modelu, a nie ścieżką audio automatycznie dołączoną później. Oznacza to, że dialogi, odgłosy kroków, dźwięki otoczenia i muzyka są generowane w relacji do akcji wizualnej i zsynchronizowane z cięciem.
MiniMax opisuje to jako „zunifikowane modelowanie głosu, efektów dźwiękowych i muzyki”, co sugeruje, że model obsługuje foley, dźwięk pomieszczenia, a nawet oryginalną muzykę w jednym przebiegu generowania.
Model obsługuje:
Poszczególne interfejsy stron trzecich mogą oferować dodatkowe opcje rozdzielczości, proporcji obrazu lub czasu trwania.
Interfejs internetowy zwraca wygenerowane wideo z dźwiękiem stereo osadzonym w tym samym pliku. Funkcje reklamowane przez hostowane generatory obejmują kontrolę proporcji obrazu, elastyczny wybór czasu trwania, przesyłanie referencji i przepływy pracy dla tekstu na wideo, animacji obrazu i multimodalnych podpowiedzi.
MiniMax-H3), hostowane platformy wnioskowania, takie jak fal.ai, oraz jako otwarte wagi na Hugging Face do wdrożenia na własnym sprzęcie. „Natywny dźwięk stereo” to wyraźne roszczenie dotyczące możliwości, ale publiczne materiały nie ujawniają dokładnej architektury sieci neuronowej, która egzekwuje synchronizację klatka-dźwięk. Źródła potwierdzają zachowanie wejścia/wyjścia i możliwości, ale nie ujawniają wystarczająco dużo szczegółów implementacji, aby dokładnie wyjaśnić, w jaki sposób model wewnętrznie osiąga tę precyzję – czy to przez konkretny harmonogram dyfuzji, tokenizację kodeka audio, wspólnie trenowany transformer, czy jakieś inne podejście.
To, co jest pewne: model generuje spójne, zsynchronizowane audio i wideo w jednym przebiegu generowania. Inżynieria, która to umożliwia, pozostaje – na razie – wewnątrz dokumentacji technicznej MiniMax.