На відміну від попередніх моделей, які розглядають відео та аудіо як окремі завдання, H3 спільно інтерпретує текст, зображення, відео та аудіо як єдиний творчий контекст. Деякі хостингові інтерфейси дозволяють передавати до 9 зображень, 3 відеокліпи та 3 аудіодоріжки в одному запиті на генерацію. Модель зчитує ідентичність, гру, рух камери, композицію, звуковий ландшафт і ритм монтажу з усього, що ви їй надаєте.
Онлайн-генератори (minimaxh3.org, minimax-h3.app та інші) працюють як браузерні інтерфейси: вони збирають ваш запит і завантажені референси, надсилають їх до хостингового сервісу інференсу H3 і показують отриманий медіафайл. Самі сайти не запускають модель на своїх серверах.
Це ключова інновація. H3 створює «рідне стереоаудіо» — звук є частиною вихідного результату моделі, а не аудіодоріжкою, яка автоматично додається після. Це означає, що діалоги, кроки, навколишнє середовище та музика генеруються у зв'язку з візуальною дією та синхронізуються з монтажним кадром.
MiniMax описує це як «уніфіковане моделювання голосу, звукових ефектів та музики», що передбачає, що модель обробляє фолі, кімнатний тон і навіть оригінальну музику в рамках одного проходу генерації.
Модель підтримує:
Окремі сторонні інтерфейси можуть пропонувати додаткові налаштування роздільної здатності, співвідношення сторін або тривалості.
Веб-інтерфейс повертає згенероване відео зі стереоаудіо, вбудованим у той самий файл. Функції, які рекламуються хостинговими генераторами, включають контроль співвідношення сторін, гнучкий вибір тривалості, завантаження референсів та робочі процеси для текст-у-відео, анімації зображень та мультимодальних запитів.
MiniMax-H3), хостингові платформи інференсу, такі як fal.ai, а також у вигляді відкритих ваг на Hugging Face для самостійного розгортання. «Рідне стереоаудіо» — це чітка заява про можливості, але публічні матеріали не розкривають точної нейромережевої архітектури, яка забезпечує синхронізацію кадру та звуку. Джерела підтверджують вхідну/вихідну поведінку та можливості, але вони не надають достатньо деталей реалізації, щоб точно пояснити, як модель внутрішньо досягає такої точності — чи то через певний дифузійний розклад, токенізацію аудіокодеком, спільно навчений трансформер, чи якийсь інший підхід.
Що точно відомо: модель видає узгоджене, синхронізоване аудіо та відео за один прохід генерації. Інженерне рішення, яке робить це можливим, поки що залишається всередині технічної документації MiniMax.