В отличие от более ранних моделей, которые обрабатывают видео и аудио по отдельности, H3 совместно интерпретирует текст, изображения, видео и аудио как единый творческий контекст. Некоторые веб-интерфейсы позволяют передать до 9 изображений, 3 видео и 3 аудиодорожки в одном запросе. Модель считывает внешность, движение, камеру, композицию, звуковую картину и ритм монтажа из всего, что вы ей даете.
Онлайн-генераторы (minimaxh3.org, minimax-h3.app и другие) работают как браузерные оболочки: они собирают ваш запрос и загруженные референсы, отправляют их на серверный сервис H3 и показывают готовый результат. Сами сайты не управляют моделью.
Это ключевая инновация. H3 создает "родное стереоаудио" — звук является частью выходных данных модели, а не аудиодорожкой, автоматически прикрепленной позднее. Это означает, что диалоги, шаги, фоновые шумы и музыка генерируются относительно визуального действия и синхронизируются с монтажом.
MiniMax описывает это как "унифицированное моделирование голоса, звуковых эффектов и музыки", подразумевая, что модель обрабатывает шумы, атмосферу и даже оригинальную музыку за один проход генерации.
Модель поддерживает:
Отдельные сторонние интерфейсы могут предлагать дополнительные настройки разрешения, соотношения сторон или длительности.
Веб-интерфейс возвращает готовое видео со встроенным стереозвуком в одном файле. Заявленные функции хостинговых генераторов включают контроль соотношения сторон, гибкий выбор длительности, загрузку референсов и рабочие процессы для текста в видео, анимации изображений и мультимодальных запросов.
MiniMax-H3), хостинговые платформы вывода вроде fal.ai и как открытые веса на Hugging Face для самостоятельного развертывания. "Родное стереоаудио" — четкое заявление о возможности, но публичные материалы не раскрывают точную нейросетевую архитектуру, которая обеспечивает синхронизацию кадра и звука. Источники подтверждают поведение на входе/выходе и возможности, но не дают достаточно деталей реализации, чтобы объяснить, как именно модель внутренне достигает такой точности — будь то особый диффузионный сэмплер, токенизация аудиокодека, совместно обученный трансформер или какой-то другой подход.
Что точно: модель выдает согласованные аудио и видео за один проход генерации. Инженерное решение, которое делает это возможным, пока остается внутри технической документации MiniMax.