A diferencia de modelos anteriores que tratan el video y el audio como tareas separadas, H3 interpreta conjuntamente texto, imágenes, video y audio como un único contexto creativo. Algunas interfaces alojadas permiten pasar hasta 9 imágenes, 3 clips de video y 3 pistas de audio en una sola solicitud de generación. El modelo lee la identidad, la interpretación, el movimiento de cámara, la composición, el paisaje sonoro y el ritmo de edición a partir de lo que le proporciones.
Los generadores en línea (minimaxh3.org, minimax-h3.app y otros) actúan como interfaces web: recogen tu prompt y las referencias subidas, las envían a un servicio de inferencia H3 alojado y presentan el resultado. Estos sitios no operan el modelo por sí mismos.
Esta es la innovación central. H3 produce "audio estéreo nativo": el sonido es parte de la salida de generación del modelo, no una pista de audio añadida automáticamente después. Esto significa que los diálogos, pasos, ambiente y música se generan en relación con la acción visual y se sincronizan con el corte.
MiniMax lo describe como "modelado unificado de voz, efectos de sonido y música", lo que implica que el modelo maneja foley, tono de sala e incluso banda sonora original en una sola pasada de generación.
El modelo admite:
Las interfaces de terceros pueden exponer controles adicionales de resolución, relación de aspecto o duración.
La interfaz web devuelve el video generado con el audio estéreo incrustado en el mismo archivo. Las funciones anunciadas por los generadores alojados incluyen controles de relación de aspecto, selección flexible de duración, subida de referencias y flujos de trabajo para texto a video, animación de imágenes y prompting multimodal.
MiniMax-H3), plataformas de inferencia alojadas como fal.ai, y como pesos abiertos en Hugging Face para implementación autogestionada. "Audio estéreo nativo" es una declaración de capacidad clara, pero los materiales públicos no revelan la arquitectura neuronal exacta que garantiza la sincronización fotograma-audio. Las fuentes confirman el comportamiento de entrada/salida y la capacidad, pero no revelan suficientes detalles de implementación para explicar precisamente cómo el modelo logra internamente esa precisión, ya sea a través de un schedule de difusión particular, tokenización de códec de audio, un transformer entrenado conjuntamente, u otro enfoque.
Lo que es seguro: el modelo produce video y audio coherentes y sincronizados en una sola pasada de generación. La ingeniería que lo hace posible permanece, por ahora, dentro de la documentación técnica de MiniMax.