MiniMax publicó los pesos abiertos de H3 el 3 de agosto de 2026. El modelo combina texto, imágenes, vídeo y audio, y puede generar clips de hasta unos 15 segundos con audio estéreo nativo.
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 es un modelo de generación de vídeo multimodal y con pesos abiertos que MiniMax publicó el 3 de agosto de 2026. Su propuesta central es reunir texto, imágenes, vídeo y audio dentro del mismo contexto para generar imagen en movimiento y sonido estéreo nativo en una sola pasada, en lugar de obligar a los creadores a ensamblar cada elemento con herramientas separadas. 1
2
Eso no convierte a H3 en un sustituto de la edición, la dirección creativa o la revisión humana. Pero sí desplaza parte del proceso: se dedica menos tiempo a buscar y preparar cada recurso desde cero y más a describir la intención, aportar referencias, generar variantes y escoger el resultado más sólido.
H3 permite crear vídeo a partir de una instrucción de texto, fotogramas clave y referencias multimodales. La documentación de ComfyUI describe salidas de hasta 2K, 24 fotogramas por segundo y unos 15 segundos de duración. La voz, la música y los efectos de sonido se generan como audio estéreo nativo durante el mismo proceso. 2
La integración del audio es especialmente relevante porque ataca uno de los puntos más engorrosos de la producción con IA: hasta ahora, la generación visual y la sonora solían ser trabajos completamente separados. H3 modela conjuntamente el resultado audiovisual, aunque un proyecto profesional seguirá necesitando edición, limpieza de audio y control de calidad convencionales.
La versión abierta incluye dos variantes principales de H3-Base.
FL2VA está diseñada para texto a vídeo y para el condicionamiento mediante el primer fotograma, el último o ambos. Es la opción más directa cuando se quiere partir de una descripción, fijar un punto visual de inicio o llegada, o guiar una transición entre imágenes proporcionadas por el usuario. 1
5
8
Ref2VA es la variante orientada a referencias. Puede utilizar combinaciones de imágenes, vídeo y audio como contexto, de modo que una misma generación tenga en cuenta aspectos visuales, movimiento, identidad, estilo o voz. 1
2
8
La diferencia es práctica: FL2VA encaja mejor en flujos dirigidos por prompts y fotogramas clave, mientras que Ref2VA está pensada para trabajos en los que varios recursos existentes deben influir en el resultado final.
Antes de un flujo verdaderamente multimodal, la creación de un clip breve podía exigir varios pasos independientes:
H3 comprime varios de esos pasos en una sola interacción con el modelo. El creador puede aportar un prompt, un fotograma inicial o final, una referencia de movimiento y otra de audio, y solicitar un candidato audiovisual sin gestionar cada recurso por separado. 2
8
El resultado no es necesariamente una película terminada. El cambio más importante está en dónde se invierte el esfuerzo creativo: menos tiempo en conseguir cada componente bruto y más en definir restricciones, comparar variantes, ajustar instrucciones y editar las mejores tomas. Esa es una consecuencia del diseño multimodal de H3, no una garantía de personajes consistentes, sincronización perfecta o sonido listo para emisión.
Esta es la principal advertencia para quienes estén evaluando H3.
La descarga pública cubre H3-Base, con las variantes FL2VA y Ref2VA. Las guías locales y la documentación del modelo señalan que los checkpoints Base generan vídeo en 768p, mientras que la etapa H3-Regenerate-2K no se ha publicado con pesos abiertos y está disponible a través del servicio alojado de MiniMax. 6
9
12
Por tanto, “H3 admite 2K” y “los pesos abiertos generan localmente el flujo 2K completo” son afirmaciones distintas. La primera describe la oferta alojada más amplia; la segunda exagera lo que se ha liberado.
Sí, aunque utilizarlo en local es un proyecto técnico con bastantes limitaciones, no una instalación sencilla para cualquier ordenador.
Según informes de la comunidad, los pesos cuantizados, el uso de la RAM del sistema y la descarga progresiva de capas pueden acercar algunos flujos de H3 a tarjetas con unos 12 GB de VRAM. La combinación funcional más pequeña se ha descrito en torno a 42,5 GB de archivos, por lo que el almacenamiento y la memoria del sistema son tan importantes como la VRAM. 7
10
La RTX 5070 Ti tiene 16 GB de VRAM, no 12 GB. Se han probado cuantizaciones experimentales de H3 en esa GPU, pero los informes publicados subrayan que la configuración exacta, la resolución, el número de pasos, la estrategia de descarga y el flujo de trabajo influyen en que la ejecución funcione y en el tiempo necesario. 33
34
39
Por eso, los tiempos locales deben interpretarse como casos concretos, no como benchmarks generales de H3. Una prueba de la comunidad registró aproximadamente 160 segundos para un clip de cinco segundos en 480p y unos 560 segundos en 720p con una RTX 5070 Ti, mientras que otros informes ofrecen resultados distintos y señalan expresamente que no existe un tiempo verificado para esa tarjeta. 45
34
38
Para quienes priorizan la velocidad frente al control local, una API alojada evita descargar el modelo y ejecutar un flujo con mucho offloading. ComfyUI también permite usar flujos de H3 mediante API alojada, así que la elección no se limita a instalarlo todo localmente o abandonar el entorno creativo. 48
ComfyUI incorporó compatibilidad nativa con H3 cuando se publicaron los pesos abiertos, con flujos para texto a vídeo, condicionamiento mediante imágenes o fotogramas y generación desde referencias. 1
2
Este acceso basado en nodos facilita además conectar H3 con scripts y automatizaciones creativas. En principio, un agente de programación podría enviar muchos prompts breves con distintas semillas o combinaciones de referencias, ordenar los archivos resultantes, crear hojas de contacto y ayudar a una persona a revisar los candidatos. Los pesos abiertos hacen más viable este tipo de orquestación local y programable.
La distinción es importante: la generación y evaluación en paralelo serían capacidades del sistema de automatización que rodea al modelo, no una función de H3 que decida por sí solo qué clip es mejor. La revisión humana sigue siendo necesaria para comprobar continuidad, composición, calidad del diálogo y adecuación del resultado.
La documentación oficial de pago por uso de MiniMax fija H3 en 0,08 dólares por segundo de salida en 768p y 0,13 dólares por segundo en 2K. La misma documentación indica un precio de 0,05 dólares por segundo para regenerar una salida de 768p a 2K. 17
Así, una generación de 10 segundos cuesta:
La afirmación repetida de que un clip estándar de 10 segundos en 2K parte de unos 0,60 dólares no está respaldada por la tarifa oficial proporcionada aquí. Podría corresponder a una promoción, al cálculo de créditos de una suscripción o a otro servicio, pero no debería presentarse como el precio estándar de la API de MiniMax sin pruebas más sólidas.
MiniMax Design también es un producto distinto de los pesos H3 descargables. Informes de terceros lo describen como una herramienta creativa cerrada construida sobre H3 o alrededor de H3, con sus propios créditos y ofertas. No debe confundirse con ejecutar H3-Base en un equipo local. 18
La importancia de MiniMax H3 no está en eliminar cada etapa de la producción de vídeo, sino en unificar entradas que antes vivían en herramientas separadas. El texto puede describir la escena, las imágenes establecer la apariencia, el vídeo guiar el movimiento y el audio influir en la voz o el ambiente, mientras el modelo genera un candidato audiovisual sincronizado. 2
Para los creadores, esto puede hacer que la ideación de piezas cortas sea más iterativa y dependa más de referencias. Para los desarrolladores, los pesos abiertos y la compatibilidad con ComfyUI ofrecen una base para crear flujos personalizados, generar lotes y automatizar parte de la revisión. Para quienes deben elegir una herramienta, la cuestión práctica es si el control local y la experimentación justifican el hardware y la configuración necesarios, o si la generación 2K alojada ofrece un mejor equilibrio.
El resumen más claro también es el más preciso: H3 reduce la fragmentación en la fase de generación, pero no elimina la necesidad de criterio de producción. Además, su lanzamiento con pesos abiertos representa solo una parte del sistema 2K completo que MiniMax ofrece en la nube.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
MiniMax publicó los pesos abiertos de H3 el 3 de agosto de 2026. El modelo combina texto, imágenes, vídeo y audio, y puede generar clips de hasta unos 15 segundos con audio estéreo nativo.
MiniMax publicó los pesos abiertos de H3 el 3 de agosto de 2026. El modelo combina texto, imágenes, vídeo y audio, y puede generar clips de hasta unos 15 segundos con audio estéreo nativo. FL2VA está orientado al texto a vídeo y al condicionamiento mediante el primer o el último fotograma; Ref2VA acepta referencias de imagen, vídeo y audio para controlar mejor el resultado.
La tarifa oficial de pago por uso es de 0,08 dólares por segundo en 768p y 0,13 dólares por segundo en 2K: un clip de 10 segundos cuesta 0,80 o 1,30 dólares, respectivamente, antes de posibles extras.