MiniMax H3, rilasciato con pesi aperti il 3 agosto 2026, combina testo, immagini, video e audio nello stesso contesto e può generare clip fino a circa 15 secondi con audio stereo nativo. FL2VA è pensato per il text to video e il condizionamento tramite primo e ultimo fotogramma; Ref2VA usa riferimenti combinati di i...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 è un modello di generazione video open-weight e omni-modale, pubblicato il 3 agosto 2026. La sua caratteristica distintiva è la capacità di collocare testo, immagini, video e audio nello stesso contesto, per poi generare video e audio stereo nativo in un unico processo. 1
2
L’obiettivo non è sostituire il montaggio, la regia o il controllo umano. H3 sposta però una parte importante del lavoro: dalla ricerca e sincronizzazione di singoli asset alla descrizione dell’intento, all’uso di riferimenti, alla generazione di varianti e alla selezione dei risultati migliori.
H3 supporta la creazione video a partire da un prompt testuale, da fotogrammi chiave e da riferimenti multimodali. La documentazione di ComfyUI indica output fino a 2K, 24 fotogrammi al secondo e una durata di circa 15 secondi. Voce, musica ed effetti sonori vengono generati come audio stereo nativo nello stesso passaggio. 2
L’integrazione dell’audio è particolarmente rilevante perché affronta uno dei punti più macchinosi della produzione video con l’IA: la necessità di generare immagini e suoni in strumenti separati. H3 cerca di modellare il risultato audiovisivo in modo congiunto, anche se per un lavoro professionale restano spesso necessari montaggio, pulizia dell’audio e revisione.
Il rilascio di H3-Base comprende due varianti principali.
FL2VA è progettato per il text-to-video e per il condizionamento tramite primo fotogramma, ultimo fotogramma oppure entrambi. È la scelta più diretta quando si vuole partire da una descrizione, fissare uno o due estremi visivi o guidare una transizione tra fotogrammi forniti dall’utente. 1
5
8
Ref2VA è la variante pensata per i riferimenti multimodali. Può usare combinazioni di immagini, video e audio per influenzare aspetto, movimento, identità, stile o voce all’interno della stessa configurazione di generazione. 1
2
8
La differenza è soprattutto pratica: FL2VA è più adatto a flussi guidati da prompt e keyframe; Ref2VA è pensato per i progetti in cui diversi asset esistenti devono contribuire al risultato finale.
In un flusso tradizionale basato su più strumenti, una breve clip può richiedere passaggi separati per:
H3 comprime diversi di questi passaggi in una singola interazione. Un creator può fornire un prompt, un fotogramma iniziale o finale, un riferimento di movimento e un riferimento audio, chiedendo direttamente una proposta audiovisiva invece di gestire ogni elemento in isolamento. 2
8
Questo non significa ottenere automaticamente un film finito. Il cambiamento più concreto riguarda la distribuzione del lavoro creativo: meno tempo speso a procurarsi ogni componente grezzo e più tempo dedicato a definire vincoli, confrontare varianti, correggere i prompt e montare gli output selezionati. È una conseguenza del design multimodale di H3, non una garanzia di personaggi sempre coerenti, timing perfetto o audio pronto per la distribuzione.
Questa è la distinzione più importante per chi sta valutando H3.
Il download pubblico riguarda H3-Base, con le varianti FL2VA e Ref2VA. Le guide locali e la documentazione del modello indicano che i checkpoint Base generano video a 768p, mentre lo stadio H3-Regenerate-2K non è open-source ed è disponibile tramite il servizio ospitato di MiniMax. 6
9
12
In altre parole, “H3 supporta il 2K” e “i pesi aperti generano localmente l’intera pipeline 2K” sono due affermazioni diverse. La prima descrive l’offerta ospitata nel suo complesso; la seconda esagera ciò che è stato effettivamente rilasciato.
Sì, ma l’uso locale è un progetto tecnico con diversi compromessi, non una semplice installazione desktop.
Quantizzazione, utilizzo della RAM di sistema e offload dei layer possono portare alcuni workflow H3 alla portata di GPU con circa 12 GB di VRAM, secondo i report della comunità. La combinazione più ridotta descritta nei materiali disponibili occupa circa 42,5 GB di file: spazio su disco e memoria di sistema contano quindi quasi quanto la VRAM. 7
10
43
La RTX 5070 Ti dispone di 16 GB di VRAM, non 12 GB. Quantizzazioni sperimentali di H3 sono state testate su questa scheda, ma i risultati dipendono dalla configurazione esatta, dalla risoluzione, dal numero di step, dalla strategia di offload e dal workflow utilizzato. 33
34
39
Anche i tempi pubblicati vanno letti come esperienze legate a una specifica configurazione, non come benchmark generali. Un test della comunità ha riportato circa 160 secondi per una clip di 5 secondi a 480p e circa 560 secondi a 720p su un sistema con RTX 5070 Ti; altri report descrivono risultati differenti e sottolineano l’assenza di un tempo verificato per quella scheda. 45
34
38
Chi privilegia la velocità rispetto al controllo locale può usare un’API ospitata, evitando di scaricare il modello e di gestire un workflow con forte offload. ComfyUI supporta anche workflow H3 basati su API, quindi la scelta non è limitata a un’installazione completamente locale o a un’applicazione creativa separata. 48
ComfyUI ha aggiunto il supporto nativo a H3 al momento del rilascio dei pesi aperti, con workflow per text-to-video, condizionamento tramite immagini o fotogrammi e generazione reference-to-video. 1
2
L’accesso tramite nodi rende inoltre H3 più semplice da collegare a script e sistemi di automazione creativa. In teoria, un agente di programmazione può inviare molti prompt brevi con seed o combinazioni di riferimenti differenti, organizzare i file generati, creare provini di confronto e aiutare una persona a esaminare i candidati.
La distinzione è importante: la generazione parallela e la valutazione sarebbero funzioni del sistema di automazione circostante, non una capacità con cui H3 decide autonomamente quale clip sia la migliore. La revisione umana resta essenziale per continuità, composizione, qualità dei dialoghi e adeguatezza del risultato.
La documentazione ufficiale pay-as-you-go di MiniMax indica 0,08 dollari per secondo per l’output a 768p e 0,13 dollari per secondo per l’output in 2K. La rigenerazione da 768p a 2K è indicata a 0,05 dollari al secondo. 17
Per una generazione di 10 secondi, il calcolo è quindi:
La cifra, spesso ripetuta, di circa 0,60 dollari per una clip 2K standard di 10 secondi non è supportata dal listino ufficiale fornito per questo articolo. Potrebbe riferirsi a una promozione, a un calcolo basato su crediti in abbonamento o a un altro servizio, ma non va presentata come prezzo API standard di MiniMax senza prove più solide.
Anche MiniMax Design è un prodotto distinto dai pesi H3 scaricabili. Le fonti di terze parti lo descrivono come uno strumento creativo chiuso costruito su H3 o attorno a H3, con crediti e offerte propri. Non va quindi confuso con l’esecuzione locale di H3-Base. 18
Il valore di MiniMax H3 non sta nell’eliminazione di ogni fase della produzione video, ma nell’unificazione degli input che prima vivevano in strumenti separati. Il testo descrive la scena, le immagini ne definiscono l’aspetto, il video può guidare il movimento e l’audio può fornire indicazioni su voce o suono: il modello restituisce una proposta audiovisiva sincronizzata. 2
Per i creator, questo può rendere l’ideazione di contenuti brevi più iterativa e guidata dai riferimenti. Per gli sviluppatori, pesi aperti e supporto a ComfyUI offrono una base per pipeline personalizzate, generazione in batch e processi di revisione assistiti da agenti. Per chi deve scegliere uno strumento, il punto è capire se il controllo locale e la sperimentazione giustificano costi hardware e complessità di configurazione, oppure se la generazione 2K ospitata rappresenti un compromesso più conveniente.
La sintesi più precisa è anche la più semplice: H3 riduce la frammentazione nella fase di generazione, ma non elimina la necessità di giudizio produttivo. Inoltre, il rilascio open-weight rappresenta solo una parte del sistema 2K completo disponibile tramite i servizi ospitati.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MiniMax H3, rilasciato con pesi aperti il 3 agosto 2026, combina testo, immagini, video e audio nello stesso contesto e può generare clip fino a circa 15 secondi con audio stereo nativo.
MiniMax H3, rilasciato con pesi aperti il 3 agosto 2026, combina testo, immagini, video e audio nello stesso contesto e può generare clip fino a circa 15 secondi con audio stereo nativo. FL2VA è pensato per il text to video e il condizionamento tramite primo e ultimo fotogramma; Ref2VA usa riferimenti combinati di immagini, video e audio per un controllo più preciso.
Il prezzo ufficiale pay as you go è di 0,13 dollari al secondo per l’output in 2K e 0,08 dollari al secondo per 768p: una clip di 10 secondi costa quindi rispettivamente 1,30 o 0,80 dollari, prima degli eventuali cost...