MiniMax H3 byl s otevřenými vahami vydán 3. srpna 2026. Varianta FL2VA slouží pro generování z textu a pro podmínění prvním či posledním snímkem; Ref2VA využívá obrazové, video a zvukové reference.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 je otevřený multimodální model pro generování videa, který MiniMax zveřejnil 3. srpna 2026. Jeho hlavní myšlenka je jednoduchá, ale prakticky významná: text, obrázky, video i audio může chápat v jediném kontextu a následně vytvořit video společně s nativním stereofonním zvukem. 1
2
H3 tím nenahrazuje střih, režii ani kontrolu výsledku. Může však přesunout část práce od shánění jednotlivých podkladů a synchronizace stop k popisu záměru, dodávání referencí, generování variant a výběru nejlepšího výstupu.
H3 podporuje tvorbu videa z textového zadání, klíčových snímků a multimodálních referencí. Dokumentace pro ComfyUI uvádí výstup až do rozlišení 2K, při 24 snímcích za sekundu a délce přibližně 15 sekund. Hlas, hudba i zvukové efekty mohou vznikat jako nativní stereofonní audio ve stejném průchodu jako obraz. 2
Právě propojení obrazu a zvuku řeší jeden z běžných problémů generativní produkce. Tvůrce už nemusí nutně nejprve vytvořit video a teprve poté k němu zvlášť vyrábět dialog, hudbu nebo ruchy. Pro profesionální výsledek ale stále může být potřeba klasický střih, čištění zvuku a další postprodukce.
Otevřená verze H3-Base obsahuje dvě důležité varianty.
FL2VA je určena pro převod textu na video a pro podmínění prvním, posledním nebo prvním i posledním snímkem. Hodí se proto ve chvíli, kdy chce tvůrce začít pouze popisem, určit vizuální začátek či konec scény nebo řídit přechod mezi dvěma dodanými snímky. 1
5
8
Ref2VA je varianta založená na referencích. V jednom zadání může využít kombinace obrázků, videa a audia. Tyto podklady mohou modelu napovědět, jak má vypadat postava, styl, pohyb, kamera nebo hlas. 1
2
8
Rozdíl je především praktický: FL2VA je vhodnější pro workflow řízené promptem a klíčovými snímky, zatímco Ref2VA se hodí pro projekty, v nichž má výsledek ovlivnit více existujících mediálních souborů.
Krátký klip dnes může vyžadovat několik oddělených kroků:
H3 dokáže část těchto úkolů sloučit do jediné interakce. Tvůrce může dodat prompt, počáteční či koncový snímek, pohybovou referenci a zvukový podklad a požádat o vytvoření audiovizuální varianty, místo aby každý prvek řešil izolovaně. 2
8
Neznamená to, že každý výstup bude hotovým filmem. Změna se týká hlavně toho, kam se přesune tvůrčí práce: méně času může padnout na získávání každého jednotlivého aktiva a více na definování omezení, porovnávání variant, úpravu promptů a střih vybraných výsledků. Samotná multimodalita H3 není zárukou konzistentních postav, dokonalého načasování ani vysílací kvality zvuku.
Tohle je nejdůležitější upozornění pro každého, kdo H3 zvažuje.
Ke stažení je především H3-Base, tedy varianty FL2VA a Ref2VA. Lokální návody a dokumentace uvádějí, že základní checkpointy generují video v rozlišení 768p. Stupeň H3-Regenerate-2K není open source a je dostupný prostřednictvím hostované služby MiniMaxu. 6
9
12
Tvrzení „H3 podporuje 2K“ a tvrzení „otevřené váhy lokálně zvládnou kompletní 2K pipeline“ proto nejsou totéž. První popisuje širší, hostovanou nabídku. Druhé by rozsah zveřejněného systému nadhodnocovalo.
Ano, ale lokální provoz je spíše technický experiment než jednoduchá instalace jedním kliknutím.
Kvantilizované váhy, využití systémové RAM a přesouvání vrstev mezi GPU a operační pamětí mohou podle komunitních zpráv zpřístupnit některé workflow i grafickým kartám s přibližně 12 GB VRAM. Nejmenší funkční kombinace souborů má mít zhruba 42,5 GB, takže kromě VRAM záleží také na kapacitě disku a operační paměti. 7
10
RTX 5070 Ti má 16 GB VRAM, nikoli 12 GB. Na této kartě byly testovány experimentální kvantizace H3, ale výsledná úspěšnost i rychlost závisí na konkrétním nastavení, rozlišení, počtu kroků, strategii offloadingu a použitém workflow. 33
34
39
Uváděné lokální časy proto nelze brát jako obecný benchmark H3. Jeden komunitní test hlásil přibližně 160 sekund pro pětisekundový klip v rozlišení 480p a asi 560 sekund při 720p na systému s RTX 5070 Ti. Jiné zprávy uvádějí odlišné výsledky a výslovně upozorňují, že pro tuto kartu nemají ověřený čas. 45
34
38
Kdo dává přednost rychlosti před lokální kontrolou, může použít hostované API. Odpadá tak stahování modelu i provoz rozsáhlého workflow s přesouváním vrstev. ComfyUI podporuje také cloudová workflow s API MiniMax H3, takže volba není omezena pouze na plně lokální instalaci nebo samostatnou kreativní aplikaci. 48
ComfyUI přidalo nativní podporu H3 v době vydání otevřených vah. K dispozici jsou workflow pro text-to-video, podmínění obrazem či snímkem a generování z referencí. 1
2
Přístup přes uzlové workflow zároveň usnadňuje napojení na skripty a automatizaci. Kódovací agent by teoreticky mohl odeslat velké množství krátkých promptů s různými seedy a kombinacemi referencí, roztřídit výsledné soubory, vytvořit kontaktní archy a pomoci člověku s kontrolou kandidátů.
Je důležité rozlišovat mezi možnostmi okolní automatizace a funkcemi samotného H3. Paralelní generování a vyhodnocování by zajišťoval nadřazený systém, nikoli model, který by sám spolehlivě rozhodoval, který klip je nejlepší. Lidská kontrola zůstává podstatná kvůli kontinuitě, kompozici, kvalitě dialogu i vhodnosti výsledku.
Oficiální dokumentace MiniMaxu pro účtování podle spotřeby uvádí cenu 0,08 USD za výstupní sekundu v 768p a 0,13 USD za výstupní sekundu v 2K. Převod z 768p do 2K prostřednictvím regenerace stojí podle stejného ceníku 0,05 USD za sekundu. 17
Desetisekundová generace tedy vychází na:
Často opakované tvrzení, že standardní desetisekundový 2K klip začíná přibližně na 0,60 USD, zde oficiální ceník nepotvrzuje. Může jít o časově omezenou akci, výpočet předplatného přes kredity nebo jinou službu. Bez silnějších podkladů by však tato částka neměla být vydávána za standardní cenu API MiniMaxu.
MiniMax Design je navíc od stažitelných vah H3 oddělený produkt. Podle třetích stran jde o uzavřený kreativní nástroj postavený na H3 nebo kolem něj, s vlastním systémem kreditů a nabídek. Nelze jej proto zaměňovat s lokálním provozem H3-Base. 18
Význam MiniMax H3 nespočívá v odstranění každého kroku video produkce. Spočívá ve sjednocení vstupů, které dříve žily v různých nástrojích. Text může popsat scénu, obrázek určit vzhled, video řídit pohyb a audio ovlivnit hlas či zvuk, zatímco model vytvoří synchronizovaný audiovizuální návrh. 2
Pro tvůrce to může znamenat rychlejší a více referenční iterování krátkých nápadů. Pro vývojáře představují otevřené váhy a podpora ComfyUI základ pro vlastní pipeline, dávkové generování i asistované hodnocení. Pro firmy a nakupující je klíčová otázka jiná: vyplatí se lokální kontrola a experimentování vzhledem k nárokům na hardware a nastavení, nebo je praktičtější hostované 2K generování?
Nejpřesnější shrnutí je zároveň nejstřízlivější: H3 omezuje roztříštěnost ve fázi generování, ale neodstraňuje potřebu produkčního úsudku. A otevřená verze H3-Base představuje pouze část celého hostovaného 2K systému.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MiniMax H3 byl s otevřenými vahami vydán 3. srpna 2026.
MiniMax H3 byl s otevřenými vahami vydán 3. srpna 2026. Varianta FL2VA slouží pro generování z textu a pro podmínění prvním či posledním snímkem; Ref2VA využívá obrazové, video a zvukové reference.
Oficiální cena přes API činí 0,08 USD za sekundu pro 768p a 0,13 USD za sekundu pro 2K.