MiniMax H3 вийшла у відкритому доступі 3 серпня 2026 року. Модель поєднує текст, зображення, відео й аудіо в одному процесі та створює ролики тривалістю приблизно до 15 секунд із нативним стереозвуком.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 — це мультимодальна модель генерації відео з відкритими вагами, випущена 3 серпня 2026 року. Її ключова особливість — здатність працювати з текстом, зображеннями, відео й аудіо в одному контексті, а потім створювати відео та нативний стереозвук одночасно, без обов’язкового складання всіх елементів у різних інструментах. 1
2
Це не означає, що H3 замінює монтажера, режисера чи фінальну перевірку. Однак модель змінює саму логіку роботи: замість пошуку кожного сирого ресурсу окремо творець може описати задум, додати референси, згенерувати кілька варіантів і вибрати найвдаліший.
H3 підтримує створення відео з текстового опису, ключових кадрів і мультимодальних референсів. Документація ComfyUI вказує на результат із роздільною здатністю до 2K, частотою 24 кадри/с і тривалістю приблизно до 15 секунд. Голос, музика та звукові ефекти генеруються як нативне стереоаудіо в тому самому проході. 2
Інтеграція звуку важлива через типову проблему AI-відео: зображення та аудіо часто створюють у різних сервісах, а потім вручну синхронізують. H3 намагається моделювати аудіовізуальний результат спільно. Водночас для професійного виробництва монтаж, очищення звуку та контроль якості все одно залишаються потрібними.
До відкритого релізу входять дві основні версії H3-Base.
FL2VA призначена для генерації відео з тексту, а також для керування першим кадром, останнім кадром або обома одночасно. Це практичний варіант, якщо потрібно почати з промпту, зафіксувати візуальний початок чи кінець сцени або спрямувати перехід між заданими кадрами. 1
5
8
Ref2VA працює за принципом генерації з референсами. Вона може використовувати комбінації зображень, відео й аудіо, щоб впливати на зовнішність персонажа, рух, стиль, ідентичність або голос в одному завданні. 1
2
8
Різниця між версіями проста: FL2VA більше підходить для сценаріїв, керованих промптом і ключовими кадрами, а Ref2VA — для роботи, де результат має врахувати кілька вже наявних медіаресурсів.
До появи мультимодального підходу короткий ролик міг вимагати окремих етапів:
H3 об’єднує кілька таких етапів в одну взаємодію з моделлю. Творець може надати опис, початковий або кінцевий кадр, референс руху й аудіореференс, а потім отримати не окремі файли, а готовий аудіовізуальний кандидат. 2
8
Це не гарантує появи завершеного фільму з першої спроби. Головна зміна полягає в іншому: менше часу йде на пошук усіх вихідних компонентів, а більше — на формулювання обмежень, порівняння варіантів, уточнення промптів і монтаж найкращих результатів. Це наслідок мультимодального дизайну H3, а не обіцянка ідеальної стабільності персонажів, бездоганного таймінгу чи готового до ефіру звуку.
Це головне застереження для тих, хто оцінює H3.
Для завантаження доступна H3-Base, зокрема варіанти FL2VA і Ref2VA. Посібники для локального запуску та документація моделі вказують, що базові контрольні точки генерують відео у 768p, тоді як етап H3-Regenerate-2K не відкритий і доступний через хостинговий сервіс MiniMax. 6
9
12
Тож твердження «H3 підтримує 2K» і твердження «відкриті ваги локально запускають повний 2K-конвеєр» — не одне й те саме. Перше описує ширшу хмарну пропозицію, а друге перебільшує можливості відкритого релізу.
Так, але локальний запуск — це радше інженерний проєкт із компромісами, ніж проста інсталяція на домашньому комп’ютері.
Квантизовані ваги, використання системної оперативної пам’яті та поетапне перенесення шарів можуть зробити окремі сценарії H3 доступними для відеокарт із 12 ГБ відеопам’яті, за даними спільноти. Найменша робоча конфігурація, за описами, займає приблизно 42,5 ГБ файлів на диску, тому важливі не лише VRAM, а й вільне сховище та обсяг оперативної пам’яті. 7
10
RTX 5070 Ti має 16 ГБ, а не 12 ГБ відеопам’яті. Експериментальні квантизації H3 тестували на цій відеокарті, але результати залежать від конкретної конфігурації, роздільної здатності, кількості кроків, стратегії offload і самого робочого процесу. 33
34
39
Тому наведені локальні таймінги варто сприймати як результати окремих конфігурацій, а не як універсальні бенчмарки H3. Один тест спільноти показав приблизно 160 секунд для п’ятисекундного ролика у 480p і близько 560 секунд для 720p на системі з RTX 5070 Ti. Водночас інші джерела наводять інші результати й прямо зазначають, що перевіреного таймінгу для цієї відеокарти немає. 45
34
38
Якщо важливіша швидкість, а не локальний контроль, хмарний API позбавляє потреби завантажувати модель і запускати великий offload-конвеєр. ComfyUI також підтримує хмарні сценарії H3 API, тому вибір не обмежується лише повністю локальним запуском або окремим творчим застосунком. 48
ComfyUI додав нативну підтримку H3 одночасно з виходом відкритих ваг. У ньому доступні сценарії для text-to-video, керування зображеннями або кадрами та генерації відео з референсами. 1
2
Такий нодовый підхід спрощує підключення H3 до скриптів і творчої автоматизації. Теоретично програмний агент може надсилати багато коротких промптів із різними seed або наборами референсів, упорядковувати отримані файли, створювати контактні аркуші й допомагати людині переглядати кандидатів. Відкриті ваги роблять подібну локальну та скриптовану оркестрацію практичнішою.
Важливо розрізняти можливості моделі й оточення: паралельна генерація та оцінювання були б функціями системи автоматизації, а не самостійною здатністю H3 визначати, який ролик найкращий. Людський контроль залишається важливим для безперервності сцен, композиції, якості діалогів і доречності результату.
В офіційній документації MiniMax для моделі pay-as-you-go вказано $0,08 за секунду відео у 768p і $0,13 за секунду у 2K. Та сама документація встановлює ціну регенерації з 768p до 2K на рівні $0,05 за секунду. 17
Отже, 10-секундна генерація коштує:
Поширене твердження, що стандартний 10-секундний ролик у 2K нібито починається приблизно від $0,60, не підтверджується наданою офіційною тарифною сіткою. Це може бути рекламна пропозиція, розрахунок через підпискові кредити або ціна іншого сервісу, але без сильніших доказів її не варто називати стандартною ціною API MiniMax.
MiniMax Design — окремий продукт від завантажуваних ваг H3. Сторонні публікації описують його як закритий творчий сервіс, створений на основі H3 або навколо неї, із власною системою кредитів і тарифами. Його не слід ототожнювати з локальним запуском H3-Base. 18
Значення MiniMax H3 не в тому, що вона скасовує всі етапи відеовиробництва. Її сильна сторона — об’єднання входів, які раніше жили в різних інструментах. Текст описує сцену, зображення задають зовнішність, відео спрямовує рух, а аудіо може визначати голос або звучання — після чого модель створює синхронізований аудіовізуальний варіант. 2
Для творців це може зробити розробку коротких роликів більш ітеративною та орієнтованою на референси. Для розробників відкриті ваги й підтримка ComfyUI створюють основу для власних конвеєрів, пакетної генерації та агентної допомоги під час перегляду. Для бізнесу й покупців практичне питання звучить інакше: чи виправдовують локальний контроль і експерименти витрати на обладнання та налаштування, чи вигіднішим компромісом буде хмарна генерація у 2K.
Найточніше резюме просте: H3 зменшує розрізненість на етапі генерації, але не прибирає потребу у виробничих рішеннях. І відкритий реліз H3-Base — це лише частина повної хмарної системи MiniMax із підтримкою 2K.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MiniMax H3 вийшла у відкритому доступі 3 серпня 2026 року. Модель поєднує текст, зображення, відео й аудіо в одному процесі та створює ролики тривалістю приблизно до 15 секунд із нативним стереозвуком.
MiniMax H3 вийшла у відкритому доступі 3 серпня 2026 року. Модель поєднує текст, зображення, відео й аудіо в одному процесі та створює ролики тривалістю приблизно до 15 секунд із нативним стереозвуком. FL2VA призначена для генерації відео з тексту та керування першим і останнім кадрами, тоді як Ref2VA працює з мультимодальними референсами — зображеннями, відео й аудіо.
Офіційна ціна API за моделлю pay as you go становить $0,13 за секунду для 2K і $0,08 за секунду для 768p: 10 секундний ролик коштує відповідно $1,30 або $0,80 без урахування можливих додаткових витрат.