MiniMax выпустила веса H3 3 августа 2026 года. Модель объединяет текст, изображения, видео и аудио в одном контексте и создаёт ролики длительностью примерно до 15 секунд с нативным стереозвуком.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 — видеогенеративная модель с открытыми весами, представленная 3 августа 2026 года. Её ключевая идея — поместить текст, изображения, видео и аудио в единый контекст, а затем сгенерировать видеоряд и нативный стереозвук одновременно, вместо того чтобы собирать сцену из результатов нескольких отдельных инструментов. 1
2
Это не отменяет монтаж, режиссуру и контроль качества. Но рабочий процесс меняется: вместо поиска и подготовки каждого исходного файла создатель может точнее описать замысел, добавить референсы, получить несколько вариантов и выбрать наиболее удачный.
H3 поддерживает создание видео по текстовому описанию, ключевым кадрам и мультимодальным референсам. В документации ComfyUI указаны параметры до 2K, 24 кадров в секунду и примерно 15 секунд на ролик. Голос, музыка и звуковые эффекты могут генерироваться как нативное стерео вместе с изображением. 2
Именно интеграция аудио делает модель особенно интересной для практической работы. Видеоряд и звук больше не обязаны начинаться как две полностью независимые задачи. H3 моделирует аудиовизуальный результат совместно, хотя для профессионального выпуска всё равно могут понадобиться монтаж, чистка дорожек и финальный микс.
В открытый релиз входят два основных варианта H3-Base.
FL2VA рассчитан на text-to-video, а также на управление через первый кадр, последний кадр или пару из первого и последнего кадров. Это подходящий вариант, когда нужно начать с промпта, зафиксировать визуальную точку старта или финиша либо задать переход между двумя предоставленными кадрами. 1
5
8
Ref2VA предназначен для работы с референсами. В качестве контекста можно комбинировать изображения, видео и аудиофайлы, чтобы передать модели сведения о внешности персонажа, стиле, движении, идентичности или голосе. 1
2
8
Практическое различие простое: FL2VA лучше подходит для сценариев, построенных вокруг промпта и ключевых кадров, а Ref2VA — для задач, где на результат должны одновременно влиять несколько уже существующих медиаматериалов.
До появления мультимодального подхода короткий ролик часто требовал отдельной цепочки действий:
H3 объединяет несколько таких шагов в одном взаимодействии. Создатель может передать промпт, начальный или конечный кадр, референс движения и аудиореференс, а затем запросить уже связанный аудиовизуальный вариант, не управляя каждым ассетом изолированно. 2
8
Это не означает, что на выходе всегда получается готовый фильм. Главное изменение — в распределении творческих усилий: меньше времени уходит на сбор исходных компонентов, больше — на постановку ограничений, сравнение вариантов, доработку промптов и монтаж выбранных результатов. Это следствие мультимодального устройства H3, а не гарантия стабильных персонажей, идеального тайминга или звука вещательного качества.
Это важная оговорка для тех, кто оценивает H3 как самостоятельный локальный инструмент.
Скачать можно компоненты H3-Base, включая FL2VA и Ref2VA. Руководства по локальному запуску и документация модели указывают, что базовые чекпойнты генерируют видео в 768p, тогда как этап H3-Regenerate-2K не опубликован с открытым исходным кодом и доступен через облачный сервис MiniMax. 6
9
12
Поэтому утверждения «H3 поддерживает 2K» и «открытые веса позволяют полностью запустить 2K-пайплайн локально» — не одно и то же. Первое относится к более широкой размещённой в облаке версии продукта, второе преувеличивает возможности опубликованного релиза.
Да, но локальная установка остаётся инженерным проектом, а не обычной установкой программы на рабочий стол.
Квантизированные веса, использование системной оперативной памяти и выгрузка слоёв могут сделать отдельные сценарии H3 доступными для видеокарт примерно с 12 ГБ памяти, согласно сообщениям сообщества. При этом минимальная рабочая конфигурация может занимать около 42,5 ГБ на диске, поэтому важны не только VRAM, но и объём оперативной памяти и свободного пространства. 7
10
43
У RTX 5070 Ti 16 ГБ видеопамяти, а не 12 ГБ. Экспериментальные квантизации H3 тестировались на этой карте, однако результаты заметно зависят от конфигурации, разрешения, количества шагов, режима выгрузки слоёв и конкретного workflow. 33
34
39
Локальные замеры скорости следует воспринимать как результаты отдельных конфигураций, а не как универсальный бенчмарк H3. В одном тесте сообщалось примерно о 160 секундах на пятиминутный по длительности? Нет: речь шла о пятisekундном ролике в 480p и примерно 560 секундах для 720p на системе с RTX 5070 Ti. Другие публикации приводят иные значения, а некоторые прямо отмечают отсутствие подтверждённого замера для этой видеокарты. 45
34
38
Для тех, кому важнее скорость, чем полный локальный контроль, облачный API позволяет не скачивать модель и не запускать тяжёлый workflow с выгрузкой на CPU. В ComfyUI также доступны сценарии через hosted H3 API, поэтому выбор не ограничивается вариантами «всё локально» или «отдельное творческое приложение». 48
ComfyUI добавила нативную поддержку H3 одновременно с выходом открытых весов. Доступны workflows для text-to-video, генерации с привязкой к изображению или кадру и создания видео по референсам. 1
2
Узловая архитектура упрощает подключение модели к скриптам и инструментам автоматизации. Теоретически coding agent может отправлять множество коротких промптов с разными seed и наборами референсов, раскладывать результаты по папкам, создавать контактные листы и помогать человеку просматривать кандидатов. Открытые веса делают подобную локальную и скриптуемую оркестрацию более реалистичной.
Но важно разделять возможности модели и окружающей автоматизации. Параллельный запуск и оценка множества вариантов — функции внешней системы, а не встроенная способность H3 самостоятельно определить лучший ролик. Человеческая проверка остаётся необходимой для контроля непрерывности, композиции, качества диалогов и уместности результата.
В официальной документации MiniMax с оплатой по факту использования для H3 указаны следующие ставки: $0,08 за выходную секунду в 768p и $0,13 за выходную секунду в 2K. Повторная генерация с повышением разрешения с 768p до 2K стоит $0,05 за секунду. 17
Таким образом, десятисекундный ролик обойдётся в:
Часто повторяемое утверждение, будто стандартный десятисекундный ролик в 2K начинается примерно с $0,60, не подтверждается приведённым официальным тарифом. Такая цифра может относиться к акции, пересчёту подписочных кредитов или другому сервису, но без дополнительных доказательств её нельзя выдавать за стандартную цену API MiniMax.
MiniMax Design — отдельный продукт, не тождественный скачиваемым весам H3. Сторонние публикации описывают его как закрытый творческий сервис, работающий на базе H3 или вокруг него и использующий собственную систему кредитов и тарифов. Его не следует путать с локальным запуском H3-Base. 18
Значение MiniMax H3 не в том, что модель якобы устраняет все этапы видеопроизводства. Её сильная сторона — объединение входных данных, которые раньше жили в разных инструментах. Текст описывает сцену, изображения задают внешний вид, видео направляет движение, а аудио помогает передать голос или звучание — после чего модель создаёт синхронизированный аудиовизуальный вариант. 2
Для создателей это может сделать разработку коротких роликов более итеративной и ориентированной на референсы. Для разработчиков открытые веса и поддержка ComfyUI создают основу для собственных пайплайнов, пакетной генерации и проверки вариантов с помощью агентов. Для бизнеса выбор сводится к практическому компромиссу: оправдывают ли локальный контроль и эксперименты затраты на оборудование и настройку или удобнее использовать облачную генерацию в 2K.
Самая точная формулировка такова: H3 уменьшает фрагментацию на этапе генерации, но не отменяет продюсерское решение, монтаж и контроль качества. Кроме того, открытый релиз — лишь часть полной облачной системы MiniMax с поддержкой 2K.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
MiniMax выпустила веса H3 3 августа 2026 года. Модель объединяет текст, изображения, видео и аудио в одном контексте и создаёт ролики длительностью примерно до 15 секунд с нативным стереозвуком.
MiniMax выпустила веса H3 3 августа 2026 года. Модель объединяет текст, изображения, видео и аудио в одном контексте и создаёт ролики длительностью примерно до 15 секунд с нативным стереозвуком. FL2VA предназначен для генерации по тексту и ключевым кадрам, а Ref2VA — для работы с наборами изображений, видео и аудиореференсов.
Официальная цена API составляет $0,08 за секунду для 768p и $0,13 за секунду для 2K.