MiniMax H3는 2026년 8월 3일 오픈 웨이트로 공개됐으며, 텍스트·이미지·영상·오디오를 하나의 생성 흐름에서 처리하고 최대 약 15초 길이의 영상과 네이티브 스테레오 오디오를 생성합니다. FL2VA는 텍스트·키프레임 기반 영상 생성에, Ref2VA는 이미지·영상·오디오를 함께 참조하는 멀티모달 생성에 적합합니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3는 2026년 8월 3일 공개된 오픈 웨이트 옴니모달 영상 생성 모델이다. 핵심은 텍스트, 이미지, 영상, 오디오를 같은 컨텍스트 안에서 이해하고, 영상과 스테레오 사운드를 함께 생성한다는 점이다. 지금까지 여러 도구로 나눠 처리하던 음성·음악·효과음 작업을 영상 생성 단계와 더 가깝게 묶는 방식이다. 1
2
물론 H3가 편집자나 연출자, 품질 검수자를 대체하는 것은 아니다. 다만 제작자가 모든 원본 에셋을 따로 모으고 트랙을 일일이 맞추는 데 쓰던 시간을 줄이고, 의도와 제약 조건을 입력하고 여러 결과를 비교한 뒤 가장 나은 출력을 다듬는 방향으로 작업의 중심을 옮길 수 있다.
H3는 텍스트 프롬프트, 키프레임, 멀티모달 레퍼런스를 바탕으로 영상을 생성한다. ComfyUI 문서에 따르면 최대 2K 해상도, 초당 24프레임, 약 15초 길이의 출력을 지원하며, 음성·음악·효과음은 생성 과정에서 네이티브 스테레오 오디오로 함께 만들어진다. 2
오디오 통합이 중요한 이유는 영상과 소리를 처음부터 별개의 작업으로 시작해야 했던 제작상의 병목을 줄이기 때문이다. H3는 시청각 결과를 공동으로 모델링하지만, 전문적인 결과물을 만들려면 여전히 편집, 믹싱, 노이즈 제거, 재생성 같은 후처리가 필요할 수 있다.
공개된 H3-Base에는 크게 두 가지 변형이 포함된다.
FL2VA는 텍스트-투-비디오 생성과 첫 프레임·마지막 프레임 조건부 생성을 담당한다. 시작 장면이나 끝 장면을 정하거나, 두 프레임 사이의 전환을 만들고 싶을 때 적합한 경로다. 1
5
8
첫 프레임만 넣어 이미지에서 영상으로 확장하거나, 첫 프레임과 마지막 프레임을 모두 제공해 장면의 시작과 끝을 지정할 수도 있다.
Ref2VA는 레퍼런스 중심의 생성 방식이다. 이미지, 영상, 오디오를 조합해 입력할 수 있어 인물의 정체성, 스타일, 움직임, 카메라 동작, 목소리 같은 요소를 한 번에 참고시킬 수 있다. 1
2
8
실무적으로 보면 FL2VA는 프롬프트와 키프레임 중심의 작업에, Ref2VA는 이미 확보한 여러 미디어 자산이 결과에 영향을 줘야 하는 작업에 더 가깝다.
기존의 짧은 영상 제작은 다음처럼 여러 단계로 쪼개지는 경우가 많았다.
H3는 이 중 여러 단계를 한 번의 모델 상호작용 안으로 압축한다. 제작자는 프롬프트, 시작·끝 프레임, 움직임 레퍼런스, 오디오 레퍼런스를 함께 제공하고, 각각의 파일을 따로 관리하는 대신 시청각 결과물 후보를 바로 요청할 수 있다. 2
8
그렇다고 결과물이 곧바로 완성 영화가 되는 것은 아니다. H3가 바꾸는 핵심은 창작자의 시간이 쓰이는 지점이다. 모든 원본 요소를 확보하는 데 들이는 시간은 줄고, 장면의 제약 조건을 정하고, 여러 변형을 생성하고, 프롬프트를 조정하고, 선택한 결과를 편집하는 일이 더 중요해진다. 이는 H3의 멀티모달 설계가 가져오는 작업 방식의 변화이지, 캐릭터 일관성이나 타이밍, 방송 수준의 음질을 보장한다는 뜻은 아니다.
H3를 평가할 때 가장 중요한 구분이다.
다운로드할 수 있는 공개 릴리스는 H3-Base이며, FL2VA와 Ref2VA가 여기에 해당한다. 로컬 설치 가이드와 모델 문서에 따르면 Base 체크포인트의 로컬 출력은 768p이고, H3-Regenerate-2K 단계는 오픈소스로 공개되지 않아 MiniMax의 호스팅 서비스에서 제공된다. 6
9
12
따라서 “H3가 2K를 지원한다”와 “오픈 웨이트만으로 전체 2K 파이프라인을 로컬에서 실행할 수 있다”는 서로 다른 주장이다. 전자는 호스팅 제품을 포함한 전체 서비스의 설명이고, 후자는 현재 공개된 구성보다 과장된 표현이다.
가능한 구성은 있지만, 일반적인 데스크톱 프로그램처럼 간단히 설치하는 수준은 아니다.
양자화된 웨이트, 시스템 RAM 사용, 레이어 오프로딩을 조합하면 일부 H3 워크플로는 약 12GB급 VRAM에서도 실행할 수 있다는 커뮤니티 보고가 있다. 다만 가장 작은 실행 구성도 파일 용량이 약 42.5GB로 알려져 있어, VRAM뿐 아니라 디스크 공간과 시스템 메모리도 중요하다. 7
10
43
참고로 RTX 5070 Ti의 VRAM은 12GB가 아니라 16GB다. 이 GPU에서 실험적인 H3 양자화 모델이 테스트됐지만, 실제 실행 여부와 속도는 해상도, 스텝 수, 오프로딩 방식, 메모리 구성, 워크플로에 따라 크게 달라진다. 33
34
39
일부 로컬 테스트에서는 RTX 5070 Ti 시스템에서 5초 480p 클립 생성에 약 160초, 720p에서 약 560초가 걸렸다는 결과가 보고됐다. 그러나 다른 자료는 해당 카드의 검증된 생성 시간을 제공하지 않는다고 명시한다. 따라서 이 수치는 H3의 일반적인 벤치마크가 아니라 특정 설정에서 나온 사례로 봐야 한다. 45
34
38
속도와 편의성을 우선한다면 호스팅 API를 이용하는 편이 낫다. 모델을 직접 내려받거나 대형 오프로딩 워크플로를 구성할 필요가 없기 때문이다. ComfyUI도 호스팅 H3 API 워크플로를 지원하므로, 선택지는 ‘완전 로컬’과 ‘별도의 창작 앱’으로만 나뉘지 않는다. 48
ComfyUI는 H3 오픈 웨이트 공개와 함께 네이티브 지원을 추가했고, 텍스트-투-비디오, 이미지·프레임 조건부 생성, 레퍼런스-투-비디오 워크플로를 제공한다. 1
2
노드 기반 접근은 H3를 스크립트나 창작 자동화 도구와 연결하기에도 유리하다. 예를 들어 코딩 에이전트가 서로 다른 프롬프트와 시드를 사용해 짧은 영상을 대량 생성하고, 결과 파일을 정리하고, 콘택트 시트를 만들고, 사람이 검토할 후보를 추려내는 식의 구성이 가능하다.
다만 병렬 생성과 후보 평가가 H3 자체의 기능인 것은 아니다. 어떤 클립이 가장 좋은지 판단하는 일은 주변 자동화 시스템과 사람의 검토에 달려 있다. 캐릭터 연속성, 구도, 대사 품질, 장면의 적절성은 여전히 사람이 확인해야 한다.
MiniMax의 공식 종량제 문서에 따르면 H3 가격은 768p 출력이 초당 0.08달러, 2K 출력이 초당 0.13달러다. 768p 영상을 2K로 재생성하는 단계는 초당 0.05달러로 안내돼 있다. 17
따라서 10초 영상의 기본 계산은 다음과 같다.
“10초 2K 영상이 약 0.60달러부터 시작한다”는 주장은 여기서 확인된 공식 요금표와 맞지 않는다. 특정 프로모션, 구독 크레딧 환산 방식, 또는 다른 서비스의 가격일 가능성은 있지만, 더 강한 근거 없이 MiniMax의 표준 API 가격으로 소개해서는 안 된다.
MiniMax Design 역시 다운로드 가능한 H3 웨이트와는 별개의 제품이다. 제3자 보도에서는 이를 H3를 기반으로 하거나 H3를 활용하는 폐쇄형 창작 제품으로 설명하며, 자체 크레딧과 요금제를 운영하는 것으로 전해진다. 따라서 MiniMax Design을 H3-Base 로컬 실행과 같은 제품으로 보면 안 된다. 18
MiniMax H3의 의미는 영상 제작의 모든 단계를 없애는 데 있지 않다. 텍스트는 장면을 설명하고, 이미지는 외형을 정하고, 영상은 움직임을 안내하고, 오디오는 목소리나 소리를 제시하는 식으로 서로 다른 입력을 하나의 생성 맥락에 넣을 수 있다는 데 있다. 그 결과 모델은 영상과 동기화된 오디오를 함께 포함하는 후보 결과물을 만든다. 2
크리에이터에게는 짧은 영상 아이디어를 더 빠르게 반복하고 레퍼런스 중심으로 발전시킬 수 있는 기반이 된다. 개발자에게는 오픈 웨이트와 ComfyUI 지원을 바탕으로 맞춤형 파이프라인, 배치 생성, 에이전트 보조 검토를 구축할 여지가 생긴다.
반면 구매자와 운영자는 다른 판단을 해야 한다. 로컬 통제와 실험 가능성을 위해 상당한 하드웨어와 설정 비용을 감수할지, 아니면 호스팅 2K 생성의 속도와 편의성을 선택할지 비교해야 한다.
가장 정확한 요약은 이렇다. H3는 생성 단계의 분절을 줄이지만 제작자의 판단까지 없애지는 않는다. 또한 오픈 웨이트 공개판은 전체 호스팅 2K 시스템의 일부다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
MiniMax H3는 2026년 8월 3일 오픈 웨이트로 공개됐으며, 텍스트·이미지·영상·오디오를 하나의 생성 흐름에서 처리하고 최대 약 15초 길이의 영상과 네이티브 스테레오 오디오를 생성합니다.
MiniMax H3는 2026년 8월 3일 오픈 웨이트로 공개됐으며, 텍스트·이미지·영상·오디오를 하나의 생성 흐름에서 처리하고 최대 약 15초 길이의 영상과 네이티브 스테레오 오디오를 생성합니다. FL2VA는 텍스트·키프레임 기반 영상 생성에, Ref2VA는 이미지·영상·오디오를 함께 참조하는 멀티모달 생성에 적합합니다.
공식 API 요금은 2K 출력이 초당 0.13달러, 768p가 초당 0.08달러입니다. 따라서 10초 영상은 각각 1.30달러와 0.80달러이며, 적용 가능한 추가 비용은 별도입니다.