MiniMax는 H3를 MiniMax 커뮤니티 라이선스(상업용 사용 시 매출 상한선 2000만 달러 적용)로 오픈소스화하기로 약속하며, 바이트댄스의 폐쇄형 전략을 정면으로 반박했습니다. H3는 MiniMax의 H3-Omni Transformer를 기반으로 구축된 단일 통합 프레임워크로 텍스트, 이미지, 비디오, 오디오를 모두 처리하는 반면, Seedance 2.5는 장기 시간적 일관성에 초점을 맞춘 확산 기반 모델입니다. 이러한 아키텍처 차이는 측정 가능한 효율성 향상으로 이어져, H3의 2K 해상도 초당 비용은 주류 경쟁사 대비 3분의 1 미만입니다.
독립 벤치마킹 플랫폼 Artificial Analysis는 H3를 다음과 같이 평가했습니다:
| 카테고리 | MiniMax H3 순위 | 선두/비고 |
|---|---|---|
| 영상 편집 | 세계 1위 | 플랫폼 최고 점수 |
| 텍스트-투-비디오 | 2위 | 구글의 Gemini Omni Flash에 이어 |
| 이미지-투-비디오 | 3위 | 바이트댄스 Seedance 2.0 및 Gemini Omni Flash에 이어 |
Artificial Analysis는 H3를 오디오를 포함한 영상 편집 리더보드에서 1위로 선정했으며, 5,043개의 블라인드 선호도 샘플을 기반으로 한 Elo 점수는 1,130점입니다. H3는 오디오를 포함한 텍스트-투-비디오 부문에서도 Elo 점수 1,242점으로 2위를 차지했습니다.
H3의 API 가격은 주요 AI 영상 모델 중 가장 공격적입니다:
분당 비용 비교: H3 $7.80, Seedance 2.0 $22.45, Kling 3.0 $20.16 . 2K 해상도에서 H3의 초당 비용은 주류 경쟁사의 3분의 1 미만이며, 768p에서는 경쟁사 720p 가격의 절반 미만입니다.
H3는 네이티브 2K 해상도(2,560×1,440픽셀)와 초당 24프레임으로 4~15초 길이의 비디오 클립을 생성하며, 스테레오 오디오를 별도 후처리 없이 동일한 추론 과정에서 함께 생성합니다. 이 모델은 텍스트, 이미지, 비디오, 오디오를 단일 통합 컨텍스트 내에서 입력으로 지원합니다. 또한 V2V(Video-to-Video) 모션 전송 기능을 지원하여 한 비디오의 움직임을 다른 비디오로 전송함으로써 정밀한 내러티브 제어가 가능합니다.
MiniMax는 H3를 다양한 산업 분야에서 실무에 바로 사용 가능한 콘텐츠 생성 도구로 포지셔닝했습니다:
H3는 현재 모델 ID MiniMax-H3로 API를 통해, 그리고 MiniMax의 소비자용 플랫폼 Hailuo AI를 통해 사용할 수 있습니다. 모델 가중치는 출시 후 며칠 내에 공개될 예정입니다.