온라인 생성기(minimaxh3.org, minimax-h3.app 등)는 브라우저 기반 프론트엔드 역할을 합니다. 사용자의 프롬프트와 업로드된 참조 파일을 수집하여 호스팅된 H3 추론 서비스로 보내고, 결과 미디어를 표시합니다. 이 사이트들이 모델 자체를 운영하는 것은 아닙니다 .
이것이 핵심 혁신입니다. H3는 '네이티브 스테레오 오디오'를 생성합니다. 즉, 사운드는 나중에 자동으로 첨부되는 오디오 트랙이 아니라 모델 생성 출력의 일부입니다 . 이는 대사, 발소리, 환경 음향, 음악이 시각적 액션과 관련되어 생성되고 컷에 맞춰 타이밍이 조정된다는 의미입니다
.
MiniMax는 이를 '음성, 음향 효과, 음악의 통합 모델링'이라고 설명하며, 모델이 단일 생성 패스 내에서 Foley, 룸 톤, 심지어 오리지널 스코어까지 처리함을 시사합니다 .
모델이 지원하는 사양은 다음과 같습니다.
웹 인터페이스는 스테레오 오디오가 동일한 파일에 내장된 생성된 비디오를 반환합니다. 호스팅 생성기가 광고하는 기능으로는 화면비 제어, 유연한 길이 선택, 참조 파일 업로드, 텍스트-투-비디오, 이미지 애니메이션 및 멀티모달 프롬프팅 워크플로가 있습니다 .
MiniMax-H3), fal.ai와 같은 호스팅 추론 플랫폼, 그리고 자체 호스팅 배포를 위한 Hugging Face의 오픈 웨이트를 통해 사용 가능 '네이티브 스테레오 오디오'는 명확한 기능 주장이지만, 공개된 자료는 프레임-오디오 동기화를 강제하는 정확한 신경망 아키텍처를 공개하지 않습니다. 소스들은 입출력 동작과 기능을 확인해 주지만, 모델이 내부적으로 어떻게 그 정밀한 동기화를 달성하는지(특정 확산 스케줄, 오디오-코덱 토크나이제이션, 공동 학습 트랜스포머 또는 다른 접근 방식인지)를 설명할 만한 충분한 구현 세부 정보는 공개되지 않았습니다 .
확실한 것은 모델이 단일 생성 패스에서 일관되고 동기화된 오디오와 비디오를 출력한다는 점입니다. 그것을 가능하게 하는 엔지니어링은 현재로서는 MiniMax의 기술 문서 안에 남아 있습니다.