Daha önceki modellerin aksine H3, video ve sesi ayrı görevler olarak ele almaz; metin, görsel, video ve sesi tek bir yaratıcı bağlam olarak birlikte yorumlar. Bazı barındırılan arayüzler, tek bir üretim isteğinde 9 adede kadar görsel, 3 video klibi ve 3 ses parçası geçirmenize izin verir. Model, kimlik, performans, kamera hareketi, kompozisyon, ses manzarası ve düzenleme ritmini sizin verdiğiniz her şeyden okur.
Çevrimiçi üreteçler (minimaxh3.org, minimax-h3.app ve diğerleri), tarayıcı tabanlı ön uçlar olarak çalışır: isteminizi ve yüklenen referansları toplar, bunları barındırılan bir H3 çıkarım hizmetine gönderir ve ortaya çıkan medyayı sunar. Siteler modeli kendileri işletmez.
Bu, temel yeniliktir. H3, “native stereo ses” üretir — ses, modele daha sonra otomatik olarak eklenen bir parça değil, modelin üretim çıktısının bir parçasıdır. Bu, diyalog, ayak sesleri, ortam ambiyansı ve müziğin görsel aksiyonla ilişkili olarak üretildiği ve kesmeye göre zamanlandığı anlamına gelir.
MiniMax bunu “ses, ses efektleri ve müziğin birleşik modellemesi” olarak tanımlar ve modelin tek bir üretim geçişinde foley, oda tonu ve hatta özgün müzik işleyebildiğini ima eder.
Model aşağıdakileri destekler:
Web arayüzü, stereo sesin aynı dosyaya gömülü olduğu üretilmiş videoyu döndürür. Barındırılan üreteçler tarafından duyurulan özellikler arasında en boy oranı kontrolleri, esnek süre seçimi, referans yüklemeleri ve metinden videoya, görsel animasyonu ve çok modlu istem için iş akışları bulunur.
MiniMax-H3), fal.ai gibi barındırılan çıkarım platformları ve kendi kendine barındırma için Hugging Face'deki açık ağırlıklar aracılığıyla kullanılabilir. “Native stereo ses” açık bir yetenek iddiasıdır, ancak kamuya açık materyaller, kare-ses senkronizasyonunu zorlayan tam sinir ağı mimarisini açıklamamaktadır. Kaynaklar girdi/çıktı davranışını ve yeteneği onaylamakta, ancak modelin bu hassasiyeti dahili olarak nasıl elde ettiğini açıklamak için yeterli uygulama ayrıntısını vermemektedir - belirli bir difüzyon takvimi, ses kodek tokenizasyonu, ortak eğitilmiş bir dönüştürücü veya başka bir yaklaşım yoluyla olsun.
Kesin olan şey: model, tek bir üretim geçişinde tutarlı, senkronize ses ve video çıktısı verir. Bunu mümkün kılan mühendislik şimdilik MiniMax'ın teknik dokümantasyonunun içinde kalıyor.