Toisin kuin aiemmat mallit, jotka käsittelevät videota ja ääntä erillisinä tehtävinä, H3 tulkitsee tekstiä, kuvia, videota ja ääntä yhtenä luovana kontekstina. Jotkut isännöidyt käyttöliittymät sallivat jopa 9 kuvan, 3 videoleikkeen ja 3 ääniraidan lähettämisen yhdessä generointipyynnössä. Malli lukee identiteetin, suorituksen, kameran liikkeen, sommittelun, äänimaiseman ja editointirytmin antamastasi materiaalista.
Verkkogeneraattorit (minimaxh3.org, minimax-h3.app ja muut) toimivat selainpohjaisina etuliittyminä: ne keräävät kehotteesi ja ladatut referenssit, lähettävät ne isännöidyllle H3-päättelypalvelulle ja esittävät tuloksena olevan median. Sivustot eivät itse käytä mallia.
Tämä on keskeinen innovaatio. H3 tuottaa ”natiivia stereoääntä” – ääni on osa mallin tuotosta, ei automaattisesti jälkeenpäin liitetty ääniraita. Tämä tarkoittaa, että dialogi, askeleet, ympäristön äänet ja musiikki syntyvät suhteessa visuaaliseen tapahtumaan ja ajoitetaan leikkauksen mukaan.
MiniMax kuvailee sitä ”äänen, äänitehosteiden ja musiikin yhtenäiseksi mallinnukseksi”, mikä viittaa siihen, että malli käsittelee äänitehosteet, huonetunnelman ja jopa alkuperäisen sävellyksen yhdessä generointikerrassa.
Malli tukee:
Yksittäiset kolmannen osapuolen käyttöliittymät voivat tarjota lisäohjaimia resoluutiolle, kuvasuhteelle ja kestolle.
Verkkokäyttöliittymä palauttaa luodun videon, johon stereoääni on upotettu samaan tiedostoon. Isännöityjen generaattorien mainostamia ominaisuuksia ovat kuvasuhdeohjaimet, joustava keston valinta, referenssien lataus sekä työnkulut tekstistä videoksi, kuvan animointiin ja multimodaaliseen kehottamiseen.
MiniMax-H3), isännöityjen päättelyalustojen kuten fal.ai, ja avoimina painoina Hugging Facessa omaa käyttöönottoa varten. ”Natiivi stereoääni” on selkeä kyvykkyysväite, mutta julkiset materiaalit eivät paljasta tarkkaa neuroarkkitehtuuria, joka takaa ruutu-äänen synkronoinnin. Lähteet vahvistavat syöttö-/tulostuskäyttäytymisen ja kyvykkyyden, mutta ne eivät kerro tarpeeksi toteutustietoja selittääkseen tarkasti, miten malli saavuttaa tämän tarkkuuden – onko se tietty diffuusioaikataulu, äänikoodekin tokenisaatio, yhdessä koulutettu transformeri vai jokin muu lähestymistapa.
Mikä on varmaa: malli tuottaa koherenttia, synkronoitua ääntä ja videota yhdessä generointikerrassa. Tekniikka, joka tekee tämän mahdolliseksi, on toistaiseksi MiniMaxin teknisen dokumentaation sisällä.