MiniMax har lovet at udgive H3's modelvægte under MiniMax Community License. Licensen har en omsætningsgrænse på 20 millioner dollar for kommerciel brug . Det står i kontrast til ByteDance, der holder Seedance lukket.
Teknisk bygger H3 på MiniMax' H3-Omni Transformer – en samlet ramme, der håndterer tekst, billeder, video og lyd. Seedance 2.5 er derimod en diffusionsbaseret model, der især er udviklet med fokus på tidsmæssig sammenhæng i længere videosekvenser .
Ifølge MiniMax giver denne forskel en betydelig effektivitetsgevinst. Ved 2K-opløsning er H3's pris pr. sekund mindre end en tredjedel af prisen hos almindelige konkurrenter .
Den uafhængige benchmarkplatform Artificial Analysis placerede H3 således :
| Kategori | MiniMax H3 | Førende model eller bemærkning |
|---|---|---|
| Videoredigering | Nr. 1 globalt | Højeste vurdering på platformen |
| Tekst-til-video | Nr. 2 | Efter Googles Gemini Omni Flash |
| Billede-til-video | Nr. 3 | Efter ByteDance Seedance 2.0 og Gemini Omni Flash |
I videoredigering med lyd indtog H3 førstepladsen med en Elo-score på 1.130. Resultatet bygger på 5.043 blindtests, hvor brugere sammenlignede modelresultater uden at kende deres ophav .
H3 ligger desuden som nummer to i kategorien tekst-til-video med lyd med en Elo-score på 1.242 . Resultaterne viser derfor et stærkt udgangspunkt for redigering og kontrol – men ikke en førsteplads i alle former for videogenerering.
H3's API-priser er blandt de laveste for førende AI-videomodeller :
Til sammenligning er den oplyste pris pr. minut 22,45 dollar for Seedance 2.0 og 20,16 dollar for Kling 3.0, mens H3 ligger på 7,80 dollar .
På 2K-niveau koster H3 dermed mindre end en tredjedel af de almindelige konkurrenters pris pr. sekund. Ved 768p siger MiniMax, at modellen koster mindre end halvdelen af konkurrenternes 720p-priser .
H3 kan generere videoklip på 4–15 sekunder i native 2K-opløsning – 2.560 × 1.440 pixel – ved 24 billeder i sekundet . Stereolyden genereres i samme inferenskørsel som videoen i stedet for at blive lagt på bagefter.
Modellen kan tage tekst, billeder, video og lyd som input i én samlet kontekst . Den understøtter også Video-to-Video Motion Transfer, hvor bevægelser fra én video kan overføres til en anden. Funktionen er udviklet til at give brugeren mere præcis kontrol over fortælling og bevægelse .
H3 er i øjeblikket tilgængelig gennem API'et under model-ID'et MiniMax-H3 samt på MiniMax' forbrugerplatform Hailuo AI . MiniMax lovede, at modelvægtene ville blive udgivet få dage efter lanceringen .
MiniMax positionerer H3 som et værktøj til produktionsklart indhold på tværs af flere brancher :
H3's lancering gør AI-videokonkurrencen til mere end et kapløb om længere klip og højere opløsning. MiniMax satser på, at en model med åbne vægte og lave brugsomkostninger kan finde vej ind i flere udvikleres værktøjer og produktionsflows.
Benchmarkresultaterne giver H3 et stærkt udgangspunkt, især inden for videoredigering. Samtidig viser placeringerne i tekst-til-video og billede-til-video, at modellen ikke er førende på alle områder. Den langsigtede betydning afhænger derfor også af, om de lovede modelvægte leverer samme kvalitet uden for MiniMax' egne tjenester – og om virksomheder faktisk tager dem i brug.