API-priset anges till 0,14 dollar per miljon inmatningstokens och 0,28 dollar per miljon utmatningstokens. Cachad indata kan kosta så lite som 0,028 dollar per miljon tokens . Det placerar V4-Flash bland de billigaste API-modellerna i den högsta prestandaklassen för avancerat resonemang – billigare än Gemini 2.5 Flash, som anges till 0,30 respektive 2,50 dollar per miljon tokens .
En omtränad version, kallad 0731-builden, släpptes den 31 juli 2026 och utgör den offentliga betaversionen av API:t. Enligt rapporterade agenttester slog den den större V4-Pro-Preview-modellen, med 82,7 poäng i Terminal Bench 2.1 och 76,7 i Cybergym .
V4-Flash kan köras i flera resonemangslägen – standard, hög och maximal tankningsinsats – samt i ett läge utan resonemang för arbetsflöden där hög genomströmning är viktig .
MiniMax lanserade H3 den 31 juli 2026 och beskriver modellen som ett allmänt multimodalt system. Den kan hantera text, bilder, video och ljud i ett gemensamt sammanhang . H3 genererar upp till 15 sekunder video i 2K-upplösning (2 560 × 1 440 pixlar) och 24 bilder per sekund, med stereoljud som skapas i samma inferenspass som videon .
Som referensmaterial kan en förfrågan innehålla upp till nio bilder, tre videoklipp och tre ljudspår samtidigt . MiniMax har lovat att släppa modellvikterna inom några dagar, även om de enligt tillgängliga uppgifter ännu inte var publicerade vid lanseringen . Det skulle innebära att en kinesisk videomodell med öppna vikter blir tillgänglig i ett område där många kommersiella konkurrenter fortfarande är proprietära.
MiniMax uppger dessutom att H3:s kostnad per sekund i 2K-upplösning är mindre än en tredjedel av priset hos etablerade konkurrenter .
ByteDance presenterade Seedance 2.5 vid konferensen Volcano Engine FORCE den 23 juni 2026 . Offentlig API-åtkomst öppnade den 16 juli 2026 .
Den största nyheten är möjligheten att skapa 30 sekunder video i en enda generering. Användaren behöver alltså inte först skapa flera kortare segment och sedan foga ihop dem . Upplösningen når upp till 4K (3 840 × 2 160 pixlar) med 10-bitars färgdjup .
Modellen kan ta emot upp till 50 multimodala referenser – exempelvis bilder, ljudklipp, 3D-blockmodeller, stilbilder och scenanvisningar. Det är en ökning från 12 referenser i den tidigare versionen .
ByteDance har också lagt till redigering på områdesnivå. Det gör det möjligt att ändra en specifik del av ett genererat klipp utan att behöva skapa om hela sekvensen . Företaget pekar bland annat på användning inom film, reklam, utbildning, industriell tillverkning och simulering för autonoma fordon .
De tre lanseringarna är inte en samlad händelse på ett enda datum, men de pekar i samma strategiska riktning:
Den ursprungliga beskrivningen placerade alla tre lanseringarna den 26 december 2024 och kopplade dem till bredare påståenden om att kinesiska öppna modeller stod för 41 procent av världens nedladdningar samt amerikanska anklagelser om modell-destillering. Det tillgängliga källmaterialet stöder inte det datumet eller de specifika siffrorna.
Påståendena kan ha blandats ihop med tidigare nyheter om exempelvis DeepSeek-V3 eller Qwen, men de går inte att verifiera genom de källor som ligger till grund för denna genomgång. Den säkrare slutsatsen är därför att de aktuella händelserna sträcker sig över flera månader under 2026, med två tunga lanseringsnyheter den 31 juli.
| Modell | Lanseringsdatum | Viktigaste specifikationer |
|---|---|---|
| DeepSeek V4-Flash | Förhandsversion: 24 april 2026; offentlig beta: 31 juli 2026 | 284 miljarder parametrar i MoE-modell, 13 miljarder aktiva; kontext på 1 miljon tokens; 0,14 dollar per miljon inmatningstokens |
| MiniMax H3 | 31 juli 2026 | Upp till 15 sekunder 2K-video; inbyggt stereoljud; modellvikter utlovade |
| ByteDance Seedance 2.5 | Presenterades 23 juni 2026; API den 16 juli 2026 | 30 sekunder i en enda generering; upp till 4K; 50 multimodala referenser |
DeepSeek V4-Flash, MiniMax H3 och Seedance 2.5 visar tillsammans hur den kinesiska AI-sektorn accelererade under mitten av 2026. Gemensamma nämnare är lägre kostnader, större användning av öppna modellvikter och betydligt längre och mer kontrollerbara genereringsförlopp.