W oficjalnym API cena ustaliła się na 0,14 dolara za milion tokenów wejściowych i 0,28 dolara za milion tokenów wyjściowych. W przypadku trafień w pamięć podręczną koszt wejścia może spaść do 0,028 dolara za milion tokenów . To stawia V4-Flash w gronie najtańszych API dla zaawansowanych modeli rozumujących; dla porównania, Gemini 2.5 Flash wyceniano na 0,30 dolara za milion tokenów wejściowych i 2,50 dolara za milion tokenów wyjściowych .
31 lipca udostępniono ponownie wytrenowaną wersję „0731”, określaną jako oficjalna publiczna beta API. Według dostępnych raportów model przewyższa większy V4-Pro-Preview w testach zadań agentowych, uzyskując 82,7 punktu w Terminal Bench 2.1 i 76,7 punktu w Cybergym . Użytkownik może wybrać standardowy poziom rozumowania, wysoki lub maksymalny, a także tryb bez „myślenia”, przydatny w szybkich potokach przetwarzania .
MiniMax uruchomił model H3 31 lipca 2026 roku. Firma pozycjonuje go jako ogólny model generatywny, który potrafi wspólnie przetwarzać tekst, obrazy, wideo i dźwięk . H3 tworzy materiały o długości do 15 sekund, w rozdzielczości 2K — 2560 × 1440 pikseli — i przy 24 klatkach na sekundę. Dźwięk stereo powstaje w tym samym przebiegu inferencji co obraz, bez konieczności korzystania z osobnego generatora audio .
Model może przyjąć jednocześnie do 9 obrazów, 3 klipów wideo i 3 ścieżek audio jako materiały referencyjne . MiniMax zapowiedział udostępnienie wag H3 w ciągu kilku dni, z zastrzeżeniem zgodności z obowiązującymi przepisami . W praktyce oznacza to próbę przeniesienia modelu otwartych wag także do generowania wideo — obszaru, w którym wiele konkurencyjnych rozwiązań nadal pozostaje zamkniętych.
Firma twierdzi ponadto, że koszt każdej sekundy generowania w 2K jest niższy niż jedna trzecia kosztu głównych konkurentów . To deklaracja producenta, a nie niezależny pomiar, ale wpisuje się w szerszą strategię rywalizacji cenowej chińskich firm AI.
ByteDance zapowiedział Seedance 2.5 podczas konferencji Volcano Engine FORCE 23 czerwca 2026 roku . Publiczny dostęp do API otwarto 16 lipca .
Najważniejszą zmianą jest możliwość wygenerowania do 30 sekund obrazu i dźwięku w jednym ciągłym przebiegu. Model nie musi więc łączyć kilku krótszych segmentów, aby uzyskać pełny klip . Według opisu produktu rozdzielczość sięga 4K, czyli 3840 × 2160 pikseli, przy 10-bitowej głębi koloru .
Seedance 2.5 obsługuje do 50 multimodalnych materiałów referencyjnych: między innymi obrazów, klipów audio, modeli 3D, plansz stylu i wskazówek dotyczących sceny. To wyraźny wzrost względem poprzedniej wersji, która przyjmowała do 12 takich elementów .
ByteDance dodał także edycję na poziomie regionu. Użytkownik może zmienić konkretny obszar wygenerowanego klipu bez konieczności tworzenia całej sekwencji od początku . Firma wskazuje zastosowania między innymi w filmie, reklamie, edukacji, produkcji przemysłowej i symulacjach dla pojazdów autonomicznych .
DeepSeek V4-Flash został wyceniony znacznie niżej niż wiele zachodnich modeli rozumujących . MiniMax deklaruje z kolei, że H3 kosztuje mniej niż jedną trzecią ceny głównych konkurentów w przeliczeniu na sekundę materiału 2K . Jeśli podobna polityka utrzyma się na większą skalę, może obniżyć próg wejścia dla firm budujących aplikacje AI.
DeepSeek V4-Flash udostępniono na licencji MIT, a MiniMax zapowiedział publikację wag H3 . Nie oznacza to, że oba modele są już dostępne na identycznych zasadach ani że wagi H3 były dostępne w dniu premiery. Pokazuje jednak kierunek odmienny od strategii wielu zamkniętych generatorów wideo: deweloperzy mają otrzymać możliwość pobierania i dostosowywania podstawowego systemu.
V4-Flash oferuje milion tokenów kontekstu . Seedance 2.5 przyjmuje do 50 materiałów referencyjnych , natomiast H3 łączy tekst, obrazy, wideo i audio w jednym przepływie generowania . Dla twórców i zespołów produktowych oznacza to mniej etapów pośrednich oraz większą kontrolę nad wynikiem.
Materiały źródłowe nie potwierdzają daty 26 grudnia 2024 roku. Nie potwierdzają także konkretnych twierdzeń, że chińskie modele otwarte odpowiadały za 41 proc. globalnych pobrań ani że w tym samym okresie pojawiły się określone zarzuty amerykańskich urzędników dotyczące destylacji modeli. Takie informacje mogą odnosić się do wcześniejszych wydarzeń związanych z DeepSeek-V3 lub Qwenem, ale nie da się ich zweryfikować na podstawie dostarczonych źródeł.
| Model | Data | Najważniejsze informacje |
|---|---|---|
| DeepSeek V4-Flash | Zapowiedź: 24 kwietnia 2026; publiczna beta: 31 lipca 2026 | 284 mld parametrów MoE, 13 mld aktywnych, milion tokenów kontekstu, 0,14 dolara za milion tokenów wejściowych |
| MiniMax H3 | 31 lipca 2026 | Do 15 sekund wideo 2K, natywny dźwięk stereo, zapowiedziane otwarte wagi |
| ByteDance Seedance 2.5 | Zapowiedź: 23 czerwca 2026; API: 16 lipca 2026 | Do 30 sekund w jednym przebiegu, rozdzielczość do 4K, 50 multimodalnych materiałów referencyjnych |
Najtrafniej opisywać te wydarzenia nie jako jedną premierę z grudnia 2024 roku, lecz jako falę rozwoju chińskiego AI w połowie 2026 roku. Jej wspólnymi elementami są agresywne ceny, coraz szersza multimodalność i przesuwanie granicy między zamkniętymi usługami a modelami, których wagi mogą zostać udostępnione społeczności.