Вартість API становить $0,14 за мільйон вхідних токенів і $0,28 за мільйон вихідних токенів. Для кешованих вхідних даних ціна може знижуватися до $0,028 за мільйон токенів . Це робить V4-Flash однією з найдешевших API-моделей передового рівня для завдань, що потребують міркування: за ціною вона випереджає, зокрема, Gemini 2.5 Flash, де вхід коштує $0,30, а вихід — $2,50 за мільйон токенів .
Перенавчена збірка «0731», оприлюднена 31 липня 2026 року, стала офіційною публічною бета-версією API. За повідомленнями, вона перевершує більшу V4-Pro-Preview у тестах агентних можливостей: 82,7 бала в Terminal Bench 2.1 і 76,7 — у Cybergym .
Модель підтримує налаштування глибини міркування — стандартний, високий і максимальний режими — а також режим без міркування для конвеєрів із великою кількістю запитів .
MiniMax запустила H3 31 липня 2026 року, позиціонуючи її як універсальну мультимодальну генеративну модель, що працює з текстом, зображеннями, відео й аудіо в єдиному контексті .
H3 здатна створювати відео тривалістю до 15 секунд у роздільній здатності 2K — 2560×1440 пікселів — при 24 кадрах на секунду. Стереозвук генерується в тому самому проході, що й відео, тому окремий аудіоконвеєр не потрібен .
Модель може одночасно приймати до 9 зображень, 3 відеокліпів і 3 аудіодоріжок як референси . MiniMax заявила, що планує оприлюднити ваги моделі протягом кількох днів. Якщо обіцянку буде виконано, це стане поширенням підходу з відкритими вагами на сферу генерації відео, де багато відомих конкурентів досі залишаються закритими .
Компанія також стверджує, що вартість секунди відео H3 у 2K становить менш як третину від ціни основних конкурентів . Водночас на момент запуску йшлося саме про майбутнє оприлюднення ваг, а не про їхню вже доступну публікацію .
ByteDance анонсувала Seedance 2.5 на конференції Volcano Engine FORCE 23 червня 2026 року . Публічний доступ до API відкрили 16 липня 2026 року .
Головне оновлення — можливість генерувати 30-секундний відеокліп за один прохід. Модель створює весь ролик без необхідності зшивати кілька коротших сегментів . Максимальна заявлена роздільна здатність — 4K, або 3840×2160 пікселів, із 10-бітною глибиною кольору .
Seedance 2.5 приймає до 50 мультимодальних референсів: зображення, аудіокліпи, 3D-білі моделі, стильові кадри та вказівки щодо сцени. У попередній версії ліміт становив 12 референсів .
ByteDance також додала редагування на рівні окремих ділянок кадру. Це дає змогу змінити конкретну область готового кліпу, не перегенеровуючи всю послідовність . Серед заявлених сфер застосування — кіно, реклама, освіта, промислове виробництво та симуляції для автономного водіння .
Три запуски, особливо щільно згруповані навколо 31 липня 2026 року, демонструють кілька спільних тенденцій китайського AI-ринку.
Початкове формулювання пов’язувало ці три релізи з 26 грудня 2024 року, а також містило ширші твердження про те, що китайські open-source-моделі становлять 41% глобальних завантажень, і про звинувачення американських посадовців у дистиляції моделей.
Надані результати пошуку не підтверджують ані дату грудня 2024 року, ані зазначену статистику чи конкретні звинувачення. Ці твердження можуть стосуватися попередніх подій навколо DeepSeek-V3 або Qwen, однак у межах доступних джерел їх перевірити не вдалося.
| Модель | Дата запуску | Ключові характеристики |
|---|---|---|
| DeepSeek V4-Flash | Попередня версія: 24 квітня 2026 року; публічна бета-версія: 31 липня 2026 року | MoE на 284 млрд параметрів, 13 млрд активних; контекст 1 млн токенів; $0,14 за мільйон вхідних токенів |
| MiniMax H3 | 31 липня 2026 року | До 15 секунд відео у 2K; вбудований стереозвук; відкриті ваги обіцяні після запуску |
| ByteDance Seedance 2.5 | Анонс: 23 червня 2026 року; API: 16 липня 2026 року | До 30 секунд відео за один прохід; 4K; до 50 мультимодальних референсів |
DeepSeek V4-Flash, MiniMax H3 і ByteDance Seedance 2.5 не були одночасними релізами 2024 року. Це окремі запуски впродовж кількох місяців 2026-го, які разом показують спільний напрям розвитку китайського AI-сектору: нижчу собівартість, відкриті ваги, довший контекст і значно тривалішу генерацію відео.