O preço da API se estabilizou em US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída, com entrada em cache chegando a US$ 0,028 por milhão de tokens . Isso torna o V4-Flash uma das APIs de raciocínio de classe frontier mais baratas disponíveis — mais barata que o Gemini 2.5 Flash, que custa US$ 0,30/US$ 2,50 por milhão de tokens .
Uma versão "0731", retreinada e lançada em 31 de julho de 2026, é o beta público oficial da API. Esta versão supostamente supera o V4-Pro-Preview em benchmarks de agentes, marcando 82,7 no Terminal Bench 2.1 e 76,7 no Cybergym . O modelo suporta modos de raciocínio configuráveis (esforço de pensamento padrão, alto e máximo) juntamente com o modo "non-thinking" para pipelines de alto rendimento .
A MiniMax lançou o H3 em 31 de julho de 2026, posicionando-o como um modelo de geração multimodal de uso geral, capaz de processar texto, imagens, vídeo e áudio em um contexto unificado . O modelo gera até 15 segundos de vídeo em resolução 2K (2560×1440) a 24 fps com áudio estéreo nativo produzido na mesma passagem de inferência — sem a necessidade de um pipeline de áudio separado .
O H3 aceita até 9 imagens + 3 clipes de vídeo + 3 faixas de áudio como entradas de referência simultâneas . A MiniMax se comprometeu a liberar os pesos do modelo em poucos dias, estendendo a abordagem de código aberto para a geração de vídeo, onde a maioria dos concorrentes comerciais permanece proprietária . A empresa afirma que o custo por segundo do H3 em resolução 2K é menos de um terço dos principais concorrentes .
A ByteDance anunciou o Seedance 2.5 em sua conferência Volcano Engine FORCE em 23 de junho de 2026 , com o acesso público à API sendo aberto em 16 de julho de 2026 .
A principal atualização: geração de vídeo em passagem única de 30 segundos — entregando um clipe completo em uma geração contínua, sem a necessidade de emendar segmentos mais curtos . A resolução atinge até 4K (3840×2160) com profundidade de cor de 10 bits . O modelo aceita até 50 entradas de referência multimodal — imagens, clipes de áudio, modelos 3D, quadros de estilo e direção de cena — um aumento em relação aos 12 da versão anterior .
A ByteDance também lançou a edição em nível de região, permitindo que os usuários modifiquem áreas específicas de um clipe gerado sem regenerar a sequência inteira . As aplicações abrangem cinema, publicidade, educação, manufatura industrial e simulação de direção autônoma .
Esses três lançamentos, fortemente concentrados em 31 de julho de 2026, compartilham temas estratégicos comuns:
A formulação original sugeria que esses três lançamentos ocorreram em 26 de dezembro de 2024, juntamente com alegações mais amplas sobre modelos de código aberto chineses representando 41% dos downloads globais e alegações dos EUA sobre destilação de modelos. Os resultados de busca disponíveis não suportam nem a data de dezembro de 2024 nem essas estatísticas específicas. Essas alegações podem estar relacionadas a eventos anteriores do DeepSeek-V3 ou Qwen, mas esta análise não pôde verificá-las por meio das fontes fornecidas.
| Modelo | Data de Lançamento | Especificações Principais |
|---|---|---|
| DeepSeek V4-Flash | Prévia: 24 Abr 2026; Beta público: 31 Jul 2026 | 284B MoE (13B ativos), 1M de contexto, US$ 0,14/M tokens de entrada |
| MiniMax H3 | 31 Jul 2026 | 15s em 2K, áudio estéreo nativo, pesos abertos prometidos |
| ByteDance Seedance 2.5 | Anunciado: 23 Jun 2026; API: 16 Jul 2026 | 30s em passagem única, 4K, 50 entradas de referência multimodal |
Estes três modelos — DeepSeek V4-Flash, MiniMax H3 e ByteDance Seedance 2.5 — representam uma aceleração coordenada do setor de IA da China em meados de 2026, definida por custos mais baixos, distribuição de pesos abertos e capacidades de geração dramaticamente mais longas.