O V4 Flash é a versão voltada à eficiência dentro da família DeepSeek V4. A proposta é atender tarefas de alto volume e baixa latência — como programação, classificação, extração de dados, chat e automação — sem abrir mão de uma janela de contexto extremamente extensa.
Em um modelo MoE, os parâmetros totais funcionam como uma grande rede de especialistas, mas apenas parte deles é acionada para cada token. Por isso, embora o V4 Flash tenha 284 bilhões de parâmetros no total, o custo computacional de cada etapa é associado aos cerca de 13 bilhões ativados naquele momento .
| Característica | Especificação |
|---|---|
| Parâmetros totais | 284 bilhões |
| Parâmetros ativos | 13 bilhões por token |
| Arquitetura | Mixture of Experts (MoE) |
| Janela de contexto | 1 milhão de tokens |
| Saída máxima | 384 mil tokens |
| Precisão | FP4 + FP8, em formato misto |
| Licença | MIT |
| Tamanho aproximado para download | 160 GB |
A versão de produção V4-Flash-0731 substitui a versão de prévia. Segundo os relatos sobre o lançamento, o tamanho e a arquitetura foram mantidos; os ganhos de desempenho vieram principalmente de uma nova etapa de pós-treinamento .
O V4 Flash e o V4 Pro foram disponibilizados com licença MIT, uma das licenças permissivas mais usadas no software. Na prática, ela permite modificar, distribuir e usar os pesos em produtos comerciais, sem cobrança de royalties, observadas as condições da própria licença .
Os pesos estão disponíveis em plataformas como o Hugging Face e podem ser hospedados em infraestrutura própria. Isso dá às empresas a opção de operar o modelo em ambiente privado, em vez de enviar todos os dados para uma API externa.
Ainda assim, “pesos abertos” não significa que a implantação seja simples ou barata. O arquivo do modelo tem cerca de 160 GB na versão quantizada, e uma configuração capaz de sustentar o contexto completo de 1 milhão de tokens exige hardware de alto desempenho. Uma estimativa de implantação em FP8 aponta para quatro GPUs NVIDIA H200 SXM5, com 564 GB de VRAM combinada, para operar com o contexto máximo .
O V4 Flash combina duas técnicas de atenção comprimida para reduzir o custo de processar sequências muito longas:
As camadas alternam entre os dois mecanismos. As camadas CSA preservam uma seleção mais detalhada do contexto, enquanto as camadas HCA armazenam uma visão muito mais compacta das partes antigas da sequência. Ao mesmo tempo, uma janela deslizante com os 128 tokens mais recentes mantém o foco nas informações imediatas .
O resultado é uma tentativa de resolver um dos principais gargalos dos modelos com contexto longo: não basta aceitar uma entrada de 1 milhão de tokens; é preciso processá-la sem que memória e latência tornem a operação inviável.
O checkpoint do V4 Flash usa diferentes níveis de precisão conforme o componente do modelo:
nvidia/DeepSeek-V4-Flash-NVFP4 .Em FP8, os pesos do modelo completo somariam aproximadamente 284 GB, antes de considerar a memória adicional necessária para o cache de atenção e a execução. A precisão mista ajuda a reduzir o espaço ocupado, mas não transforma o V4 Flash em um modelo trivial para rodar localmente.
O modelo expõe o parâmetro configurável reasoning_effort, que permite escolher quanto processamento deve ser dedicado a uma resposta. A documentação e as implementações disponíveis descrevem três modos :
Essa configuração permite trocar velocidade por profundidade conforme o caso de uso. Uma aplicação de triagem pode priorizar latência, enquanto um agente de programação pode optar por um modo mais cuidadoso.
A API do DeepSeek V4 Flash custa:
O preço de entrada com cache representa uma redução de 98% em relação à tarifa sem cache . Isso pode ser especialmente relevante para aplicações que repetem instruções de sistema, exemplos ou prefixos longos em muitas chamadas.
Na comparação citada por fontes do setor, a saída do V4 Flash é 54 vezes mais barata que a do Sonnet 4.6, a US$ 15 por milhão de tokens, e 107 vezes mais barata que a do GPT-5.5, a US$ 30 . Por isso, diferentes análises o descrevem como uma das APIs de capacidade de fronteira mais baratas disponíveis .
O preço baixo não elimina outros custos: empresas ainda precisam considerar armazenamento, GPUs, observabilidade, segurança, limites de concorrência e o trabalho de integrar o modelo ao produto.
A atualização de 31 de julho trouxe ganhos importantes em tarefas de programação e uso de ferramentas. De acordo com o registro oficial citado nas reportagens, o V4-Flash-0731 alcançou os seguintes resultados :
A DeepSeek afirma que a versão de produção apresenta desempenho comparável ao do V4 Pro em benchmarks de programação e tarefas agentivas . Isso enfraquece a distinção tradicional segundo a qual a versão “Pro” seria sempre a escolha para trabalhos mais sofisticados, enquanto a “Flash” ficaria restrita a tarefas simples .
Os materiais analisados, porém, não confirmam uma pontuação específica do V4-Flash-0731 no SWE-bench . Portanto, comparações mais amplas com outros modelos de programação devem ser tratadas com cautela até que sejam publicados resultados diretamente comparáveis.
A segunda novidade é o DeepSeek Harness, um framework de execução que fica ao redor do modelo e ajuda a administrar contexto, acionar ferramentas e conduzir tarefas de várias etapas .
A diferença é importante: um modelo de linguagem gera respostas, mas um harness pode organizar um fluxo de trabalho completo. Ele pode, por exemplo, decidir quando consultar um arquivo, chamar uma ferramenta, avaliar o resultado e tentar novamente antes de concluir uma tarefa.
O nome DeepSeek Harness apareceu no changelog do V4-Flash-0731 com a indicação de que seria lançado em breve . Em 1º de agosto de 2026, a empresa começou a recrutar desenvolvedores de projetos open source para uma beta fechada . Os candidatos precisam ter experiência com projetos relacionados a Agent Harness e enviar seu ID do GitHub acompanhado de trabalhos representativos .
Cui Tianyi lidera a equipe do Harness. As fontes indicam que o time foi criado em março de 2026, quando Cui entrou na DeepSeek . A data de lançamento público do framework ainda não foi confirmada .
O V4 Flash mostra uma estratégia centrada em três elementos: capacidade, custo baixo e abertura dos pesos. A combinação de preços de US$ 0,14/US$ 0,28 por milhão de tokens com a licença MIT torna mais barato experimentar agentes, automações e aplicações de alto volume .
Essa abordagem é associada à visão do CEO Liang Wenfeng de que modelos baratos e capazes podem contribuir para o desenvolvimento da inteligência artificial geral. As fontes reunidas não apresentam, contudo, uma declaração direta de Liang sobre essa estratégia; o preço e o modelo de distribuição são os sinais operacionais mais claros dessa direção .
A empresa compete na China com nomes como Alibaba, dona da família Qwen, ByteDance, com o Doubao, Moonshot AI, MiniMax e Z.AI . Dentro dessa disputa, a família V4 se diferencia por oferecer pesos abertos sob uma licença MIT permissiva e uma janela de contexto de 1 milhão de tokens .
Também há relatos sobre preparativos para uma possível abertura de capital da DeepSeek, mas não foram confirmados uma data, os bancos coordenadores ou detalhes de um processo formal .
Alguns pontos continuam sem verificação independente nas fontes analisadas:
Por enquanto, o fato mais concreto é a combinação de um modelo MoE de grande escala, uma licença permissiva, contexto de 1 milhão de tokens e preços agressivos com uma nova camada de software para agentes. Se o DeepSeek Harness cumprir o que a empresa está testando, a disputa deixará de ser apenas sobre qual modelo responde melhor — e passará também a envolver qual plataforma consegue executar mais tarefas pelo menor custo.