Uma formulação cuidadosa seria:
O DeepSeek V4 usa Hybrid Attention, Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA) para reduzir bastante o custo de KV cache em inferência de contexto longo. Isso não comprova que a VRAM total necessária para rodar o modelo caia 98% .
Essa distinção é importante para quem precisa comprar GPU, dimensionar instância em nuvem ou estimar custo de serving. O KV cache pode ser um gargalo enorme em modelos de linguagem com janelas longas, mas ele não é a única coisa que ocupa memória na GPU.
A página oficial de notícias da API da DeepSeek lista o DeepSeek-V4 Preview como lançado em 24/04/2026 . O model card do DeepSeek V4 informa que a família inclui DeepSeek-V4-Pro e DeepSeek-V4-Flash, descrevendo o V4 como uma série de modelos de linguagem Mixture-of-Experts (MoE) que mantém o framework DeepSeekMoE e a estratégia Multi-Token Prediction (MTP), ao mesmo tempo em que introduz mudanças como a Hybrid Attention Architecture .
A parte diretamente relacionada a “economizar memória” está no tratamento de attention em contexto longo. Um artigo técnico da NVIDIA descreve a Compressed Sparse Attention (CSA) como um mecanismo que usa compressão dinâmica de sequência para comprimir entradas de KV e reduzir a pegada de memória do KV cache; depois, aplica DeepSeek Sparse Attention (DSA) para tornar as matrizes de attention mais esparsas e diminuir o custo computacional . A Heavily Compressed Attention (HCA) vai além: consolida entradas de KV de conjuntos de tokens em uma única entrada comprimida, reduzindo ainda mais o tamanho do KV cache .
Em outras palavras: a evidência pública sustenta que o DeepSeek V4 foi desenhado para diminuir KV cache size e custo de attention em contextos longos. Isso não equivale a uma promessa oficial de que todo o consumo de VRAM caia na mesma proporção.
O número 98% aparece de forma mais direta em um artigo gerado por usuário no LinkedIn, cujo título afirma que o DeepSeek Sparse Attention reduz a memória de KV em 98% em serving real . Esse tipo de publicação pode servir como pista para investigação, mas não deve ser tratado como especificação oficial da DeepSeek.
Um número mais fácil de conferir em reportagem de terceiros é 10% de KV cache. A Wccftech noticiou que, em comparação com o DeepSeek V3.2, o DeepSeek V4 exigiria 27% dos FLOPs de inferência single-token e 10% do key-value (KV) cache . Lido literalmente, 10% de KV cache significa uma redução de cerca de 90% no cache — mas o comparativo é contra o V3.2 e não diz, por si só, que todas as janelas de contexto, batches, configurações de hardware ou toda a VRAM cairão 90% .
Também há manchete falando em 9,5x menos requisitos de memória . Mesmo na conta direta, 1/9,5 deixa cerca de 10,5% da necessidade original, ou seja, algo próximo de 89,5% de redução. Isso ainda não é 98% e, mais importante, ainda exige confirmar o escopo: KV cache? contexto de 1 milhão de tokens? implantação completa? um benchmark específico?
| Afirmação | Estado da evidência | Leitura mais prudente |
|---|---|---|
| VRAM total 98% menor | Não aparece como especificação oficial nos materiais citados | Não usar em proposta comercial, compra de hardware ou marketing técnico |
| KV cache fortemente comprimido | Há descrição técnica consistente | CSA/HCA comprimem entradas de KV em contexto longo |
| 10% de KV cache | Reportagem de terceiro | Sugere cerca de 90% menos KV cache versus V3.2, não 90% menos VRAM total |
| 9,5x menos memória | Manchete de terceiro | Aproxima 89,5% de redução, mas o escopo precisa ser verificado |
O KV cache guarda informações de tokens anteriores para que o modelo consiga continuar calculando attention sem recomputar tudo do zero. Em contextos longos, ele cresce e pode virar um dos maiores gargalos de inferência.
A Hugging Face descreve bem esse problema em workloads agentic longos: resultados de ferramentas são adicionados ao contexto, e cada token subsequente paga custo de attention contra o histórico que veio antes; dois números passam a importar muito, os FLOPs de inferência single-token e o tamanho do KV cache, ambos crescendo com o comprimento da sequência . A versão do texto no GitHub também aponta falhas típicas desses fluxos: o trace ultrapassa o orçamento de contexto, o KV cache enche a GPU ou as idas e vindas de chamadas de ferramentas degradam a tarefa no meio do caminho .
Mas a memória total de uma implantação não é só KV cache. Mesmo o artigo do LinkedIn que populariza a tese dos 98% separa itens como pesos compartilhados, pesos de especialistas em MoE, ativações, KV cache e overhead de framework . Essa divisão é justamente o ponto: se o KV cache cai muito em um cenário específico, isso não autoriza concluir que todos os outros componentes cairão na mesma proporção.
O que torna o DeepSeek V4 interessante é a direção técnica. Ele mira um dos custos mais difíceis de modelos com janelas muito longas: attention e memória de KV em sequências enormes. Segundo a NVIDIA, a CSA comprime entradas de KV e esparsifica matrizes de attention; a HCA aplica uma compressão mais agressiva ao consolidar entradas de KV de múltiplos grupos de tokens .
O relatório técnico do DeepSeek V4 também menciona otimizações de infraestrutura para treino e inferência, incluindo um kernel único e fundido para módulos MoE, projetado para sobrepor computação, comunicação e acesso à memória . São melhorias relevantes. O que elas não fazem, sozinhas, é transformar a frase “98% menos memória total” em fato comprovado.
Se a sua pergunta é se o DeepSeek V4 serve para documentos longos, conversas extensas ou agentes que acumulam muitos resultados de ferramentas, a métrica certa não é uma manchete de 98%. A pergunta operacional é: o seu gargalo é realmente o KV cache?
Para uma avaliação séria, rode benchmarks com o seu tamanho de contexto, batch size, concorrência, engine de serving e hardware. Se o limite principal for KV cache em contexto longo, as técnicas de compressão do V4 podem ser valiosas . Se o gargalo estiver em pesos do modelo, ativações, overhead do framework, paralelismo ou estratégia de concorrência, uma redução no KV cache não se traduz automaticamente na mesma economia de VRAM total .
A conclusão, por enquanto, é simples: o DeepSeek V4 tem evidência pública forte de otimização de KV cache em contexto longo. Já a frase “98% menos memória” é ampla demais para ser usada como fato técnico sem qualificar exatamente o que foi medido .