O DeepSeek V4.1 Flash aceita até 1 milhão de tokens de contexto, mas esse limite não garante que ele recuperará com precisão qualquer detalhe de uma sessão longa. Segundo a DeepSeek, o cache KV global ocupa 890 bytes por token, cerca de um quarto do tamanho registrado no V4 Flash; isso não equivale a uma redução de...
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Para um agente de IA que consulta um histórico extenso antes de dar uma resposta curta, não basta aceitar mais texto: é preciso processá-lo e manter informações da conversa em memória. O DeepSeek-V4.1-Flash foi projetado para esse tipo de uso. É um modelo multimodal de mistura de especialistas (MoE), com pesos publicados e suporte a contextos de até 1 milhão de tokens. Esse é um limite de entrada, não uma promessa de que o modelo encontrará corretamente qualquer detalhe espalhado pela sessão. 2
8
A estrutura principal do modelo tem 552 bilhões de parâmetros e 40 camadas: 20 em um codificador causal e 20 em um decodificador. O cache de chaves e valores, ou cache KV — dados guardados para evitar refazer parte do processamento do histórico —, é projetado a partir dos estados finais do codificador, em vez de ser produzido separadamente por cada camada do decodificador. 2
8
Segundo a DeepSeek, o modelo ativa cerca de 8 bilhões de parâmetros por token na fase de leitura da entrada (prefill) e 16 bilhões na geração da resposta (decode). A diferença favorece tarefas em que o agente recebe muito mais conteúdo do que produz, sem significar que uma sessão de 1 milhão de tokens terá desempenho ou custo idênticos em qualquer infraestrutura. 2
8
A técnica Compressed Sparse Attention 2 (CSA2) atribui às camadas de atenção um de três modos fixos — Full, Reindex ou Reuse — para compartilhar dados do cache e reaproveitar seleções de atenção. Com o armazenamento do cache KV principal em FP4, a DeepSeek informa um cache KV global de 890 bytes por token, cerca de um quarto do registrado no V4-Flash. A comparação é sobre a memória ocupada por esse cache, não sobre o custo total de operação. 6
8
Há ainda o SWA Bounded Replay: em vez de manter em SSD certos estados de atenção de janela deslizante, o sistema os reconstrói reprocessando apenas a janela mais recente de tokens. A documentação do modelo estima que, com essa abordagem, o cache KV persistente ocupa aproximadamente um oitavo do equivalente no V4-Flash. Trata-se de uma medida de armazenamento persistente, distinta da redução para um quarto no cache KV global. 5
9
Uma ficha do modelo descreve treinamento do zero em um conjunto multimodal de 45 trilhões de tokens, treinamento de atenção esparsa com sequências de 64 mil tokens e ampliação do contexto para 1 milhão de tokens quando o treinamento havia alcançado 34 trilhões de tokens. A DeepSeek também atribui avanços a novos métodos de pré-treinamento e a um pós-treinamento mais amplo com aprendizado por reforço, sem que o material citado detalhe essa receita. 9
16
O modelo processa texto e imagens nativamente, e a DeepSeek informa que a versão oferecida por API inclui suporte multimodal. Os trechos citados, porém, não permitem avaliar em detalhe seu desempenho em testes de visão. 2
16
Nas avaliações da própria DeepSeek, a versão base apresentou desempenho comparável ao V4-Pro-Base em conhecimento, raciocínio e programação, com ganhos de 5% a 10% em avaliações reservadas para teste, usando cerca de um terço dos parâmetros totais e um quarto dos parâmetros ativados. A empresa também afirma que o modelo lançado supera o V4-Pro em tarefas de agentes, mas o material citado não sustenta uma comparação confiável, teste por teste. São resultados divulgados pela empresa, não uma avaliação independente. 1
16
Na API da DeepSeek, o nome do modelo é deepseek-flash. Os pesos publicados são listados sob licença MIT; os materiais do modelo descrevem uma opção de execução com SGLang, e fichas também apontam suporte de inferência com Transformers e vLLM. Antes de implantar o modelo, vale conferir quais recursos multimodais e de contexto longo cada ambiente de execução oferece. 8
9
16
Segundo a DeepSeek, V4-Flash e V4-Flash-Vision-Exp foram descontinuados, e seus antigos nomes na API passaram a encaminhar temporariamente as requisições ao V4.1-Flash. A empresa também anunciou que, a partir de 14 de setembro de 2026, chamadas a deepseek-v4-pro seriam direcionadas ao V4.1-Flash com preços da linha Flash, enquanto se aguarda o V4.1-Pro. Quem depende de um comportamento específico do Pro deve verificar qual modelo atende às chamadas, em vez de confiar apenas no nome usado na requisição. 16
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O DeepSeek V4.1 Flash aceita até 1 milhão de tokens de contexto, mas esse limite não garante que ele recuperará com precisão qualquer detalhe de uma sessão longa.
O DeepSeek V4.1 Flash aceita até 1 milhão de tokens de contexto, mas esse limite não garante que ele recuperará com precisão qualquer detalhe de uma sessão longa. Segundo a DeepSeek, o cache KV global ocupa 890 bytes por token, cerca de um quarto do tamanho registrado no V4 Flash; isso não equivale a uma redução de 75% no custo total de uso.
O modelo está disponível na API como deepseek flash. Os ganhos de desempenho divulgados são resultados reportados pela DeepSeek, não uma comparação independente.