Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash; cada imagem é limitada a 384 tokens de entrada e cobrada pela tarifa do Flash. As imagens podem ser enviadas em Base64, por URL pública ou pela Files API gratuita, que permite reutilizar o mesmo arquivo por m...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A DeepSeek lançou, em 21 de agosto de 2026, o deepseek-v4-flash-vision-exp, uma versão experimental do V4-Flash capaz de receber imagens junto com texto pela API. A novidade permite que agentes analisem capturas de tela, interfaces, gráficos e outros estados visuais sem migrar necessariamente para um modelo multimodal de preço premium. 114
O principal destaque está no custo: cada imagem é convertida em no máximo 384 tokens de entrada e cobrada pela tarifa normal do V4-Flash. A empresa também afirma que o desempenho do modelo em agentes visuais já se aproxima do Claude Opus 4.8 — uma comparação baseada em resultados divulgados pela própria DeepSeek e ainda sem confirmação independente. 319
O modelo é acessado pelo identificador deepseek-v4-flash-vision-exp. Ele combina entradas de texto e imagem, mantendo a base de geração de texto, uso de ferramentas e agentes da família V4-Flash. A integração está disponível nos formatos Chat Completions, Messages e Responses. 412
Na prática, isso permite criar um ciclo de agente mais próximo do uso real de um computador: o sistema examina uma captura de tela, decide o próximo passo, aciona uma ferramenta e analisa novamente o resultado. Entre as demonstrações relatadas estão a geração de código executável a partir de capturas de tela e o uso de entradas visuais em fluxos de criação de jogos. 510
Os desenvolvedores podem fornecer imagens de três maneiras:
file_id retornado. 6714A Files API não tem custo de uso e é especialmente útil quando a aplicação precisa consultar repetidamente a mesma imagem. Ao reutilizar a referência do arquivo, o sistema evita reenviar os mesmos dados a cada chamada, reduzindo o tráfego em fluxos recorrentes de agentes. 112
Segundo a DeepSeek, cada imagem é tokenizada para fins de cobrança em no máximo 384 tokens de entrada. Esses tokens seguem a tarifa comum do V4-Flash, sem uma sobretaxa específica para visão. 3614
Uma tabela de preços publicada lista, para o modelo de visão, US$ 0,44 por milhão de tokens de entrada não armazenados em cache e US$ 1,32 por milhão de tokens de saída nos períodos de pico. A mesma tabela informa uma janela de contexto de 1 milhão de tokens e uma saída máxima de 384 mil tokens. 1
Relatos descrevem o limite de 384 tokens como inferior a metade do consumo atribuído a algumas comparações com modelos GPT e Claude. A comparação, porém, deve ser vista como uma indicação de direção, não como um benchmark totalmente padronizado: as fontes fornecidas não comprovam versões idênticas dos modelos, resoluções iguais ou as mesmas premissas de cobrança. 327
O efeito prático é mais claro. Um agente que verifica muitas capturas de tela pode ter um custo de entrada visual previsível e relativamente baixo, sem precisar usar um modelo multimodal premium a cada observação.
A DeepSeek afirma que o novo modelo preserva as capacidades textuais do V4-Flash, incluindo raciocínio, conhecimento geral e funções de agente, enquanto acrescenta a entrada visual. 626
A empresa também divulgou uma melhora expressiva em benchmarks de agentes multimodais e disse que o desempenho se aproximou do Claude Opus 4.8. Algumas tabelas publicadas colocam o modelo perto do Opus 4.8 em tarefas selecionadas, mas os resultados variam conforme o benchmark. 4192123
Essa ressalva é importante. A frase “próximo do Opus 4.8” deve ser interpretada, neste momento, como uma alegação baseada nas avaliações da DeepSeek — não como prova de equivalência entre os modelos em todos os fluxos de agentes visuais. Testes independentes ainda serão necessários para medir confiabilidade, precisão visual e desempenho no uso de ferramentas fora do ambiente avaliado pela empresa.
Antes de colocar o modelo em um fluxo visual de produção, os desenvolvedores devem testar as configurações de raciocínio. Um teste prático relatado indicou que os tokens de pensamento podem consumir todo o orçamento de conclusão, deixando a resposta visível vazia. A recomendação apresentada foi desativar o modo de pensamento em tarefas visuais relevantes ou aumentar max_tokens para reservar espaço para a resposta. 27
Esse é um alerta de integração, não uma conclusão geral sobre a capacidade do modelo. Quando o raciocínio estiver ativado, a aplicação deve reservar tokens suficientes tanto para o processamento interno quanto para a resposta destinada ao usuário. Também é importante confirmar os parâmetros e o comportamento atuais na documentação da API da DeepSeek antes de depender de uma configuração específica.
As fontes fornecidas não trazem uma explicação estratégica formal da DeepSeek. Ainda assim, o desenho do produto aponta para um objetivo evidente: tornar a percepção visual barata o bastante para ser usada repetidamente por agentes. Capturas de tela, telas de jogos, painéis e estados de aplicativos só são realmente úteis quando o agente pode examiná-los com frequência sem tornar cada ciclo caro demais.
Ao lançar a visão como uma variante experimental do Flash, a DeepSeek também permite que desenvolvedores acrescentem entrada de imagem a fluxos de agentes e chamadas de ferramentas já baseados em uma API de menor custo. Isso evita, em tese, a migração completa para uma camada multimodal premium e torna o modelo relevante para agentes que operam por telas, ferramentas de conversão de captura de tela em código e aplicações que precisam de retorno visual frequente.
O balanço inicial é direto: o DeepSeek V4-Flash-Vision-Exp oferece um limite declarado de tokens por imagem incomumente baixo e formas flexíveis de ingestão. Ao mesmo tempo, suas alegações de desempenho e seu comportamento em produção ainda precisam ser testados. Para começar, a abordagem mais segura é usar capturas de tela realistas, definir explicitamente o orçamento de saída e comparar a qualidade com avaliações independentes.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash; cada imagem é limitada a 384 tokens de entrada e cobrada pela tarifa do Flash.
Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash; cada imagem é limitada a 384 tokens de entrada e cobrada pela tarifa do Flash. As imagens podem ser enviadas em Base64, por URL pública ou pela Files API gratuita, que permite reutilizar o mesmo arquivo por meio de um file id em várias solicitações.
O modelo mantém a base de texto, raciocínio e uso de ferramentas do V4 Flash, mas desenvolvedores devem controlar o orçamento de saída: testes relatados indicaram que o modo de pensamento pode consumir toda a resposta.