Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash e, segundo uma comparação publicada pela própria empresa, superou o Claude Opus 4.8 em 3 de 11 benchmarks — s... O modelo é acessado pelo identificador deepseek v4 flash vision exp; cada imagem representa no m...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
O DeepSeek-V4-Flash-Vision-Exp é uma extensão multimodal experimental do modelo V4-Flash. Disponibilizado em 21 de agosto de 2026, ele mantém os recursos de texto, raciocínio e agentes da família V4-Flash e acrescenta a capacidade de interpretar imagens pela API da DeepSeek.
A proposta é oferecer uma forma relativamente barata de colocar visão em agentes de IA — capazes de analisar uma imagem, tomar uma decisão e, quando necessário, chamar ferramentas. A comparação da DeepSeek com o Claude Opus 4.8 chama atenção, mas os principais resultados publicados ainda vêm da própria empresa. Isso torna o lançamento relevante para desenvolvedores e para a disputa entre modelos, sem comprovar uma equivalência ampla com o modelo de ponta da Anthropic.
A principal novidade é a entrada visual. O desenvolvedor pode enviar texto e imagens na mesma solicitação, permitindo que o agente interprete fotografias, capturas de tela, gráficos, documentos e outros conteúdos visuais compatíveis antes de responder ou executar uma ação.
O identificador usado nas chamadas da API é:
deepseek-v4-flash-vision-expA DeepSeek afirma que o modelo preserva as capacidades de texto do V4-Flash, incluindo raciocínio, agentes e conhecimento geral. O changelog oficial lista, entre outros resultados, 83,9 no Terminal Bench 2.1, 59,3 no DeepSWE e 63,6 no DSBench-Hard.
Na prática, o Vision-Exp não é apresentado apenas como um sistema de descrição de imagens. A ideia é ampliar um modelo de texto e agentes para fluxos em que a IA precisa entender o que aparece na tela ou dentro de um arquivo visual.
A DeepSeek diz que o Vision-Exp se aproxima do Claude Opus 4.8 em benchmarks de agentes multimodais, mantendo o desempenho textual do V4-Flash. Na comparação publicada pela empresa e repercutida pelo The Next Web, o modelo da DeepSeek ficou à frente em 3 dos 11 benchmarks listados.
O resultado precisa ser interpretado com cautela. A expressão “próximo do Opus 4.8” descreve o desempenho em um conjunto de avaliações selecionado pela própria DeepSeek; não demonstra qualidade equivalente em todas as tarefas visuais, cargas de programação ou sessões longas com agentes.
Entre os resultados divulgados no changelog oficial estão 36,5 no ApexBench, 27,3 no Agents’ Last Exam, 64,3 no Chartography e 35,0 no ZeroBench Pass@5.
Esses números também não respondem a questões importantes de produção. Os resultados podem variar conforme os prompts, o ambiente de ferramentas, a seleção das tarefas, a latência, o tratamento de falhas e a metodologia de avaliação. Com o material disponível, ainda não há evidências independentes suficientes para tratar a comparação como um ranking definitivo de modelos.
Para aplicações predominantemente textuais, a principal alegação é de continuidade, não de domínio claro sobre modelos de categoria superior. A DeepSeek posiciona o Vision-Exp como um modelo que mantém as capacidades textuais do V4-Flash, permitindo ganhar entrada de imagens sem abrir mão do comportamento já associado a raciocínio e agentes.
Isso ajuda a definir os casos de uso:
O Vision-Exp está disponível na plataforma de API da DeepSeek. O lançamento oferece suporte a Chat Completions, Messages e Responses, incluindo entradas combinadas de texto e imagem.
Há três formas documentadas de enviar uma imagem:
file_id correspondente a uma imagem enviada pela Files API.Os formatos aceitos são JPEG, PNG, GIF e WebP. Na Responses API, a imagem é enviada como uma parte de conteúdo
input_image, usando uma URL, uma URL de dados em base64 ou uma referência a arquivo enviado.
A entrada visual é convertida em tokens faturáveis. Segundo a DeepSeek, cada imagem contribui com no máximo 384 tokens de entrada, seguindo a estrutura de preços do V4-Flash.
As tarifas publicadas associadas ao lançamento são:
O teto de 384 tokens torna o custo da imagem relativamente previsível. Ele não limita, porém, o texto enviado junto, as chamadas de ferramentas nem a resposta gerada. Uma interação completa com um agente pode, portanto, consumir muito mais tokens do que a imagem isoladamente.
A DeepSeek lançou o Harness 0.1.1 com suporte pronto para o Vision-Exp. A ferramenta é especialmente relevante para quem desenvolve agentes, e não apenas para quem faz perguntas isoladas sobre uma imagem.
A empresa também colocou no ar uma Files API gratuita. O desenvolvedor pode enviar uma imagem uma vez e reutilizá-la em solicitações futuras por meio de um file_id, sem precisar transmitir os mesmos dados novamente. As referências de arquivo seguem o formato file-api-....
Esse recurso pode ser útil quando um agente precisa analisar a mesma captura de tela, página de documento ou recurso visual em várias etapas. A Files API não cobra pelo armazenamento ou envio conforme a descrição do lançamento, mas a inferência do modelo e o uso de tokens continuam sujeitos a cobrança.
O Vision-Exp mostra que a disputa entre modelos está se deslocando da qualidade isolada para o pacote completo oferecido aos desenvolvedores: capacidade multimodal, compatibilidade de API, preço, arquivos reutilizáveis e ferramentas para agentes. A DeepSeek oferece uma extensão visual da linha Flash com as mesmas tarifas de tokens publicadas para o V4-Flash, enquanto o Opus 4.8 aparece como referência de alto nível nas comparações feitas pela própria empresa.
O impacto prático dependerá menos de uma única tabela de benchmarks e mais da confiabilidade do modelo em tarefas como programação a partir de capturas de tela, análise de documentos, agentes de interface e uso visual de ferramentas. O rótulo “experimental” é um lembrete para validar esses fluxos diretamente antes de empregá-los em tarefas críticas.
A conclusão mais segura é moderada: a DeepSeek tornou o raciocínio visual de baixo custo mais acessível dentro de seu ecossistema de APIs, e os primeiros resultados sugerem um desafio relevante em avaliações multimodais específicas. Avaliações independentes, confiabilidade no mundo real e adoção contínua por desenvolvedores dirão se o Vision-Exp se tornará uma alternativa duradoura ou permanecerá como um lançamento experimental promissor.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash e, segundo uma comparação publicada pela própria empresa, superou o Claude Opus 4.8 em 3 de 11 benchmarks — s...
Lançado em 21 de agosto de 2026, o DeepSeek V4 Flash Vision Exp adiciona compreensão de imagens ao V4 Flash e, segundo uma comparação publicada pela própria empresa, superou o Claude Opus 4.8 em 3 de 11 benchmarks — s... O modelo é acessado pelo identificador deepseek v4 flash vision exp; cada imagem representa no máximo 384 tokens de entrada faturáveis e pode ser enviada em base64, por URL ou por uma referência reutilizável da Files...
O lançamento veio acompanhado do Harness 0.1.1, com suporte nativo ao modelo, e de uma Files API gratuita para reutilizar imagens em agentes com múltiplas etapas.