Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp est un modèle multimodal expérimental qui conserve les capacités de V4 Flash en texte, raisonnement et agents, tout en ajoutant l’analyse d’images. Il accepte les images JPEG, PNG, GIF et WebP via les API Chat Completions et Responses de DeepSeek, pour traiter des...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek vient de compléter sa gamme V4-Flash avec un modèle capable de comprendre les images. Disponible via l’API sous le nom deepseek-v4-flash-vision-exp, ce modèle conserve, selon l’entreprise, les performances de V4-Flash en texte, raisonnement, agents et connaissances générales, tout en ajoutant une entrée visuelle.
La nouveauté est intéressante pour les agents capables d’interagir avec des outils : ils peuvent désormais lire une capture d’écran, interpréter un graphique ou examiner un document avant de décider de l’action suivante. Mais il faut garder la tête froide. Le suffixe « Exp » signifie que le modèle est expérimental, et l’affirmation selon laquelle il serait proche de Claude Opus 4.8 n’a pas encore été confirmée par une évaluation indépendante comparable.
Le modèle est accessible avec l’identifiant deepseek-v4-flash-vision-exp. DeepSeek indique qu’il égale V4-Flash sur les tâches textuelles — notamment les agents, le raisonnement et les connaissances générales — et qu’il progresse nettement sur les tests nécessitant une compréhension visuelle.
Concrètement, il peut recevoir du texte accompagné d’images aux formats JPEG, PNG, GIF ou WebP. Les usages documentés comprennent la description d’une image, la lecture du texte présent dans une capture d’écran, les réponses à des questions visuelles et l’analyse de graphiques.
Il ne s’agit donc pas d’un simple modèle de vision destiné à répondre à des questions sur des photos. Son positionnement est celui d’un modèle multimodal orienté vers les agents : l’image devient une information supplémentaire dans un processus qui peut ensuite appeler des outils, produire du code ou manipuler des données.
DeepSeek prend en charge les requêtes mêlant texte et image dans ses interfaces Chat Completions et Responses. La documentation API répertorie deepseek-v4-flash-vision-exp comme identifiant utilisable avec ces deux points d’accès.
Les images peuvent être transmises de plusieurs façons : données intégrées directement dans la requête, URL externe ou Files API. La documentation de l’API Responses décrit également l’envoi d’images avec ce modèle.
Cette compatibilité est particulièrement utile pour les concepteurs d’agents. Un système peut, par exemple, examiner une interface affichée à l’écran, comprendre un tableau ou extraire des informations d’un document avant de choisir l’outil à appeler.
DeepSeek documente aussi une intégration avec Codex : le modèle Vision Exp y apparaît comme une option ajoutant la prise en charge des images. L’entreprise indique par ailleurs que DeepSeek Harness 0.1.1, son outil destiné aux workflows d’agents, prend en charge le modèle.
Il faut toutefois distinguer ces intégrations. La documentation de DeepSeek consacrée à GitHub Copilot cite V4 Pro et V4 Flash dans le sélecteur de modèles. Elle explique que les images peuvent être traitées par un autre modèle Copilot installé, mais ne confirme pas que Vision Exp soit directement proposé dans ce sélecteur.
La principale affirmation de DeepSeek est double : Vision Exp conserverait les performances textuelles de V4-Flash et ferait un bond important sur les benchmarks d’agents multimodaux, au point de se rapprocher de Claude Opus 4.8.
Des articles relayant l’annonce citent notamment un score de 64,3 à Chartography, de 36,5 à ApexBench Pass@1, de 27,3 à Agents’ Last Exam et de 35,0 à ZeroBench Pass@5. Ces chiffres proviennent toutefois de la communication de DeepSeek rapportée par des sources secondaires, et non d’une comparaison indépendante détaillée et reproductible entre plusieurs fournisseurs.
La nuance est essentielle : « proche de Claude Opus 4.8 » ne signifie pas que DeepSeek dépasse Claude dans l’ensemble, ni que les deux modèles offrent la même fiabilité sur chaque type de tâche. Les éléments disponibles ne fournissent pas de protocole neutre comparant les mêmes prompts, les mêmes outils, la latence, les taux d’échec et les coûts.
La conclusion la plus solide est donc plus limitée : DeepSeek a bien lancé et documenté une API capable de traiter des images, et ses propres résultats suggèrent un progrès important par rapport à V4-Flash sur les tâches où la vision est indispensable. La place exacte du modèle face à Anthropic, OpenAI, Google ou aux autres laboratoires chinois reste à établir.
Les fiches de modèles disponibles indiquent un tarif de 0,22 dollar par million de tokens en entrée et de 0,66 dollar par million de tokens en sortie, avec une fenêtre de contexte d’un million de tokens. La documentation officielle de DeepSeek confirme une facturation par million de tokens et inclut
deepseek-v4-flash-vision-exp dans son tableau tarifaire.
Les images sont converties en tokens pour la facturation. Selon une source citant les indications publiées par DeepSeek, une image peut représenter jusqu’à 384 tokens et suit la grille tarifaire de V4-Flash. Le coût réel d’un workflow visuel dépendra donc du nombre et de la taille des images, du texte associé, de la longueur des réponses et de la répétition éventuelle du contexte.
De son côté, Anthropic facture Claude Opus 4.8 5 dollars par million de tokens d’entrée et 25 dollars par million de tokens de sortie en tarification standard. Des tarifs distincts s’appliquent au cache et au mode rapide.
Sur le seul prix des tokens, DeepSeek est donc nettement moins cher. C’est un argument sérieux pour lancer un test, mais pas une preuve d’un coût total inférieur. Un modèle moins cher peut nécessiter davantage de relances, commettre plus d’erreurs dans l’appel d’outils ou imposer un prétraitement supplémentaire des images.
Les deux modèles peuvent viser des usages proches — agents, analyse de documents, code et automatisation — mais ils ne jouent pas exactement dans la même catégorie :
La stratégie de DeepSeek est claire : intégrer la vision à une gamme plus abordable tout en revendiquant des performances proches d’un modèle premium sur les tâches d’agents multimodaux. L’avantage de Claude, au vu des informations disponibles, ne se résume pas à un score supérieur démontré sur tous les benchmarks. Il tient surtout à la maturité documentée de son produit, de ses outils et de son écosystème.
Le meilleur comparatif devra être réalisé tâche par tâche. Pour une chaîne d’extraction de données depuis des graphiques ou de lecture de captures d’écran, Vision Exp pourrait offrir un niveau de qualité suffisant à un coût bien plus faible. Pour un agent autonome intervenant dans un contexte sensible, il faudra surtout mesurer la régularité, la précision des appels d’outils, le comportement face aux refus, la supervision et la récupération après erreur.
La vision devient progressivement une composante des agents, et non plus une fonction isolée de questions-réponses sur des images. Un agent de programmation peut devoir interpréter une capture d’écran, un agent de navigation comprendre une page web et un outil d’entreprise croiser documents, tableaux, graphiques et appels structurés.
La famille DeepSeek V4 met déjà l’accent sur les contextes longs et les usages agentiques. Dans la présentation de la gamme, V4-Flash est décrit comme une option plus rapide et plus économique que V4-Pro. Vision Exp prolonge cette orientation en ajoutant la vision aux agents, plutôt qu’en lançant un modèle séparé uniquement consacré aux images.
Cela ne suffit pas pour autant à placer DeepSeek devant Anthropic, OpenAI, Google ou les principaux laboratoires chinois. Les sources disponibles ne présentent pas d’évaluation indépendante menée à armes égales, et un modèle expérimental accessible par API ne doit pas être confondu avec un produit phare arrivé à maturité.
Oui, mais dans un cadre contrôlé.
Pour obtenir un résultat utile, les développeurs devraient comparer Vision Exp avec Claude Opus 4.8 et leur modèle actuellement utilisé sur les mêmes tâches mêlant images et outils. Les indicateurs à suivre sont notamment :
Le verdict le plus raisonnable est donc prudent, mais favorable : DeepSeek V4 Flash Vision Exp est une expérience multimodale crédible, dotée d’interfaces développeur utiles et d’un tarif affiché très attractif. Sa promesse de performances proches de Claude Opus 4.8 mérite d’être testée — pas encore considérée comme un fait établi indépendamment.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp est un modèle multimodal expérimental qui conserve les capacités de V4 Flash en texte, raisonnement et agents, tout en ajoutant l’analyse d’images.
Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp est un modèle multimodal expérimental qui conserve les capacités de V4 Flash en texte, raisonnement et agents, tout en ajoutant l’analyse d’images. Il accepte les images JPEG, PNG, GIF et WebP via les API Chat Completions et Responses de DeepSeek, pour traiter des captures d’écran, des documents, des graphiques ou des workflows combinant images et outils.
Les tarifs annoncés sont de 0,22 dollar par million de tokens en entrée et 0,66 dollar en sortie, contre 5 et 25 dollars pour Claude Opus 4.8 ; le coût des images et la qualité réelle des tâches doivent toutefois être...