Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp ajoute la compréhension d’images à V4 Flash : chaque image est plafonnée à 384 tokens d’entrée et facturée au tarif Flash. Les développeurs peuvent envoyer une image en Base64, via une URL publique ou au moyen de la Files API gratuite, qui permet de réutiliser un f...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Le 21 août 2026, DeepSeek a lancé deepseek-v4-flash-vision-exp, une variante expérimentale de V4-Flash capable d’analyser des images en plus du texte. L’objectif est clair : permettre à des agents logiciels d’observer des captures d’écran, des interfaces, des graphiques ou l’état d’un jeu, puis d’agir à l’aide d’outils. 114
La nouveauté la plus marquante n’est toutefois pas seulement la capacité à « voir ». C’est son mode de facturation : DeepSeek affirme qu’une image est convertie en 384 tokens d’entrée au maximum, facturés au tarif habituel de V4-Flash, sans supplément propre à la vision. 319
Le modèle est accessible avec l’identifiant deepseek-v4-flash-vision-exp. Il accepte des requêtes mêlant texte et images et peut être appelé via les interfaces Chat Completions, Messages et Responses. Il conserve ainsi la base de génération de texte et d’utilisation d’outils de la famille V4-Flash, tout en ajoutant une entrée visuelle. 412
Dans la pratique, cela permet de construire une boucle d’agent fondée sur l’écran :
Les démonstrations rapportées incluent notamment la génération de code exécutable à partir de captures d’écran et l’utilisation d’images dans des flux de création de jeux. 510
Les développeurs disposent de trois méthodes :
file_id renvoyé par l’API. 6714La Files API est gratuite. Elle est particulièrement adaptée aux applications qui consultent régulièrement la même capture, le même document visuel ou le même élément d’interface. En réutilisant une référence de fichier, l’application évite de renvoyer les mêmes données à chaque requête et réduit ainsi la bande passante nécessaire aux workflows récurrents. 112
Selon DeepSeek, chaque image est tokenisée pour la facturation à hauteur de 384 tokens d’entrée maximum. Ces tokens sont facturés au tarif V4-Flash, sans niveau tarifaire multimodal distinct. 3614
Un tableau de prix publié indique, en période de pointe, 0,44 dollar par million de tokens d’entrée non mis en cache et 1,32 dollar par million de tokens de sortie pour le modèle visuel. Le même tableau mentionne une fenêtre de contexte d’un million de tokens et une sortie maximale de 384 000 tokens. 1
Certains comptes rendus présentent ce plafond de 384 tokens comme inférieur de plus de moitié à la consommation d’image de certains modèles GPT et Claude. Cette comparaison doit cependant être considérée comme indicative : les éléments disponibles ne garantissent pas que les versions de modèles, les résolutions d’image ou les hypothèses de facturation soient identiques. 327
Le bénéfice concret est plus simple à établir. Un agent qui examine fréquemment des captures d’écran peut recevoir une perception visuelle à un coût d’entrée prévisible, au tarif Flash, plutôt que de recourir à un modèle multimodal premium à chaque étape de sa boucle.
DeepSeek affirme que le nouveau modèle préserve les capacités textuelles de V4-Flash, notamment le raisonnement, les connaissances générales et les fonctions d’agent, tout en ajoutant la compréhension visuelle. 626
L’entreprise affirme également avoir obtenu une forte progression sur des benchmarks d’agents multimodaux, avec des résultats proches de ceux de Claude Opus 4.8. Certaines comparaisons publiées placent effectivement le modèle près d’Opus 4.8 sur plusieurs tâches, tandis que d’autres montrent des écarts variables selon les benchmarks. 4192123
La nuance est importante : « proche d’Opus 4.8 » décrit pour l’instant les résultats communiqués par DeepSeek, et non une équivalence établie dans tous les usages d’agents visuels. Des évaluations indépendantes devront encore mesurer la fiabilité, la précision d’analyse des images et l’efficacité de l’utilisation d’outils dans des scénarios réels.
Les développeurs doivent tester soigneusement les paramètres de raisonnement avant d’intégrer le modèle dans une boucle visuelle en production. Un essai pratique rapporté indique que les tokens de réflexion peuvent consommer l’intégralité du budget de complétion, sans laisser de place à la réponse visible. Le même compte rendu recommande de désactiver le mode de réflexion pour les tâches visuelles concernées ou d’augmenter max_tokens. 27
Il s’agit d’un avertissement d’intégration, pas d’un jugement général sur les capacités du modèle. Lorsque le raisonnement est activé, l’application doit réserver assez de tokens pour les étapes internes comme pour la réponse destinée à l’utilisateur. Les équipes devront aussi vérifier les paramètres et le comportement les plus récents dans la documentation de l’API DeepSeek avant de dépendre d’un réglage précis.
DeepSeek n’a pas fourni, dans les éléments disponibles, d’explication stratégique formelle. La conception du produit suggère néanmoins un objectif évident : rendre la perception visuelle suffisamment abordable pour être répétée souvent.
Un agent qui doit travailler avec une interface, un tableau de bord, une partie de jeu ou une succession de captures d’écran n’est utile que s’il peut observer régulièrement son environnement sans rendre chaque cycle trop coûteux. En ajoutant la vision à une variante Flash expérimentale, DeepSeek permet aussi aux développeurs d’étendre un agent et ses appels d’outils existants, plutôt que de migrer toute leur application vers une offre multimodale premium.
Pour les créateurs d’agents pilotés par écran, d’outils de conversion de captures en code ou d’applications nécessitant un retour visuel fréquent, le positionnement est donc intéressant. Le compromis reste toutefois à surveiller : le plafond annoncé de 384 tokens et les méthodes d’importation sont attractifs, mais les performances de référence et le comportement en production doivent encore être confirmés par des tests indépendants.
La meilleure approche consiste à commencer par des essais contrôlés, avec des captures réalistes, un budget de sortie explicite et des vérifications de qualité séparées.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp ajoute la compréhension d’images à V4 Flash : chaque image est plafonnée à 384 tokens d’entrée et facturée au tarif Flash.
Lancé le 21 août 2026, DeepSeek V4 Flash Vision Exp ajoute la compréhension d’images à V4 Flash : chaque image est plafonnée à 384 tokens d’entrée et facturée au tarif Flash. Les développeurs peuvent envoyer une image en Base64, via une URL publique ou au moyen de la Files API gratuite, qui permet de réutiliser un fichier avec son identifiant.
DeepSeek affirme que les performances de ses agents visuels se rapprochent de Claude Opus 4.8, mais cette comparaison reste fondée sur des résultats communiqués par l’entreprise.