DeepSeek indique que Vision-Exp se rapproche de Claude Opus 4.8 sur des benchmarks d’agents multimodaux, tout en conservant les performances texte de V4-Flash. Dans le tableau comparatif publié par DeepSeek et rapporté par The Next Web, le nouveau modèle devance Opus 4.8 sur 3 des 11 benchmarks présentés.
Les résultats publiés par DeepSeek incluent notamment :
Mais « proche d’Opus 4.8 » ne signifie pas que les deux modèles sont équivalents dans tous les usages. Cette formulation décrit une performance observée dans une sélection de tests choisie et présentée par DeepSeek. Elle ne permet pas de conclure à une parité générale pour l’analyse visuelle, le développement logiciel, les longues sessions avec outils ou les tâches d’agent sur lesquelles les erreurs s’accumulent.
Les résultats d’un benchmark peuvent varier selon les invites utilisées, l’environnement d’outils, le choix des tâches, la latence visée, la gestion des échecs et la méthode de notation. En l’absence de validations indépendantes suffisantes, ces chiffres doivent donc être considérés comme des indications de lancement, et non comme un classement définitif des modèles.
Sur les tâches principalement textuelles, DeepSeek met surtout en avant la continuité avec V4-Flash plutôt qu’une domination clairement établie. L’entreprise présente Vision-Exp comme un modèle qui conserve le raisonnement, les agents et les connaissances générales de la version existante.
Cette distinction compte au moment de choisir un modèle :
Vision-Exp est accessible via la plateforme API de DeepSeek. Le lancement prend en charge les formats Chat Completions, Messages et Responses, ainsi que les requêtes combinant texte et image.
Une image peut être fournie de trois façons :
file_id correspondant à une image téléversée avec la Files API.Les formats documentés sont JPEG, PNG, GIF et WebP. Dans la Responses API, l’image est transmise comme une partie de contenu
input_image, avec une URL, une URL de données en base64 ou une référence à un fichier déjà téléversé.
Les images sont converties en tokens d’entrée facturables. DeepSeek indique que chaque image contribue à hauteur de 384 tokens au maximum, selon la grille tarifaire de V4-Flash.
Les tarifs V4-Flash associés au lancement sont les suivants :
Le plafond de 384 tokens rend le coût de la partie image relativement prévisible. Il ne limite toutefois ni le texte associé, ni les appels d’outils, ni la réponse générée. Une interaction complète avec un agent peut donc consommer bien davantage que les seuls tokens attribués à l’image.
DeepSeek a publié Harness 0.1.1 avec une prise en charge native de Vision-Exp. Cet élément intéresse particulièrement les développeurs qui conçoivent des agents capables d’utiliser des outils, plutôt que de simples systèmes répondant à une question sur une image.
La société a également mis en ligne une Files API gratuite. Elle permet de téléverser une image une seule fois, puis de la réutiliser dans les requêtes suivantes en transmettant son file_id. DeepSeek documente ces références sous la forme file-api-....
Cette approche peut simplifier les agents qui doivent examiner plusieurs fois la même capture d’écran, la même page de document ou le même support visuel au fil d’une conversation. La mise à disposition des fichiers est gratuite, mais l’inférence du modèle et la consommation de tokens restent facturées.
Le lancement illustre une évolution de la concurrence : les entreprises ne se battent plus uniquement sur un tableau de scores. Le prix des tokens, la compatibilité des API, la réutilisation des fichiers, les outils pour agents et la facilité d’intégration deviennent eux aussi déterminants.
DeepSeek propose ainsi une extension visuelle de sa gamme Flash, au tarif publié de V4-Flash, tandis que Claude Opus 4.8 sert de point de comparaison haut de gamme dans les résultats communiqués par l’entreprise.
L’impact réel dépendra moins d’un seul tableau de benchmarks que de la fiabilité constatée par les développeurs dans des tâches comme le codage à partir de captures d’écran, l’analyse de documents, les agents d’interface et l’utilisation d’outils visuels. La mention « expérimental » invite à tester directement ces scénarios avant toute utilisation critique.
La conclusion la plus solide reste donc mesurée : DeepSeek rend le raisonnement visuel plus accessible financièrement dans son écosystème API et ses premiers résultats suggèrent un concurrent sérieux sur certains tests multimodaux. Des évaluations indépendantes, la fiabilité en conditions réelles et l’adoption par les développeurs détermineront si Vision-Exp devient une alternative durable ou reste une sortie expérimentale prometteuse.