DeepSeek V4 Flash Vision Exp verscheen op 21 augustus 2026 als experimenteel API model. Het model accepteert JPEG , PNG , GIF en WebP afbeeldingen via de Chat Completions en Responses API's.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp is het eerste model met beeldondersteuning binnen DeepSeeks V4-Flash-API-lijn. Het model behoudt volgens DeepSeek de tekst-, redeneer-, agent- en wereldkennisfuncties van V4-Flash, maar kan daar nu ook afbeeldingen bij verwerken. DeepSeek noemt het model experimenteel en zegt dat de multimodale agentprestaties dicht bij Claude Opus 4.8 liggen. Voorlopig is er echter onvoldoende onafhankelijke informatie om dat als een vaststaand resultaat op een algemene ranglijst te beschouwen.
Het model is via de DeepSeek-API beschikbaar onder de identifier deepseek-v4-flash-vision-exp. In de release-informatie staat dat het op teksttaken — waaronder agents, redeneren en wereldkennis — vergelijkbaar presteert met V4-Flash. Tegelijk zou het een grote stap vooruit zetten op benchmarks waarvoor visueel begrip nodig is.
De belangrijkste verandering is de invoermodaliteit. Het model kan tekst combineren met JPEG-, PNG-, GIF- of WebP-afbeeldingen. Daardoor kan het bijvoorbeeld afbeeldingen beschrijven, tekst uit een screenshot lezen, visuele vragen beantwoorden en grafieken analyseren.
De toevoeging Exp is belangrijk. Dit is een API-release voor ontwikkelaars, geen bewijs dat DeepSeek al een volledig uitontwikkeld consumentenproduct of een bewezen productiemodel heeft. Ontwikkelaars doen er daarom goed aan het model eerst gecontroleerd te testen, in plaats van het automatisch als vervanger van een bestaand model in te zetten.
DeepSeek documenteert gemengde verzoeken met tekst en afbeeldingen. Het model is beschikbaar via zowel de Chat Completions- als de Responses-interface; beide documentaties vermelden deepseek-v4-flash-vision-exp als ondersteunde model-ID.
Afbeeldingen kunnen volgens de vision-documentatie worden meegestuurd als inlinegegevens, via een externe URL of met de Files API. Ook de documentatie van de Responses-API beschrijft expliciet hoe afbeeldingen met dit model kunnen worden aangeleverd.
Dat maakt de release interessant voor bouwers van AI-agents. Een agent kan bijvoorbeeld eerst een screenshot, grafiek of gescand document interpreteren en daarna bepalen welke tool moet worden aangeroepen. DeepSeek documenteert bovendien een Codex-integratie waarin Vision Exp als optie wordt genoemd voor ondersteuning van beeldinvoer.
Volgens de release-informatie kreeg DeepSeek Harness 0.1.1 eveneens ondersteuning voor het model. Dat biedt een extra route naar agent-workflows. De documentatie voor GitHub Copilot noemt daarentegen V4 Pro en V4 Flash in de modelkiezer. Voor afbeeldingen gebruikt die integratie volgens de documentatie een ander geïnstalleerd Copilot-model; de bron bevestigt dus niet dat Vision Exp rechtstreeks in die modelkiezer beschikbaar is.
De centrale prestatieclaim van DeepSeek luidt dat Vision Exp de tekstprestaties van V4-Flash behoudt en een grote sprong maakt op multimodale agentbenchmarks. Volgens het bedrijf komt de multimodale agentcapaciteit daarmee dicht bij Claude Opus 4.8.
In berichtgeving over de aankondiging worden onder meer een score van 64,3 op Chartography, 36,5 op ApexBench Pass@1, 27,3 op Agents’ Last Exam en 35,0 op ZeroBench Pass@5 genoemd. Deze cijfers zijn afkomstig uit secundaire berichtgeving over de aankondiging van DeepSeek, niet uit een gedetailleerde en onafhankelijk reproduceerbare vergelijking tussen aanbieders.
Dat onderscheid is wezenlijk. “Dicht bij Opus 4.8” betekent niet dat het model Claude in het algemeen verslaat, op elke taak even goed presteert of dezelfde betrouwbaarheid in productie biedt. De beschikbare bronnen bevatten geen neutrale evaluatie met identieke prompts, tools, latency, foutpercentages en kosten voor DeepSeek en Anthropic.
De meest verdedigbare conclusie is daarom beperkt maar positief: DeepSeek heeft een echt en gedocumenteerd API-model met beeldondersteuning uitgebracht. De eigen resultaten van het bedrijf wijzen op een betekenisvolle verbetering ten opzichte van de tekstgerichte V4-Flash bij taken waarbij visuele input nodig is. De precieze positie tegenover Claude, OpenAI, Google en andere Chinese AI-laboratoria is nog niet vastgesteld.
Beschikbare modeloverzichten vermelden voor Vision Exp $0,22 per miljoen invoertokens en $0,66 per miljoen uitvoertokens, met een contextvenster van 1 miljoen tokens. De officiële prijsdocumentatie van DeepSeek bevestigt dat de API per miljoen tokens rekent en
deepseek-v4-flash-vision-exp in de prijstabel opneemt.
Afbeeldingen worden voor de facturatie omgezet in tokens. Een bericht dat verwijst naar de gepubliceerde richtlijnen van DeepSeek stelt dat één afbeelding maximaal 384 tokens kan vertegenwoordigen en dat de prijsstructuur gelijk is aan die van V4-Flash. De effectieve kosten van een visuele workflow hangen dus af van het aantal en de omvang van de afbeeldingen, de omliggende tekst, de lengte van het antwoord en de hoeveelheid context die opnieuw wordt meegestuurd.
Anthropic vermeldt voor Claude Opus 4.8 $5 per miljoen baselinvoertokens en $25 per miljoen uitvoertokens. Daarnaast gelden aparte tarieven voor onder meer promptcaching en de snelle modus.
Op basis van de standaardtarieven is DeepSeek dus veel goedkoper. Dat is een goede reden om het model te testen, maar nog geen bewijs dat een volledige workflow ook goedkoper uitvalt. Een model met lagere tokenkosten kan door extra pogingen, meer fouten bij toolgebruik of noodzakelijke beeldvoorbewerking alsnog duurder worden.
De modellen hebben deels overlappende toepassingen, maar nemen een andere positie in:
De strategische boodschap van DeepSeek is duidelijk: beeldbegrip toevoegen aan een goedkopere modelcategorie en tegelijk prestaties claimen die bij multimodale agenttaken in de buurt komen van een premium frontiermodel. Het beschikbare bewijs bewijst niet dat Claude op elke benchmark beter is. Claude heeft in deze vergelijking vooral een voorsprong in aantoonbare productvolwassenheid, platformdekking en de gevestigde positie van het model en de omliggende tools.
De vergelijking moet uiteindelijk per taak worden gemaakt. Voor een pipeline die screenshots leest of gegevens uit grafieken haalt, kan Vision Exp voldoende kwaliteit bieden tegen veel lagere tokenkosten. Bij een autonome workflow met hoge risico’s zijn consistentie, nauwkeurig toolgebruik, weigergedrag, monitoring, ondersteuning en herstel na fouten belangrijker dan alleen de prijs per token.
De release is relevant omdat beeldbegrip steeds meer onderdeel wordt van agenttaken, in plaats van een losstaande functie voor vragen over afbeeldingen. Programmeeragents kunnen screenshots moeten lezen, browseragents webpagina’s moeten interpreteren en bedrijfssystemen kunnen documenten, grafieken en toolaanroepen moeten combineren.
De V4-familie van DeepSeek richt zich al op lange contexten en agenttaken. In de V4-documentatie positioneert DeepSeek Flash als een snellere en voordeligere optie binnen de familie. Vision Exp trekt die lijn door naar multimodale agents, in plaats van een afzonderlijk model te lanceren dat alleen afbeeldingen analyseert.
Toch is er geen basis om DeepSeek nu al boven Anthropic, OpenAI, Google of toonaangevende Chinese AI-laboratoria te plaatsen. De beschikbare bronnen bevatten geen onafhankelijke, één-op-éénvergelijking tussen aanbieders. Bovendien is een experimentele API-release niet hetzelfde als een volwassen vlaggenschip voor productiegebruik.
Ja, zolang de test gecontroleerd verloopt.
Een zinvolle proef vergelijkt Vision Exp met Claude Opus 4.8 en het huidige productiemodel op precies dezelfde taken met afbeeldingen en tools. Meet daarbij in elk geval:
Het voorlopige oordeel is daarom voorzichtig maar positief: DeepSeek V4 Flash Vision Exp is een geloofwaardig nieuw multimodaal API-experiment met een aantrekkelijke vermelde prijs en bruikbare ontwikkelaarsinterfaces. De claim dat het model op multimodale agenttaken bijna het niveau van Claude Opus 4.8 haalt, is het testen waard — maar nog geen onafhankelijk vastgesteld feit.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash Vision Exp verscheen op 21 augustus 2026 als experimenteel API model.
DeepSeek V4 Flash Vision Exp verscheen op 21 augustus 2026 als experimenteel API model. Het model accepteert JPEG , PNG , GIF en WebP afbeeldingen via de Chat Completions en Responses API's.
Vermelde tarieven bedragen $0,22 per miljoen invoertokens en $0,66 per miljoen uitvoertokens, tegenover $5 en $25 voor Claude Opus 4.8.