DeepSeek bracht op 21 augustus 2026 het experimentele model V4 Flash Vision Exp uit. Ontwikkelaars kunnen afbeeldingen inline als Base64, via een openbare URL of met een herbruikbare verwijzing uit de gratis Files API aanleveren.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek heeft op 21 augustus 2026 deepseek-v4-flash-vision-exp uitgebracht: een experimentele multimodale uitbreiding van V4-Flash die naast tekst ook afbeeldingen begrijpt. Daarmee krijgen ontwikkelaars een relatief goedkope manier om agents screenshots, interfaces, grafieken en andere visuele informatie te laten analyseren. 114
De opvallendste eigenschap is de prijsstructuur. Iedere afbeelding wordt voor de facturatie omgezet in maximaal 384 invoertokens en valt onder de normale tarieven van V4-Flash. Er is dus geen afzonderlijke toeslag voor beeldverwerking. DeepSeek claimt bovendien dat de prestaties van visuele agents dicht bij Claude Opus 4.8 komen. Dat is voorlopig een claim van DeepSeek zelf en geen onafhankelijk vastgestelde gelijkwaardigheid. 319
Het model is beschikbaar onder de API-identificatie deepseek-v4-flash-vision-exp. Het combineert tekst- en beeldinvoer met de bestaande tekstgeneratie-, redeneer- en toolfunctionaliteit van de V4-Flash-familie. Gemengde visuele prompts worden ondersteund via Chat Completions, Messages en de Responses-achtige API-interface. 412
Dat maakt de release interessanter dan een eenvoudige functie voor beeldbeschrijvingen. Een agent kan bijvoorbeeld een screenshot bekijken, bepalen welke actie nodig is, een tool aanroepen en daarna opnieuw naar de gewijzigde interface kijken. In gepubliceerde demonstraties werd uitvoerbare code uit screenshots gegenereerd en werd visuele input gebruikt bij workflows voor het bouwen van games. 510
Ontwikkelaars hebben drie opties:
file_id. 6714De Files API is gratis. Dat is vooral praktisch voor toepassingen die herhaaldelijk naar dezelfde afbeelding verwijzen, bijvoorbeeld wanneer een agent telkens een vergelijkbare schermafbeelding of visuele toestand controleert. Door de bestandsverwijzing opnieuw te gebruiken, hoeft dezelfde afbeeldingsdata niet bij ieder verzoek opnieuw te worden geüpload. Dat bespaart bandbreedte in terugkerende agentlussen. 112
Volgens DeepSeek wordt iedere afbeelding voor de facturatie getokeniseerd met een maximum van 384 invoertokens. Die tokens worden tegen het gewone V4-Flash-invoertarief berekend; beeldbegrip krijgt dus geen aparte premiummodule. 3614
Een gepubliceerde prijstabel vermeldt voor het visiemodel tijdens piekuren $0,44 per miljoen niet-gecachete invoertokens en $1,32 per miljoen uitvoertokens. De tabel noemt daarnaast een contextvenster van 1 miljoen tokens en maximaal 384.000 uitvoertokens. 1
Sommige vergelijkingen beschrijven de limiet van 384 tokens als minder dan de helft van het beeldtokengebruik bij bepaalde GPT- en Claude-modellen. Dat is vooral een richtinggevende vergelijking: de aangeleverde bronnen bewijzen niet dat exact dezelfde modelversies, beeldresoluties en facturatievoorwaarden zijn gebruikt. 327
De praktische betekenis is wel duidelijk. Een agent die regelmatig screenshots controleert, kan dat doen tegen een voorspelbare Flash-prijs, zonder voor elke observatie een duurder multimodaal model nodig te hebben.
DeepSeek zegt dat V4-Flash-Vision-Exp de tekstuele mogelijkheden van V4-Flash behoudt, waaronder redeneervermogen, wereldkennis en agentfunctionaliteit, en daar beeldinvoer aan toevoegt. 626
Het bedrijf meldt ook een flinke verbetering op benchmarks voor multimodale agents, waardoor het model dicht bij Claude Opus 4.8 zou komen. Gepubliceerde vergelijkingen zetten het model op sommige taken inderdaad in de buurt van Opus 4.8, maar laten ook verschillen tussen benchmarks zien. 4192123
Dat onderscheid is belangrijk. “Dicht bij Opus 4.8” moet voorlopig worden gelezen als een uitspraak over de evaluaties van DeepSeek, niet als bewijs dat beide modellen in alle realistische visuele agenttaken gelijkwaardig zijn. Onafhankelijke tests moeten nog uitwijzen hoe betrouwbaar het model is, hoe nauwkeurig het beelden interpreteert en hoe goed het met tools werkt buiten de testopstelling van de fabrikant.
Ontwikkelaars doen er verstandig aan de redeneerinstellingen eerst gecontroleerd te testen voordat ze het model in een productielus met screenshots plaatsen. In een gerapporteerde praktijktest namen denktokens het volledige completionbudget in beslag, waardoor er geen zichtbaar antwoord werd teruggestuurd. De aanbeveling uit die test: schakel de denkmodus uit voor relevante visuele taken of verhoog max_tokens, zodat het model voldoende ruimte houdt om een antwoord te geven. 27
Dit is een integratiewaarschuwing, geen definitief oordeel over de mogelijkheden van het model. Wie redeneren inschakelt, moet ruimte reserveren voor zowel het interne redeneerproces als het antwoord aan de gebruiker. Controleer bovendien de actuele DeepSeek-documentatie voordat je op een specifieke parameter of instelling vertrouwt.
DeepSeek heeft in de aangeleverde informatie geen formele strategische toelichting gegeven. Het ontwerp wijst wel op een voor de hand liggend gebruiksscenario: visuele waarneming goedkoop genoeg maken voor herhaalde agentacties. Screenshots, spelbeelden, dashboards en interfaces zijn pas echt bruikbaar wanneer een agent ze regelmatig kan bekijken zonder dat iedere stap onbetaalbaar wordt.
Door vision als experimentele Flash-variant aan te bieden, kunnen ontwikkelaars beeldinvoer toevoegen aan bestaande, goedkope workflows voor agents en toolgebruik. Ze hoeven hun hele toepassing niet meteen onder te brengen bij een afzonderlijke multimodale premiummodule. Dat maakt de release vooral relevant voor schermgestuurde agents, tools die screenshots in code omzetten en toepassingen die vaak visuele feedback nodig hebben.
De balans is voorlopig helder: DeepSeek V4-Flash-Vision-Exp combineert flexibele invoermethoden met een opvallend lage limiet van maximaal 384 beeldtokens. De claims over benchmarkleiderschap en gedrag in productie moeten nog worden gecontroleerd. Voor ontwikkelaars is een gecontroleerde proef daarom het verstandigste begin: gebruik realistische screenshots, stel een ruim uitvoerbudget in en voer onafhankelijke kwaliteitscontroles uit.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek bracht op 21 augustus 2026 het experimentele model V4 Flash Vision Exp uit.
DeepSeek bracht op 21 augustus 2026 het experimentele model V4 Flash Vision Exp uit. Ontwikkelaars kunnen afbeeldingen inline als Base64, via een openbare URL of met een herbruikbare verwijzing uit de gratis Files API aanleveren.
DeepSeek zegt dat de prestaties van visuele agents in de buurt komen van Claude Opus 4.8, maar die vergelijking is gebaseerd op bedrijfsrapportages en wacht nog op onafhankelijke tests.