DeepSeek lancerede den 21. august 2026 V4 Flash Vision Exp med billedforståelse, højst 384 inputtokens pr. Billeder kan sendes som inline Base64, offentlige URL’er eller via gratis Files API, hvor den samme fil kan genbruges med et file id.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek lancerede den 21. august 2026 den eksperimentelle model deepseek-v4-flash-vision-exp på sin API-platform. Den bygger billedforståelse oven på V4-Flash, så udviklere kan sende tekst og billeder i samme forespørgsel og lade agenter analysere skærmbilleder, brugerflader, diagrammer og andre visuelle tilstande. 114
Den store nyhed er ikke kun, at modellen kan se. Det er også prisen: Hvert billede konverteres til højst 384 inputtokens og afregnes efter V4-Flash’ normale takst – uden et særskilt tillæg for vision. DeepSeek hævder samtidig, at modellens præstationer som visuel agent nærmer sig Claude Opus 4.8. Den sammenligning bygger dog på virksomhedens egne resultater og er endnu ikke uafhængigt bekræftet. 319
Modellen kaldes via API-identifikatoren deepseek-v4-flash-vision-exp. Den kombinerer tekst- og billedinput med V4-Flash-familiens grundlag for tekstgenerering, værktøjsbrug og agentarbejde. Den kan kaldes gennem Chat Completions, Messages og Responses-lignende API-flader. 412
Det gør udgivelsen mere interessant end et almindeligt værktøj til billedbeskrivelser. En agent kan eksempelvis indgå i en løkke, hvor den:
Rapporterede demonstrationer omfattede generering af kørbar kode ud fra skærmbilleder samt brug af visuelle input i arbejdsgange til udvikling af spil. 510
Udviklere kan sende billeder på tre måder:
file_id. 6714Files API er gratis at bruge og er især praktisk, når den samme fil skal indgå i mange forespørgsler. Ved at genbruge en filreference slipper applikationen for at uploade identiske billeddata igen og igen, hvilket reducerer båndbreddeforbruget i tilbagevendende agentforløb. 112
DeepSeek oplyser, at hvert billede ved fakturering tokeniseres til maksimalt 384 inputtokens. De afregnes til den almindelige V4-Flash-inputpris, så billedforståelse ikke placeres i et særskilt premium-niveau. 3614
En offentliggjort pristabel angiver en peak-pris på 0,44 dollar pr. million uncached inputtokens og 1,32 dollar pr. million outputtokens for vision-modellen. Tabellen angiver også et kontekstvindue på 1 million tokens og en maksimal outputlængde på 384.000 tokens. 1
Flere rapporter har beskrevet loftet på 384 billedtokens som mindre end halvdelen af tokenforbruget for visse sammenligninger med GPT- og Claude-modeller. Det er dog først og fremmest en retningsgivende sammenligning: Kilderne fastslår ikke, at modelversioner, billedopløsninger eller afregningsforudsætninger er identiske. 327
Den praktiske pointe er derfor mere sikker end konkurrencesammenligningen. En visuel agent, der jævnligt tjekker skærmbilleder, kan få en mere forudsigelig og begrænset billedinputpris til Flash-takst i stedet for at bruge en dyr multimodal model ved hver observation.
DeepSeek siger, at den nye model bevarer V4-Flash’ tekstlige egenskaber, herunder ræsonnering, almen viden og agentfunktioner, samtidig med at den får visuelt input. 626
Virksomheden rapporterer også et markant løft på benchmarks for multimodale agenter, hvor modellen skulle komme tæt på Claude Opus 4.8. Nogle offentliggjorte sammenligninger placerer V4-Flash-Vision-Exp tæt på Opus 4.8 på udvalgte opgaver, mens andre viser variation fra benchmark til benchmark. 4192123
Det er en vigtig forskel. Formuleringen “tæt på Opus 4.8” bør på nuværende tidspunkt læses som en påstand baseret på DeepSeeks egen evaluering – ikke som bevis på, at modellerne er lige gode i alle praktiske opgaver med visuelle agenter. Uafhængige tests skal stadig afklare stabilitet, visuel præcision og værktøjsbrug uden for virksomhedens testopsætning.
Udviklere bør teste modellens ræsonneringsindstillinger, før den sættes ind i en produktionsløsning med gentagne visuelle kald. En rapporteret praktisk test viste, at thinking-tokens kunne bruge hele completion-budgettet, så der ikke blev plads til et synligt svar. Rapporten anbefaler at deaktivere thinking i relevante visuelle opgaver eller hæve max_tokens, så modellen har plads til at returnere et resultat. 27
Det er en implementeringsadvarsel – ikke nødvendigvis en dom over modellens generelle evner. Hvis ræsonnering er slået til, bør applikationen reservere nok outputkapacitet til både den interne proces og svaret til brugeren. Udviklere bør desuden kontrollere de aktuelle parameterbeskrivelser i DeepSeeks API-dokumentation, før de baserer en løsning på en bestemt indstilling.
DeepSeek har ikke fremlagt en formel strategisk forklaring i det tilgængelige materiale. Produktdesignet peger dog på en tydelig anvendelse: at gøre visuel perception billig nok til, at agenter kan bruge den gentagne gange.
Skærmbilleder, spilframes, dashboards og aktuelle programtilstande er kun rigtig nyttige for en agent, hvis den kan undersøge dem løbende uden at gøre hver eneste arbejdsgang uforholdsmæssigt dyr. Ved at lancere vision som en eksperimentel Flash-variant kan udviklere tilføje billedinput til eksisterende, prisvenlige agent- og værktøjsflows i stedet for at flytte hele løsningen over på en separat premium-model.
Det gør udgivelsen særligt relevant for udviklere, der bygger skærmstyrede agenter, værktøjer fra skærmbillede til kode eller applikationer, som har brug for hyppig visuel feedback.
Kort sagt tilbyder DeepSeek V4-Flash-Vision-Exp et usædvanligt lavt angivet loft for billedtokens og fleksible metoder til at sende billeder. Til gengæld skal både benchmarkføringen og modellens stabilitet i produktion fortsat efterprøves. Et fornuftigt første skridt er kontrollerede tests med realistiske skærmbilleder, et eksplicit outputbudget og uafhængige kvalitetstjek.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek lancerede den 21. august 2026 V4 Flash Vision Exp med billedforståelse, højst 384 inputtokens pr.
DeepSeek lancerede den 21. august 2026 V4 Flash Vision Exp med billedforståelse, højst 384 inputtokens pr. Billeder kan sendes som inline Base64, offentlige URL’er eller via gratis Files API, hvor den samme fil kan genbruges med et file id.
Modellen bevarer ifølge DeepSeek V4 Flash’ tekst , ræsonnerings og agentfunktioner, men visuelle integrationer bør reservere nok outputtokens, fordi rapporterede tests viste, at thinking kunne bruge hele svarbudgettet.