DeepSeek lanserte 21. august 2026 den eksperimentelle V4 Flash Vision Exp, som legger bildeforståelse til V4 Flash og begrenser hvert bilde til maksimalt 384 inputtoken.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek lanserte 21. august 2026 deepseek-v4-flash-vision-exp, en eksperimentell modell som gir V4-Flash evnen til å forstå bilder i tillegg til tekst. For utviklere betyr det en rimeligere måte å bygge agenter som kan lese skjermbilder, tolke grensesnitt, analysere diagrammer og følge med på visuell tilstand i en applikasjon. 114
Det mest oppsiktsvekkende er ikke nødvendigvis benchmark-tallene, men prismodellen: Hvert bilde konverteres til maksimalt 384 inputtoken og faktureres etter V4-Flash-satsene. Det kommer altså ikke et separat pristillegg for syn. DeepSeek hevder samtidig at den visuelle agentytelsen nærmer seg Claude Opus 4.8. Den sammenligningen bygger imidlertid på selskapets egne resultater og er foreløpig ikke uavhengig bekreftet. 319
Modellen brukes med API-identifikatoren deepseek-v4-flash-vision-exp. Den kombinerer tekst og bilder, samtidig som den beholder V4-Flash-familiens grunnlag for tekstgenerering, resonnering og verktøybruk. Blandede tekst- og bildeforespørsler støttes gjennom Chat Completions-, Messages- og Responses-grensesnittene. 412
Dette gjør modellen mer relevant enn et rent verktøy for bildebeskrivelser. En agent kan for eksempel:
Demonstrasjoner som er omtalt, viser blant annet hvordan modellen kan lage kjørbar kode fra skjermbilder og bruke visuelle inntrykk i arbeidsflyter for spillutvikling. 510
Utviklere kan legge ved bilder på tre måter:
file_id-verdien. 6714Files API er gratis å bruke. Det er særlig praktisk når den samme illustrasjonen, skjermdumpen eller visuelle tilstanden skal brukes i flere forespørsler. Gjenbruk av filreferansen gjør at identiske bildedata ikke må lastes opp på nytt hver gang, noe som reduserer båndbredde i tilbakevendende agentløp. 112
DeepSeek oppgir at hvert bilde teller som maksimalt 384 inputtoken ved fakturering. Tokenene prises etter den ordinære V4-Flash-satsen, ikke etter en egen og dyrere multimodal prisklasse. 3614
En publisert pristabell oppgir en toppsats på 0,44 dollar per million ubufrede inputtoken og 1,32 dollar per million outputtoken for synsmodellen. Tabellen oppgir også et kontekstvindu på 1 million token og en maksimal utdatamengde på 384 000 token. 1
Flere omtaler har beskrevet grensen på 384 token som under halvparten av bilde-tokenbruken i enkelte sammenligninger med GPT- og Claude-modeller. Det bør likevel leses som en retningsgivende sammenligning, ikke som en fullt standardisert måling: Kildene fastslår ikke at modellversjoner, bildeoppløsning eller faktureringsforutsetninger er identiske. 327
Den praktiske fordelen er tydeligere enn konkurrentregnestykket. En agent som må kontrollere mange skjermbilder, kan få en mer forutsigbar og begrenset bildekostnad til Flash-pris, i stedet for at hver observasjon krever en separat premium-modell for multimodal bruk.
DeepSeek sier at den nye modellen viderefører V4-Flashs tekstegenskaper, blant annet resonnering, verdensforståelse og agentfunksjoner, samtidig som den får visuell input. 626
Selskapet rapporterer også en betydelig forbedring i benchmarktester for multimodale agenter, med resultater som skal ligge nær Claude Opus 4.8. Enkelte publiserte sammenligninger plasserer modellen nær Opus 4.8 på utvalgte oppgaver, mens andre viser variasjon mellom benchmarkene. 4192123
Det er en viktig forskjell på «nær Opus 4.8» i selskapets evalueringer og dokumentert lik ytelse i praktisk bruk. Påstanden sier foreløpig mest om DeepSeeks eget testoppsett. Uavhengige tester må vise hvor stabil, presis og nyttig modellen er når den skal forstå bilder og bruke verktøy i virkelige arbeidsflyter.
Utviklere bør teste innstillingene for resonnering før modellen settes inn i en produksjonsloop som kontinuerlig analyserer bilder. En rapportert praktisk test fant at thinking-tokenene kunne bruke opp hele completion-budsjettet, slik at det ikke ble igjen noe synlig svar. Rapporten anbefaler å slå av tenkemodus for relevante visuelle oppgaver eller øke max_tokens, slik at modellen får plass til å returnere et resultat. 27
Dette er en integrasjonsadvarsel, ikke en generell dom over modellens evner. Når resonnering er aktivert, bør applikasjonen sette av nok kapasitet til både intern resonnering og svaret som skal vises til brukeren. Utviklere bør også kontrollere gjeldende parameternavn og oppførsel i DeepSeeks API-dokumentasjon før de bygger en løsning rundt en bestemt innstilling.
Kildematerialet inneholder ingen formell strategiforklaring fra DeepSeek. Produktutformingen peker likevel mot et konkret behov: Visuell persepsjon må være billig nok til å brukes gjentatte ganger dersom agenter faktisk skal kunne handle på skjermbilder, spillbilder, dashbord og skiftende programtilstander.
Ved å lansere syn som en eksperimentell Flash-variant kan utviklere legge bildeforståelse oppå eksisterende, rimelige arbeidsflyter for agenter og verktøykall. De slipper dermed nødvendigvis å flytte hele løsningen over på en separat og dyrere multimodal modell.
For utviklere av skjermstyrte agenter, verktøy som gjør skjermbilder om til kode og systemer som trenger hyppige visuelle tilbakemeldinger, er dette den viktigste siden ved lanseringen. DeepSeek V4-Flash-Vision-Exp kombinerer fleksible innmatingsmetoder med en uvanlig lav oppgitt bildegrense. Samtidig bør benchmarkpåstandene og produksjonsadferden testes med realistiske skjermbilder, tydelige outputbudsjetter og uavhengige kvalitetskontroller.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek lanserte 21. august 2026 den eksperimentelle V4 Flash Vision Exp, som legger bildeforståelse til V4 Flash og begrenser hvert bilde til maksimalt 384 inputtoken.
DeepSeek lanserte 21. august 2026 den eksperimentelle V4 Flash Vision Exp, som legger bildeforståelse til V4 Flash og begrenser hvert bilde til maksimalt 384 inputtoken. Bilder kan sendes som innebygd Base64, via en offentlig URL eller gjennom det kostnadsfrie Files API et, der samme bilde kan gjenbrukes med en file id.
DeepSeek hevder at den visuelle agentytelsen nærmer seg Claude Opus 4.8, men påstanden er leverandørrapportert.