
Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp er den første modellen i DeepSeeks V4-Flash-serie med synsforståelse. Den beholder ifølge selskapet V4-Flash-egenskapene innen tekst, resonnering, agenter og verdensforståelse, samtidig som den kan ta imot bilder. DeepSeek sier at modellen ligger nær Claude Opus 4.8 i multimodale agentoppgaver. Det er imidlertid en selskaps påstand – ikke et ferdig, uavhengig resultat på tvers av alle oppgaver.
Modellen kan kalles gjennom DeepSeeks API med modell-ID-en deepseek-v4-flash-vision-exp. I lanseringsnotatet beskriver DeepSeek den som lik V4-Flash på tekstlige oppgaver, inkludert agenter, resonnering og verdensforståelse, men med et betydelig løft på oppgaver der visuell forståelse er nødvendig.
Den praktiske forskjellen er altså hva modellen kan lese inn. Utviklere kan sende tekst sammen med JPEG-, PNG-, GIF- eller WebP-bilder. Det åpner for å beskrive bilder, lese tekst fra skjermbilder, svare på visuelle spørsmål og analysere diagrammer.
Suffikset «Exp» er viktig. Dette er et eksperimentelt API-produkt, ikke dokumentasjon på at DeepSeek allerede har en moden forbrukertjeneste eller en direkte erstatning for en etablert produksjonsmodell.
DeepSeek dokumenterer støtte for blandede tekst- og bildeforespørsler gjennom både Chat Completions- og Responses-grensesnittene. deepseek-v4-flash-vision-exp står oppført som en støttet modell-ID i begge API-ene.
Bilder kan sendes som innebygde data, via eksterne URL-er eller gjennom Files API. Responses-dokumentasjonen beskriver også spesifikt hvordan bilder kan sendes til denne modellen.
Dette gjør modellen interessant for agentutviklere. En agent kan for eksempel tolke et skjermbilde, et diagram eller et skannet dokument før den bestemmer hvilket verktøy som skal brukes videre. DeepSeek dokumenterer også Codex-integrasjon, der Vision Exp er oppført som et alternativ med støtte for bildeinndata.
DeepSeek Harness 0.1.1 fikk ifølge selskapets lanseringsnotat støtte for modellen, noe som gir utviklere enda en inngang til agentarbeidsflyter. GitHub Copilot-dokumentasjonen nevner derimot V4 Pro og V4 Flash i modellvelgeren, og beskriver bildehåndtering gjennom en annen installert Copilot-modell. Den bekrefter derfor ikke at Vision Exp kan velges direkte der.
DeepSeeks viktigste påstand er at Vision Exp beholder V4-Flash-ytelsen på tekst, samtidig som den gjør et stort hopp på multimodale agenttester og nærmer seg Claude Opus 4.8.
Sekundær omtale av lanseringen gjengir blant annet en score på 64,3 i Chartography, 36,5 i ApexBench Pass@1, 27,3 i Agents’ Last Exam og 35,0 i ZeroBench Pass@5. Tallene er imidlertid ikke presentert i kildematerialet som en detaljert, uavhengig og reproduserbar sammenligning mellom leverandører.
«Nær Opus 4.8» betyr derfor ikke at modellen slår Claude totalt, matcher modellen på alle oppgaver eller har samme stabilitet i produksjon. Det foreligger ingen nøytral test her med identiske instruksjoner, verktøymiljøer, responstider, feilrater og kostnader for DeepSeek og Anthropic.
Den mest holdbare konklusjonen er smalere: DeepSeek har lansert en reell og dokumentert API-modell med synsforståelse, og selskapets egne tall tyder på et tydelig løft sammenlignet med tekstbaserte V4-Flash på oppgaver der bilder spiller en rolle. Modellens nøyaktige plassering mot Claude, OpenAI, Google og andre kinesiske AI-modeller er fortsatt uavklart.
Tilgjengelige modelloversikter oppgir en pris på 0,22 dollar per million input-token og 0,66 dollar per million output-token for Vision Exp. Kontekstvinduet er oppgitt til 1 million token. DeepSeeks egen prisdokumentasjon bekrefter at API-prisene beregnes per million token, og inkluderer
deepseek-v4-flash-vision-exp i modelltabellen.
Bilder gjøres om til token og inngår i API-faktureringen. En rapport som viser til DeepSeeks publiserte veiledning, oppgir at ett bilde kan utgjøre opptil 384 token, og at modellen følger V4-Flash-prisstrukturen. Den faktiske kostnaden avhenger derfor også av antall og størrelse på bildene, mengden tekst rundt dem, svarlengden og hvor mye kontekst som sendes på nytt.
Anthropic oppgir Claude Opus 4.8 til 5 dollar per million basetoken for input og 25 dollar per million output-token. Selskapet har i tillegg egne priser for hurtigmodus og hurtigbufring.
På selve tokenprisen er DeepSeek dermed betydelig billigere. Det er en god grunn til å teste modellen, men ikke alene et bevis på lavere totalkostnad. En billigere modell kan bli dyrere i praksis hvis den trenger flere forsøk, gjør flere verktøyfeil eller krever ekstra bildebehandling.
De to modellene har overlappende bruksområder, men ulik posisjon:
DeepSeeks strategi er lett å se: Selskapet vil bringe synsforståelse inn i en rimeligere modellklasse, samtidig som det hevder ytelse nær en dyr premium-modell på multimodale agentoppgaver. Kildene beviser ikke at Claude er best på alle enkeltoppgaver. Anthropics fortrinn i denne sammenligningen er først og fremst en mer etablert produktflate, verktøystøtte og markedsposisjon.
Sammenligningen bør gjøres oppgave for oppgave. I en pipeline som leser skjermbilder eller henter ut data fra diagrammer, kan Vision Exp være god nok til en langt lavere tokenpris. I en autonom arbeidsflyt med høye konsekvenser er konsistens, verktøypresisjon, håndtering av avslag, logging og evnen til å komme seg etter feil viktigere enn en enkelt benchmarkscore.
Synsforståelse er i ferd med å bli en del av agentarbeid, ikke bare en funksjon for spørsmål om bilder. Kodeagenter kan måtte lese skjermbilder, nettleseragenter kan tolke nettsider, og virksomhetssystemer kan måtte kombinere dokumenter, diagrammer og verktøykall.
DeepSeek har allerede presentert V4-familien som rettet mot lange kontekster og agentoppgaver, mens Flash beskrives som det raskere og mer økonomiske alternativet i familien. Vision Exp viderefører denne retningen ved å gjøre agentene multimodale, i stedet for å lansere en separat modell som bare svarer på bilder.
Det er likevel for tidlig å erklære DeepSeek som ledende foran Anthropic, OpenAI, Google eller andre kinesiske AI-laboratorier. Kildene inneholder ingen uavhengig sammenligning med like vilkår, og en eksperimentell API-lansering er ikke det samme som en moden flaggskipmodell i produksjon.
Ja – men i en kontrollert test.
En nyttig prøve bør sammenligne Vision Exp med Claude Opus 4.8 og dagens produksjonsmodell på de samme bilde- og verktøyoppgavene. Følg særlig med på:
Konklusjonen bør derfor være forsiktig, men positiv: DeepSeek V4 Flash Vision Exp er et troverdig nytt multimodalt API-eksperiment med attraktive oppgitte priser og nyttige utviklergrensesnitt. Påstanden om ytelse nær Claude Opus 4.8 er interessant nok til å testes – men ikke godt nok dokumentert til å behandles som et uavhengig etablert faktum.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek lanserte 21. august 2026 V4 Flash Vision Exp som en eksperimentell API modell med bildeinndata i tillegg til V4 Flash funksjoner for tekst, resonnering og agenter.
DeepSeek lanserte 21. august 2026 V4 Flash Vision Exp som en eksperimentell API modell med bildeinndata i tillegg til V4 Flash funksjoner for tekst, resonnering og agenter. Modellen støtter JPEG, PNG, GIF og WebP gjennom DeepSeeks Chat Completions og Responses API er, og kan brukes til blant annet skjermbilder, dokumenter, diagrammer og agentarbeidsflyter med bilder.
Oppgitte priser er 0,22 dollar per million input token og 0,66 dollar per million output token, mot 5 og 25 dollar for Claude Opus 4.8.