DeepSeek lanserade modellen den 21 augusti 2026. Den lägger till bildförståelse i V4 Flash, där varje bild räknas som högst 384 inmatningstoken och debiteras enligt den vanliga Flash taxan.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeeks lansering den 21 augusti 2026 ger V4-Flash förmågan att förstå bilder. Den experimentella modellen deepseek-v4-flash-vision-exp tar emot blandade text- och bildprompter via API:et och är tänkt att ge utvecklare ett billigare sätt att bygga agenter som kan tolka skärmbilder, användargränssnitt, diagram och annan visuell information. 114
Den stora nyheten är prismodellen: varje bild omvandlas till högst 384 inmatningstoken och debiteras enligt V4-Flash-priset. Det innebär att DeepSeek inte lägger på någon separat avgift för bildförståelse. Företaget säger samtidigt att modellens prestanda för visuella agenter närmar sig Claude Opus 4.8 – ett påstående som bygger på DeepSeeks egna resultat och ännu inte har verifierats oberoende. 319
Modellen anropas med API-identifieraren deepseek-v4-flash-vision-exp. Den kombinerar text- och bildinmatning med V4-Flash-familjens grund för textgenerering, verktygsanrop och AI-agenter. Blandade visuella prompter stöds via Chat Completions, Messages och Responses. 412
Det här är därför mer än ett verktyg för att beskriva en enstaka bild. En agent kan exempelvis arbeta i en återkommande loop: läsa av en skärmbild, avgöra nästa steg, anropa ett verktyg och sedan granska det uppdaterade gränssnittet. I rapporterade demonstrationer har modellen bland annat genererat körbar kod från skärmbilder och använt visuella indata i spelutvecklingsflöden. 510
Utvecklare kan välja mellan tre metoder:
file_id. 6714Files API är kostnadsfritt och passar särskilt bra när samma bild eller skärmbild används i flera anrop. Genom att återanvända filreferensen slipper applikationen skicka samma bilddata om och om igen, vilket minskar bandbredden i återkommande agentflöden. 112
DeepSeek uppger att varje bild räknas som högst 384 inmatningstoken vid faktureringen. Tokenen debiteras enligt den normala inmatningstaxan för V4-Flash, inte enligt en dyrare multimodal nivå. 3614
En publicerad pristabell anger ett högsta pris på 0,44 dollar per en miljon uncachade inmatningstoken och 1,32 dollar per en miljon utmatningstoken för synmodellen. Tabellen anger också ett kontextfönster på en miljon token och en maximal utmatning på 384 000 token. 1
Flera rapporter har beskrivit 384-tokenstaket som mindre än hälften av bildkostnaden i vissa jämförelser med GPT- och Claude-modeller. Det är dock en riktning snarare än ett helt jämförbart benchmark: underlaget fastställer inte att modellerna har testats med samma versioner, bildupplösningar eller antaganden om fakturering. 327
Den praktiska poängen är tydligare än jämförelsen mellan leverantörer. En visuell agent som behöver kontrollera många skärmbilder kan få en förutsägbar och relativt låg kostnad för bildinmatning – utan att varje observation måste gå via en särskild premiummodell.
DeepSeek säger att modellen behåller V4-Flashs textförmågor, däribland resonemang, omvärldskunskap och agentfunktioner, samtidigt som den får stöd för visuella indata. 626
Företaget rapporterar också ett tydligt lyft i benchmarktester av multimodala agenter, med resultat nära Claude Opus 4.8. Vissa publicerade jämförelser placerar modellen nära Opus 4.8 i utvalda uppgifter, medan andra visar variation mellan olika testsviter. 4192123
Det är en viktig skillnad. Formuleringen ”nära Opus 4.8” bör i nuläget läsas som ett påstående om DeepSeeks egna utvärderingar – inte som ett bevis på att modellerna är likvärdiga i alla verkliga arbetsflöden med visuella agenter. Oberoende tester behövs för att bedöma tillförlitlighet, visuell precision och verktygsanvändning utanför företagets testmiljö.
Utvecklare bör testa modellens inställningar för resonemang innan den placeras i ett produktionsflöde med återkommande bildanalys. I ett rapporterat praktiskt test kunde tänkandet förbruka hela svarbudgeten, så att inget synligt svar återstod. Samma rapport rekommenderar att tänkandet stängs av för relevanta visuella uppgifter eller att max_tokens höjs så att modellen får plats att faktiskt svara. 27
Detta är en integrationsdetalj, inte ett generellt omdöme om modellens kapacitet. Om resonemang är aktiverat behöver applikationen reservera tillräckligt många utmatningstoken för både modellens interna resonemang och svaret till användaren. Kontrollera också aktuella parameterinställningar i DeepSeeks API-dokumentation innan ett visst beteende byggs in i produktionen.
DeepSeek har inte gett någon formell strategisk förklaring i det tillgängliga underlaget. Produktens utformning pekar ändå mot ett tydligt användningsområde: att göra visuell perception tillräckligt billig för att kunna användas ofta. Skärmbilder, spelfönster, instrumentpaneler och applikationstillstånd blir bara användbara för en agent om den kan inspektera dem regelbundet utan att varje steg blir orimligt dyrt.
Genom att lansera bildförståelsen som en experimentell Flash-variant kan utvecklare dessutom lägga till visuella indata i befintliga lågkostnadsflöden för agenter och verktygsanrop. De behöver inte nödvändigtvis flytta hela applikationen till en separat, dyrare multimodal modell. Det gör lanseringen särskilt relevant för skärmbaserade agenter, verktyg som omvandlar skärmbilder till kod och system som behöver återkoppling från ett visuellt gränssnitt.
Balansen är därmed tydlig: DeepSeek V4-Flash-Vision-Exp erbjuder ett ovanligt lågt angivet tokenstak för bilder och flexibla sätt att skicka in dem. Däremot återstår det att pröva företagets benchmarkförsprång och hur modellen beter sig i produktion. För utvecklare är en kontrollerad start klokast – med realistiska skärmbilder, en uttrycklig svarbudget och oberoende kvalitetskontroller.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek lanserade modellen den 21 augusti 2026. Den lägger till bildförståelse i V4 Flash, där varje bild räknas som högst 384 inmatningstoken och debiteras enligt den vanliga Flash taxan.
DeepSeek lanserade modellen den 21 augusti 2026. Den lägger till bildförståelse i V4 Flash, där varje bild räknas som högst 384 inmatningstoken och debiteras enligt den vanliga Flash taxan. Bilder kan skickas som Base64 data, via en offentlig URL eller genom det kostnadsfria Files API, där en uppladdad bild kan återanvändas med sitt file id.
DeepSeek säger att modellen närmar sig Claude Opus 4.8 i tester av visuella agenter, men påståendet är leverantörsrapporterat och ännu inte oberoende bekräftat.