Resultatet bör tolkas försiktigt. Att modellen är ”nära Opus 4.8” beskriver prestationen i DeepSeeks utvalda testuppsättning – inte att kvaliteten är likvärdig i alla visuella uppgifter, kodningsscenarier eller långvariga agentkörningar. Den officiella ändringsloggen redovisar bland annat 36,5 i ApexBench, 27,3 i Agents’ Last Exam, 64,3 i Chartography och 35,0 i ZeroBench Pass@5.
Siffrorna besvarar inte heller flera viktiga produktionsfrågor. Benchmarkresultat kan påverkas av instruktioner, verktygsmiljöer, uppgiftsurval, svarstid, felhantering och testmetodik. Det finns inte tillräckligt med oberoende material för att kalla jämförelsen en definitiv rangordning av modeller.
Det starkaste påståendet för texttunga användningsområden är kontinuitet, snarare än tydlig dominans. DeepSeek positionerar Vision-Exp som en modell som behåller V4-Flashs textförmågor. Utvecklare behöver alltså inte avstå från modellens etablerade resonemangs- och agentbeteende för att få bildinmatning.
Det är en viktig skillnad när man väljer modell:
Vision-Exp finns på DeepSeeks API-plattform. Modellen stöder Chat Completions, Messages och Responses, inklusive blandad text- och bildinmatning.
Bilder kan skickas på tre sätt:
file_id för en bild som laddats upp via Files API.De dokumenterade formaten är JPEG, PNG, GIF och WebP. Responses API tar på motsvarande sätt emot en
input_image-del med bild-URL, base64-data-URL eller en uppladdad filreferens.
Bildinmatning omvandlas till debiterbara token. DeepSeek uppger att varje bild bidrar med högst 384 indatatoken enligt V4-Flashs prisstruktur.
De publicerade V4-Flash-priserna i samband med lanseringen är:
Takgränsen på 384 token gör bildkostnaden relativt förutsägbar. Den begränsar däremot inte kostnaden för tillhörande text, verktygsanrop eller genererade svar. Ett komplett agentförlopp kan därför använda betydligt fler token än själva bilden.
DeepSeek släppte Harness 0.1.1 med färdigt stöd för Vision-Exp. Det är relevant för utvecklare som bygger agenter, snarare än ställer enstaka bildfrågor, eftersom modellen är avsedd att fungera i arbetsflöden där verktyg används.
Samtidigt lanserades ett kostnadsfritt Files API. Utvecklare kan ladda upp en bild en gång och återanvända den i senare anrop genom att skicka ett file_id, i stället för att upprepade gånger överföra samma bilddata. DeepSeek dokumenterar filreferenser i formatet file-api-....
Återanvändbara filreferenser är särskilt praktiska när en agent behöver granska samma skärmdump, dokumentsida eller visuella tillgång i flera turer. Files API är kostnadsfritt att använda, men modellkörning och tokenförbrukning debiteras fortfarande.
Vision-Exp visar hur konkurrensen allt mer handlar om hela utvecklarpaketet – inte bara om modellkvalitet. Multimodalitet, API-kompatibilitet, pris, återanvändbara filer och agentverktyg blir minst lika viktiga. DeepSeek erbjuder en visuell utbyggnad av Flash-serien till samma publicerade tokenpriser som V4-Flash, medan Anthropics Opus 4.8 är den avancerade jämförelsepunkt som används i DeepSeeks rapportering.
Den praktiska betydelsen kommer sannolikt att avgöras mindre av en enskild benchmarktabell och mer av hur pålitlig modellen är i verkliga arbetsflöden: kodning utifrån skärmdumpar, dokumentanalys, gränssnittsagenter och användning av visuella verktyg. Etiketten ”experimentell” är samtidigt en tydlig påminnelse om att testa dessa flöden direkt innan modellen används i kritisk produktion.
Den mest rimliga slutsatsen är därför återhållsam: DeepSeek har gjort visuellt resonemang billigare och enklare att nå via sitt befintliga API-ekosystem. De tidiga resultaten antyder en betydande utmaning i vissa multimodala tester, men oberoende utvärderingar, tillförlitlighet i vardagen och långsiktigt utvecklarstöd avgör om Vision-Exp blir ett hållbart alternativ eller förblir en lovande experimentell lansering.