Påstanden bør leses med en klype salt. «Nær Opus 4.8» beskriver resultatene i DeepSeeks utvalgte testoppsett – ikke dokumentert lik kvalitet på alle visuelle oppgaver, programmeringsoppgaver eller langvarige agentøkter.
DeepSeeks endringslogg oppgir blant annet følgende Vision-Exp-resultater: 36,5 i ApexBench, 27,3 i Agents’ Last Exam, 64,3 i Chartography og 35,0 i ZeroBench Pass@5.
Tallene sier likevel ikke alt om hvordan modellen fungerer i produksjon. Resultatene kan påvirkes av instruksjoner, verktøymiljø, oppgaveutvalg, responstid, feilhåndtering og selve evalueringsmetoden. Det finnes foreløpig ikke nok uavhengig dokumentasjon til å bruke sammenligningen som en endelig rangering av modellene.
For teksttunge bruksområder handler den sterkeste påstanden først og fremst om kontinuitet, ikke klar dominans. DeepSeek presenterer Vision-Exp som en modell som beholder V4-Flashs etablerte tekstegenskaper, slik at utviklere kan få bildeinput uten å gi avkall på tidligere resonnerings- og agentfunksjoner.
Det gir tre praktiske tommelfingerregler:
Vision-Exp er tilgjengelig på DeepSeeks API-plattform. Lanseringen støtter Chat Completions, Messages og Responses, inkludert kombinasjoner av tekst og bilder.
Bilder kan sendes på tre måter:
file_id for et bilde som er lastet opp gjennom Files API.De dokumenterte formatene er JPEG, PNG, GIF og WebP. Responses API bruker tilsvarende en
input_image-del med bilde-URL, base64-data-URL eller en opplastet filreferanse.
Bildeinput gjøres om til fakturerbare token. DeepSeek oppgir at hvert bilde bidrar med maksimalt 384 input-token, etter prisstrukturen til V4-Flash.
Prisene som er knyttet til lanseringen, er oppgitt slik per én million token:
At bildet har et tak på 384 token, gjør bildekostnaden forholdsvis forutsigbar. Taket gjelder imidlertid ikke teksten i forespørselen, verktøykallene eller modellens svar. En komplett agentinteraksjon kan derfor bruke betydelig flere token enn selve bildet.
DeepSeek lanserte Harness 0.1.1 med innebygd støtte for Vision-Exp. Det er særlig relevant for utviklere som bygger agenter som bruker verktøy, og ikke bare stiller enkeltstående spørsmål om et bilde.
Samtidig ble Files API gjort tilgjengelig uten kostnad. Utviklere kan laste opp et bilde én gang og bruke det på nytt i senere forespørsler ved å sende med en file_id, i stedet for å laste opp de samme bildedataene hver gang. DeepSeek dokumenterer filreferanser på formatet file-api-....
Gjenbrukbare filreferanser kan være nyttige når en agent skal undersøke det samme skjermbildet, den samme dokumentsiden eller et visuelt materiale gjennom flere samtalerunder. Selve Files API-et kan være gratis, men modellkjøring og tokenbruk faktureres fortsatt.
Vision-Exp illustrerer hvordan konkurransen i økende grad handler om mer enn modellkvalitet alene. Pris, multimodal funksjonalitet, API-kompatibilitet, gjenbrukbare filer og agentverktøy blir en del av den samlede utvikleropplevelsen.
DeepSeek tilbyr en visuell utvidelse av Flash-serien til de publiserte tokenprisene for V4-Flash, mens Anthropics Opus 4.8 fungerer som sammenligningspunkt i DeepSeeks egen rapportering.
I praksis vil betydningen avgjøres mindre av én benchmark-tabell enn av hvor stabil modellen er i oppgaver som koding basert på skjermbilder, dokumentanalyse, grensesnittagenter og visuell verktøybruk. At modellen er merket «eksperimentell», er en påminnelse om å validere slike arbeidsflyter direkte før den tas i bruk i kritiske produksjonssystemer.
Den mest nøkterne konklusjonen er derfor denne: DeepSeek har gjort visuell resonnering lettere tilgjengelig gjennom sitt eksisterende API-økosystem, og de tidlige testresultatene tyder på en reell utfordring i enkelte multimodale evalueringer. Uavhengige tester, pålitelighet i virkelige oppgaver og varig utvikleradopsjon vil avgjøre om Vision-Exp blir et varig alternativ – eller forblir en interessant eksperimentell lansering.