DeepSeek V4.1 Flash støtter kontekster på opptil én million tekstbiter, men grensen er ingen garanti for at modellen finner igjen alle detaljer. Modellen aktiverer rundt 8 milliarder parametere per tekstbit ved innlesing og 16 milliarder ved generering.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
For en KI-agent som stadig leser dokumenter og tidligere meldinger, kan det være dyrere å holde styr på samtalehistorikken enn å skrive et kort svar. DeepSeek-V4.1-Flash er laget med dette bruksmønsteret i tankene: Modellen har åpne vekter, kan behandle tekst og bilder og støtter kontekster på opptil én million tekstbiter. Det siste er en teknisk grense, ikke et løfte om at modellen alltid finner igjen enhver detalj i en lang økt. 2
8
Modellen er en mixture-of-experts-modell (MoE) med en grunnstruktur på 552 milliarder parametere. Den har 20 lag som leser inn konteksten, fulgt av 20 lag som brukes når den genererer svar. Dekoderens globale KV-hurtigbuffer – lagret informasjon modellen bruker for å rette oppmerksomheten mot tidligere innhold – bygges fra sluttilstanden i innlesingsdelen, i stedet for å bli laget separat av hvert dekoderlag. Under innlesing aktiveres rundt 8 milliarder parametere per tekstbit, mot 16 milliarder når modellen genererer tekst. Forskjellen er særlig relevant når en agent leser mye mer enn den skriver. 2
8
Hurtigbufferen blir også mindre. Metoden Compressed Sparse Attention 2 (CSA2) gir oppmerksomhetslagene én av tre faste moduser – Full, Reindex eller Reuse – slik at lag kan dele lagret informasjon og gjenbruke utvalg av tekstbiter. Sammen med FP4-lagring av den viktigste KV-hurtigbufferen gir dette ifølge DeepSeek et globalt fotavtrykk på 890 byte per tekstbit, omtrent en fjerdedel av DeepSeek-V4-Flash. Det er en sammenligning av hurtigbufferstørrelse, ikke en måling av hvor mye enhver installasjon vil spare totalt. 6
8
En annen metode, SWA Bounded Replay, gjenskaper manglende KV-data for et begrenset oppmerksomhetsvindu ved å kjøre gjennom bare de nyeste tekstbitene på nytt. Dermed trenger ikke disse dataene å lagres permanent på SSD. DeepSeeks modellbeskrivelse anslår at den vedvarende KV-lagringen blir omtrent en åttendedel av nivået i V4-Flash. Dette er et annet mål enn tallet på én fjerdedel for den globale hurtigbufferen. 5
9
En modelloppføring beskriver trening fra bunnen av på et multimodalt materiale på 45 billioner tekstbiter, trening av sparsom oppmerksomhet med sekvenser på 64 000 tekstbiter og utvidelse til én million tekstbiter da treningen hadde nådd 34 billioner. DeepSeek viser også til nye metoder for forhåndstrening og mer omfattende ettertrening med forsterkningslæring, men de oppgitte kildene gir ikke grunnlag for å beskrive ettertreningen mer detaljert. 9
16
Modellen kan behandle både bilder og tekst, og DeepSeek sier at API-utgaven har multimodal støtte. De oppgitte kildeutdragene dokumenterer ikke detaljerte resultater fra bildetester. 2
16
I DeepSeeks egne evalueringer var grunnmodellen på nivå med V4-Pro-Base innen kunnskap, resonnering og koding. På evalueringer holdt utenfor treningen oppgir selskapet 5–10 prosent forbedring, med omtrent en tredjedel så mange parametere totalt og en fjerdedel så mange aktiverte parametere. DeepSeek sier også at den lanserte modellen gjør det bedre enn V4-Pro på agentoppgaver. Kildene gir imidlertid ikke grunnlag for en pålitelig sammenligning test for test, og resultatene er ikke en uavhengig direkte test. 1
16
I DeepSeeks API er modellnavnet deepseek-flash. De publiserte vektene er oppført med MIT-lisens. Modellmaterialet beskriver bruk med SGLang, mens modelloppføringer også nevner støtte for Transformers og vLLM. Sjekk kravene til den konkrete løsningen før du antar at bildebehandling og svært lange kontekster fungerer likt overalt. 8
9
16
DeepSeek opplyser at V4-Flash og V4-Flash-Vision-Exp er tatt ut av bruk, og at de eldre API-navnene midlertidig sender forespørsler videre til V4.1-Flash. Selskapet kunngjorde også at forespørsler til deepseek-v4-pro fra 14. september 2026 skulle rutes til V4.1-Flash til Flash-priser, i påvente av V4.1-Pro. Hvis en applikasjon er avhengig av Pro-spesifikk oppførsel, bør utviklerne kontrollere hvilken modell som faktisk svarer – ikke bare stole på navnet i forespørselen. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash støtter kontekster på opptil én million tekstbiter, men grensen er ingen garanti for at modellen finner igjen alle detaljer.
DeepSeek V4.1 Flash støtter kontekster på opptil én million tekstbiter, men grensen er ingen garanti for at modellen finner igjen alle detaljer. Modellen aktiverer rundt 8 milliarder parametere per tekstbit ved innlesing og 16 milliarder ved generering.
DeepSeek tilbyr modellen i API et som deepseek flash. Resultatene selskapet oppgir mot V4 Pro, er ikke en uavhengig sammenligning.