Malli tukee enintään miljoonan tokenin kontekstia, mutta raja ei takaa, että se löytää jokaisen yksityiskohdan pitkästä historiasta. Syötettä käsitellessä aktivoituu noin 8 miljardia parametria tokenia kohti; vastausta tuotettaessa määrä on noin 16 miljardia.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Pitkässä tekoälyagentin työskentelyssä malli voi joutua lukemaan yhä uudelleen suuren määrän aiempia viestejä ja aineistoa, vaikka sen oma vastaus olisi lyhyt. DeepSeek-V4.1-Flash on tähän tilanteeseen suunnattu avoimin painoin julkaistu multimodaalinen MoE-malli eli asiantuntijaverkkomalli. Sen tuettu konteksti ulottuu miljoonaan tokeniin. Se kertoo, kuinka pitkän syötteen malli voi käsitellä – ei sitä, että jokainen yksityiskohta löytyisi pitkästä historiasta luotettavasti. 2
8
Mallin 552 miljardin parametrin perusrakenne jakautuu 20-kerroksiseen kausaaliseen enkooderiin ja 20-kerroksiseen dekooderiin. Dekooderin globaali KV-välimuisti, johon tallennetaan aiempien tokenien avain- ja arvoesityksiä, muodostetaan enkooderin viimeisistä tiloista sen sijaan, että jokainen dekooderikerros tuottaisi sen erikseen. DeepSeekin mukaan mallissa aktivoituu noin 8 miljardia parametria tokenia kohti syötteen käsittelyvaiheessa ja 16 miljardia vastauksen tuottamisvaiheessa. Ero on olennainen juuri silloin, kun agentti lukee paljon enemmän kuin kirjoittaa. 2
8
Toinen keino on Compressed Sparse Attention 2 (CSA2). Siinä tarkkaavaisuuskerrokselle määrätään yksi kolmesta kiinteästä toimintatavasta – Full, Reindex tai Reuse – jotta kerrokset voivat jakaa välimuistiin tallennettua tietoa ja käyttää uudelleen harvan tarkkaavaisuuden valintoja. Kun pääasiallinen KV-välimuisti lisäksi tallennetaan FP4-muodossa, globaalin KV-välimuistin koko on DeepSeekin mukaan 890 tavua tokenia kohti, noin neljännes V4-Flash-mallin vastaavasta koosta. Tämä on välimuistin kokovertaus, ei lupaus koko palvelun kustannusten putoamisesta neljännekseen. 6
8
SWA Bounded Replay puolestaan rakentaa puuttuvat liukuvan tarkkaavaisuusikkunan KV-tilat uudelleen käsittelemällä vain viimeisimmän token-ikkunan. Näitä tiloja ei siten tarvitse säilyttää SSD-levyllä. DeepSeekin mallikortin mukaan pysyvästi tallennettavan KV-välimuistin koko on tällä menetelmällä noin kahdeksasosa V4-Flashin vastaavasta. Se on eri mittari kuin edellä mainittu globaalin KV-välimuistin neljäsosa. 5
9
Mallikorttilistauksen mukaan malli koulutettiin alusta asti 45 biljoonan tokenin multimodaalisella aineistolla. Harvaa tarkkaavaisuutta koulutettiin 64 000 tokenin pituisilla jaksoilla, ja konteksti laajennettiin miljoonaan tokeniin, kun koulutuksessa oli edetty 34 biljoonan tokenin kohtaan. DeepSeek liittää parannukset myös uusiin esikoulutusmenetelmiin ja aiempaa laajempaan vahvistusoppimiseen perustuvaan jälkikoulutukseen. Käytettävissä olevat lähteet eivät erittele jälkikoulutuksen tarkkaa toteutusta. 9
16
Malli käsittelee natiivisti tekstiä ja kuvia, ja DeepSeekin mukaan myös API-julkaisu tukee multimodaalisuutta. Viitatut lähteet eivät kuitenkaan anna pohjaa yksityiskohtaiselle arviolle sen kuvan ymmärtämisen testituloksista. 2
16
DeepSeekin omissa arvioinneissa perusmalli ylsi tiedossa, päättelyssä ja koodauksessa suunnilleen V4-Pro-Base-mallin tasolle ja paransi erillisissä arvioinneissa tuloksia 5–10 prosenttia. Vertailussa sillä oli noin kolmannes kokonaisparametreista ja neljännes aktivoituvista parametreista. DeepSeek sanoo myös julkaistun mallin ohittavan V4-Pron agenttitehtävissä, mutta viitatut otteet eivät riitä luotettavaan testikohtaiseen vertailuun. Kyse on raportoiduista tuloksista, ei riippumattomasta rinnakkaistestistä. 1
16
DeepSeekin API:ssa mallin nimi on deepseek-flash, ja julkaistut mallipainot on ilmoitettu MIT-lisenssin alaisiksi. Mallimateriaaleissa kuvataan käyttöönotto SGLangilla; mallilistauksissa mainitaan myös Transformers- ja vLLM-tuki. Käytettävän ajoympäristön ominaisuudet kannattaa silti tarkistaa erikseen, etenkin jos sovellus tarvitsee sekä kuvatuen että pitkän kontekstin. 8
9
16
DeepSeekin mukaan V4-Flash ja V4-Flash-Vision-Exp on poistettu käytöstä, ja niiden vanhat API-nimet ohjataan tilapäisesti V4.1-Flashiin. Yhtiö ilmoitti myös, että 14.9.2026 alkaen deepseek-v4-pro-nimellä tehdyt pyynnöt ohjataan V4.1-Flashiin Flash-hinnoittelulla V4.1-Pron julkaisuun saakka. Jos sovellus riippuu Pro-mallin ominaisuuksista, pelkkään API-nimeen ei kannata luottaa: käytännössä palveleva malli on syytä varmistaa. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Malli tukee enintään miljoonan tokenin kontekstia, mutta raja ei takaa, että se löytää jokaisen yksityiskohdan pitkästä historiasta.
Malli tukee enintään miljoonan tokenin kontekstia, mutta raja ei takaa, että se löytää jokaisen yksityiskohdan pitkästä historiasta. Syötettä käsitellessä aktivoituu noin 8 miljardia parametria tokenia kohti; vastausta tuotettaessa määrä on noin 16 miljardia.
DeepSeekin mukaan globaali KV välimuisti vie 890 tavua tokenia kohti, noin neljänneksen aiemman V4 Flash mallin vastaavasta määrästä.