V4 Flash on DeepSeek V4 -malliperheen tehokkuuteen ja kustannuksiin optimoitu versio. MoE-arkkitehtuurissa mallin kaikki parametrit eivät osallistu jokaiseen pyyntöön: kokonaisuudessaan mallissa on 284 miljardia parametria, mutta kutakin tokenia käsiteltäessä aktiivisena on vain 13 miljardia .
Käytännössä malli saa käyttöönsä laajan joukon erikoistuneita asiantuntijaverkkoja ilman, että jokainen vastaus vaatisi koko mallin laskentaa. Tämä auttaa pitämään päättelyn nopeana ja API-käytön edullisena.
| Ominaisuus | Tieto |
|---|---|
| Kokonaisparametrit | 284 miljardia (304 miljardia DSpark-luonnosmoduuli mukaan lukien) |
| Aktiiviset parametrit | 13 miljardia tokenia kohti |
| Arkkitehtuuri | Mixture of Experts (MoE) |
| Konteksti-ikkuna | 1 miljoona tokenia |
| Suurin tuloste | 384 000 tokenia |
| Tarkkuus | FP4- ja FP8-sekatarkkuus |
| Lisenssi | MIT |
| Latauskoko | Noin 160 gigatavua |
Lähteet:
V4 Flash ja suurempi V4 Pro on julkaistu sallivalla MIT-lisenssillä. Se mahdollistaa mallin kaupallisen käytön, muokkaamisen ja jakelun ilman rojaltimaksuja . Painot ovat saatavilla muun muassa Hugging Facessa, joten organisaatiot voivat ajaa mallia omassa infrastruktuurissaan sen sijaan, että kaikki aineisto kulkisi ulkopuolisen API-palvelun kautta.
Tämä on merkittävä ero suljettuihin malleihin verrattuna. Yritys voi esimerkiksi rakentaa mallin päälle oman ohjelmistotuotteen, hienosäätää sitä tai käyttää sitä yksityisessä pilviympäristössä lisenssin sallimissa rajoissa. Saatavilla olevien lähteiden mukaan V4-malliperhe on tässä kokoluokassa ainoa avoimien painojen kokonaisuus, joka tarjoaa miljoonan tokenin kontekstin sallivalla MIT-lisenssillä .
Miljoonan tokenin konteksti tarkoittaa, että malli voi käsitellä erittäin pitkiä aineistoja, kuten laajoja koodivarastoja, sopimuskokonaisuuksia tai pitkiä keskusteluhistorioita. Näin suuren kontekstin käsittely olisi kuitenkin raskasta perinteisellä tiheällä attention-laskennalla.
DeepSeek ratkaisee ongelmaa hybridillä attention-arkkitehtuurilla, jossa yhdistyvät kaksi mekanismia:
Mallin kerrokset vuorottelevat näiden mekanismien välillä. Toisen kerroksen jälkeen parilliset kerrokset käyttävät CSA:ta ja kolmannen kerroksen jälkeen parittomat HCA:ta. Lisäksi mallissa on aina viimeisiin 128 raakaan tokeniin ulottuva liukuva ikkuna, jotta aivan tuore konteksti säilyy tarkkana .
V4 Flash käyttää sekatarkkuutta mallin muistijalanjäljen pienentämiseen:
nvidia/DeepSeek-V4-Flash-NVFP4 .Pelkillä FP8-painoilla 284 miljardin parametrin mallin painot veisivät noin 284 gigatavua. Miljoonan tokenin kontekstilla itse ylläpito vaatii lähteiden mukaan suositeltuna kokoonpanona neljä NVIDIA H200 SXM5 -grafiikkasuoritinta, yhteensä 564 gigatavua VRAM-muistia . Tämä kertoo samalla mallin avoimuuden rajoituksesta: painojen lataaminen on mahdollista, mutta täysi tuotantokäyttö ei ole tavallisen työaseman tehtävä.
DeepSeek V4 Flash tarjoaa konfiguroitavan reasoning_effort-asetuksen. Sen avulla kehittäjä voi vaihtaa nopean vastauksen ja perusteellisemman päättelyn välillä:
Asetus on käytännöllinen etenkin sovelluksissa, joissa kaikki pyynnöt eivät tarvitse samaa laskentamäärää. Luokittelussa tai yksinkertaisessa tiedonpoiminnassa voidaan suosia nopeutta, kun taas koodin generointi ja monivaiheinen suunnittelu voidaan ohjata raskaampaan tilaan .
DeepSeekin ilmoittama V4 Flash -hinnoittelu on:
Välimuistiosuma voi syntyä esimerkiksi toistuvasta järjestelmäkehotteesta tai samasta keskustelun alkuosasta. Tällöin syötteen hinta laskee 98 prosenttia .
Useat lähteet kuvaavat V4 Flashia halvimmaksi saatavilla olevaksi frontier-tason API:ksi. Vertailuluvuissa sen tulostokenit ovat noin 54 kertaa Sonnet 4.6:ta edullisempia ja 107 kertaa GPT-5.5:tä edullisempia . Hintoja kannattaa silti verrata aina saman palveluntarjoajan ajantasaisista ehdoista, sillä mallien nimet, välimuistihinnat ja saatavuus voivat muuttua.
Julkaisun mukaan Flash saavuttaa agentti- ja koodaustehtävissä vertailukelpoisen tason suuremman V4 Pro -sisarmallinsa kanssa . Tämä haastaa perinteisen oletuksen, jonka mukaan Pro olisi aina automaattisesti paras valinta monivaiheiseen koodityöhön .
Tarkkoja SWE-bench-tuloksia V4-Flash-0731:lle ei kuitenkaan löytynyt tarkastelluista lähteistä. Siksi mallin suorituskyvystä ei pidä tehdä tätä pidemmälle meneviä päätelmiä pelkkien markkinointivertailujen perusteella .
DeepSeekin toinen merkittävä avaus on DeepSeek Harness, agenttien suorituskehys. Se on ohjelmistokerros, joka toimii suuren kielimallin ympärillä ja vastaa muun muassa kontekstin hallinnasta, työkalukutsuista ja tehtävän etenemisestä .
Tavoitteena on muuttaa kielimalli pelkästä vastausten tuottajasta järjestelmäksi, joka voi esimerkiksi suunnitella työvaiheet, käyttää työkaluja ja viedä tehtävän loppuun itsenäisesti. Harness mainittiin ensimmäisen kerran V4-Flash-0731:n 31. heinäkuuta julkaistussa muutoslokissa merkinnällä ”julkaistaan pian” .
DeepSeek aloitti 1. elokuuta 2026 avoimen lähdekoodin kehittäjien rekrytoinnin Harnessin suljettuun betaan . Hakijoilta edellytetään kokemusta Agent Harness -aiheisista projekteista, ja heidän on toimitettava GitHub-tunnuksensa sekä esimerkkejä aiemmasta työstään . Harnessille ei lähteiden perusteella ole vielä ilmoitettu julkaisupäivää.
Kehitystiimi perustettiin lähteiden mukaan maaliskuussa 2026, jolloin Cui Tianyi liittyi DeepSeekiin rakentamaan sitä . Cui Tianyin aiemmista tehtävistä TSY Capitalissa ja Jane Streetillä on kuitenkin löytynyt vain yksittäinen maininta, jota ei ole pystytty vahvistamaan riippumattomista lähteistä .
DeepSeekin toimitusjohtaja Liang Wenfeng yhdistetään strategiaan, jossa halvat ja kyvykkäät mallit nähdään tienä kohti yleisälyä eli AGI:a . Yhtiön hinnoittelu ja MIT-lisenssi ovat tämän ajattelun konkreettisimpia ilmentymiä: tehokas malli pyritään tekemään mahdollisimman laajasti saataville sekä API:nä että avoimina painoina.
DeepSeek kilpailee Kiinassa muun muassa Alibaban Qwen-mallien, ByteDancen Doubaon, Moonshot AI:n, MiniMaxin ja Z.AI:n kanssa . V4-perheen erikoisasema on avoimien painojen ja sallivan MIT-lisenssin yhdistelmä, vaikka kilpailijat voivat olla vahvoja suljetuissa palveluissa ja tietyissä käyttötapauksissa.
Lähteissä viitataan myös DeepSeekin mahdollisiin listautumisvalmisteluihin, mutta listautumisen aikataulua, pääjärjestäjiä tai vahvistettuja hakemustietoja ei ole ilmoitettu .
Kehittäjille V4 Flashin tärkein viesti on yhdistelmä: suuri konteksti, avoimet painot, säädettävä päättely ja erittäin matala API-hinta. Yrityksille MIT-lisenssi voi tarjota enemmän hallintaa kuin suljettu palvelu, mutta itse ylläpidon laitteistovaatimukset ovat edelleen huomattavat.
DeepSeek Harness puolestaan osoittaa, että kilpailu ei enää koske vain sitä, mikä malli vastaa parhaiten. Se koskee myös sitä, mikä ekosysteemi pystyy hallitsemaan työkaluja, pitkiä tehtäväketjuja ja agenttien käytännön suorittamista. V4 Flashin seuraava testi onkin se, miten hyvin nämä ominaisuudet toimivat todellisissa tuotantoympäristöissä — ei vain julkaisutason vertailuissa.