DeepSeek siirtyi V4 Flashin ja V4 Pron osalta aikaperusteiseen hinnoitteluun 17. Ruuhka aikoina V4 Flashin tulostokenit maksavat 9 ¥ ja V4 Pron 27 ¥ miljoonaa tokenia kohden.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek korvasi V4-malliensa kiinteän API-hinnoittelun ruuhka- ja hiljaisen ajan hinnoittelulla 17. elokuuta 2026 kello 00.00 Pekingin aikaa eli 16. elokuuta kello 16.00 UTC-aikaa. Hiljaisen ajan hinnat ovat täsmälleen puolet ruuhka-ajan hinnoista. Uudet hinnat ovat mallista, token-tyypistä ja käyttöajankohdasta riippuen 50–1 100 prosenttia aiempia hintoja korkeammat. 1
2
Muutos koskee malleja DeepSeek-V4-Flash ja DeepSeek-V4-Pro. Pekingin ajan ruuhka-ajat ovat päivittäin:
Kaikki muut ajat ovat hiljaista aikaa. Yksittäinen pyyntö laskutetaan sen perusteella, milloin DeepSeekin palvelin vastaanottaa sen. Kehittäjien on siis huomioitava Pekingin aika myös silloin, kun liikennettä ajoitetaan automaattisesti. 2
7
Kyse ei ole vain tasaisesta hinnankorotuksesta. Sama mallikutsu maksaa ruuhka-aikana kaksi kertaa enemmän kuin hiljaisena aikana.
Alla olevat hinnat on ilmoitettu Kiinan juaneina miljoonaa tokenia kohden. Välimuistiosuma tarkoittaa, että syötteen aiemmin tallennettu kehoteosa voidaan hyödyntää uudelleen. Välimuistihaku tarkoittaa, ettei vastaavaa aiempaa sisältöä voida hyödyntää ja syöte käsitellään korkeammalla hinnalla.
| Malli ja token-tyyppi | Aiempi kiinteä hinta | Hiljainen aika | Muutos aiempaan | Ruuhka-aika | Muutos aiempaan |
|---|---|---|---|---|---|
| V4-Flash, syöte, välimuistiosuma | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, syöte, välimuistihaku | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, tuloste | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, syöte, välimuistiosuma | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1 100 % |
| V4-Pro, syöte, välimuistihaku | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, tuloste | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
V4-Flashin hinnat on dokumentoitu erikseen seuraavasti: hiljaisena aikana välimuistiosuman sisältävä syöte maksaa ¥0,05, välimuistihakuun perustuva syöte ¥1,50 ja tuloste ¥4,50 miljoonaa tokenia kohden. Ruuhka-aikana vastaavat hinnat ovat ¥0,10, ¥3 ja ¥9. 2 Laajemmin tarkasteltuna V4-hintojen korotukset vaihtelevat eri mallien ja token-tyyppien välillä 50 prosentista 1 100 prosenttiin.
1
8
Arviointiajot, dokumenttien indeksointi, tietokantojen täydennykset, synteettisen datan tuottaminen ja muut kiireettömät tehtävät voidaan jonottaa ruuhka-aikojen ulkopuolelle. Koska hiljaisen ajan hinta on puolet ruuhka-ajan hinnasta, pelkkä ajoituksen muuttaminen voi pienentää joustavien työkuormien kustannuksia merkittävästi. 2
AI-infrastruktuurissa aikavyöhykkeestä tulee näin uusi käyttömuuttuja. Jonotusjärjestelmä voi ottaa huomioon sekä tehtävän määräajan että Pekingin ajan laskutusikkunan ja siirtää työn myöhemmäksi ilman mallin vaihtamista tai token-budjetin pienentämistä.
Asiakaspalvelu, koodausavustajat ja reaaliaikaiset agentit toimivat yleensä silloin, kun käyttäjät ovat aktiivisia. Niiden on siksi ehkä hyväksyttävä ruuhka-ajan hinnat. Kuluja voi silti vähentää käyttämällä kehotteita uudelleen, suunnittelemalla pyynnöt välimuistiystävällisiksi, lyhentämällä tulosteita ja reitittämällä tehtäviä eri mallien välillä.
Välimuistin tehokas käyttö on erityisen tärkeää, sillä välimuistiosumaan perustuva syöte on molemmissa malleissa paljon välimuistihakua edullisempi. Jos järjestelmä lähettää toistuvasti samat ohjeet, työkalumääritykset tai dokumenttikontekstin, välimuistiosumien osuuden kasvattaminen voi olla kustannusten kannalta merkittävämpää kuin pienten pyyntömäärien vähentäminen.
Pitkät päättelyketjut, laajat raportit ja suuret koodivastaukset kuluttavat paljon tulostetokeneita. Ruuhka-aikana niiden hinta on V4-Flashilla ¥9 ja V4-Prolla ¥27 miljoonaa tokenia kohden. Kehittäjät voivat vastata tähän rajoittamalla tulosteen enimmäispituutta, käyttämällä Flashia rutiinitehtävissä ja varaamalla Pron tehtäviin, joissa sen lisäteho oikeuttaa korkeamman hinnan. 1
2
V4-Pron ruuhka-ajan välimuistiosuman hinta on 12-kertainen aiempaan kiinteään hintaan verrattuna, mikä on uuden hinnoittelun suurin prosentuaalinen korotus. Hinta on edelleen absoluuttisesti pieni verrattuna välimuistihakuihin ja tulosteisiin, mutta muutos voi olla merkittävä sovelluksille, jotka käsittelevät erittäin suuria määriä toistuvasti välimuistittuvaa sisältöä. 1
19
Hinnoittelumuutos seurasi DeepSeek-V4-Pro-0813-version yleistä saatavuutta. Malli tuli käyttöön deepseek-v4-pro-päätepisteen kautta elokuussa. Julkaistujen tietojen mukaan kyseessä on tekstimalli, jonka konteksti-ikkuna on miljoona tokenia ja suurin tulostepituus 384 000 tokenia. Malli perustuu mixture-of-experts-arkkitehtuuriin, jossa on noin 1,6 biljoonaa kokonaisparametria ja noin 49 miljardia aktiivista parametria tokenia kohden. 29
33
DeepSeekin dokumentoidut tilikohtaiset samanaikaisuusrajat erottavat mallit toisistaan:
Pyyntö varaa paikan siihen asti, että käsittely päättyy. Tämä koskee myös suoratoistona toimitettavia vastauksia. 28
Hinnoittelu ja samanaikaisuusrajat viittaavat tuotesegmentointiin, jossa Flash sopii paremmin suuren läpimenon rutiiniliikenteeseen ja Pro kapasiteetiltaan rajatummaksi vaihtoehdoksi vaativaan päättelyyn ja laajoihin konteksteihin. Kyse on julkaistuista hinnoista ja rajoista tehdyssä päätelmässä, ei DeepSeekin suorasta luonnehdinnasta jokaisesta käyttötapauksesta. 2
28
DeepSeekin ratkaisu muistuttaa GPU-pohjaisen päättelyn kysynnän ohjaamista. Palveluntarjoajilla on yleensä eniten painetta silloin, kun vuorovaikutteiset käyttäjät ovat verkossa, kun taas eräajot voidaan usein siirtää myöhemmäksi. Korkeampi ruuhkahinta ja edullisempi hiljaisen ajan hinta kannustavat levittämään laskentaa tasaisemmin vuorokauden aikana.
Kehittäjien optimointitehtävä muuttuu samalla. Kustannusten hallinta ei tarkoita enää vain mallin valitsemista ja tokenien laskemista. Tuotantojärjestelmissä on päätettävä myös:
Laajemmin katsottuna muutos vie suurten kielimallien hintakilpailua pois tasahintaisesta alihinnoittelusta kohti kapasiteetin niukkuuteen perustuvaa hinnoittelua. DeepSeek tarjoaa edelleen edullisemman väylän joustavalle kysynnälle, mutta tekee huippuluokan päättelyn hinnasta aiempaa riippuvaisemman käyttöajankohdasta. Reuters kuvasi muutosta huomattavaksi hinnankorotukseksi, joka vaihtelee mallin, token-luokan ja käyttöajan mukaan – ei yhdeksi kaikille samaa suuruusluokkaa olevaksi lisämaksuksi. 1
DeepSeek V4:ää käyttäville tiimeille käytännön johtopäätös on selkeä: ajoitus, välimuisti, mallin reititys ja tulosteen hallinta on otettava mukaan API-kustannusmalliin. Tehtävä, jota ei voi siirtää myöhemmäksi, voi vaatia toisen mallin tai tiukemman token-budjetin. Tehtävä, joka voi odottaa, saattaa puolestaan säilyttää suuren osan kustannustehokkuudestaan ajamalla hiljaisena aikana.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek siirtyi V4 Flashin ja V4 Pron osalta aikaperusteiseen hinnoitteluun 17.
DeepSeek siirtyi V4 Flashin ja V4 Pron osalta aikaperusteiseen hinnoitteluun 17. Ruuhka aikoina V4 Flashin tulostokenit maksavat 9 ¥ ja V4 Pron 27 ¥ miljoonaa tokenia kohden.
Muutos tekee tehtävien ajoituksesta, kehotteiden välimuistittamisesta, mallin reitityksestä ja tulosteen pituuden rajoittamisesta osan API kustannusten hallintaa.