Mulai pukul 00.00 waktu Beijing pada 17 Agustus 2026, DeepSeek menerapkan tarif berbasis waktu untuk V4 Flash dan V4 Pro. Jam peak berlangsung setiap hari pada 09.00–12.00 dan 14.00–18.00 waktu Beijing, setara dengan 08.00–11.00 dan 13.00–17.00 WIB.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek mengubah cara penagihan API untuk dua model V4-nya. Mulai pukul 00.00 waktu Beijing pada 17 Agustus 2026—atau 16.00 UTC pada 16 Agustus—tarif tetap digantikan oleh skema peak dan off-peak. Tarif off-peak persis setengah dari tarif peak, sementara kenaikan dibandingkan harga lama berkisar antara 50% hingga 1.100%, bergantung pada model, jenis token, dan waktu penggunaan. 1
2
Skema baru berlaku untuk DeepSeek-V4-Flash dan DeepSeek-V4-Pro. Periode peak setiap hari adalah:
Di luar dua rentang tersebut, permintaan masuk periode off-peak. Waktu yang digunakan untuk menentukan tarif adalah saat server platform menerima permintaan, bukan ketika proses selesai. 2
7
Bagi pengembang di Indonesia, waktu Beijing berada di zona waktu yang sama dengan WIB, yakni UTC+8 untuk Beijing dan UTC+7 untuk WIB? Wait, Beijing is UTC+8 and WIB UTC+7. Need correct.
Dengan demikian, jadwal peak tersebut setara dengan 08.00–11.00 dan 13.00–17.00 WIB. Satu panggilan API yang sama dapat dikenai biaya dua kali lipat hanya karena dikirim pada salah satu jendela peak.
Seluruh angka di bawah ini menggunakan yuan Tiongkok per satu juta token. Cache hit berarti bagian input dapat memakai awalan prompt yang sebelumnya tersimpan di cache. Cache miss berarti input diproses tanpa memanfaatkan cache dan dikenai tarif input yang lebih tinggi.
| Model dan jenis token | Tarif lama | Off-peak | Perubahan dari tarif lama | Peak | Perubahan dari tarif lama |
|---|---|---|---|---|---|
| V4-Flash, input cache hit | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash, input cache miss | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash, output | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro, input cache hit | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1.100% |
| V4-Pro, input cache miss | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro, output | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
Untuk V4-Flash, dokumentasi mencantumkan tarif off-peak sebesar ¥0,05 untuk input cache hit, ¥1,50 untuk input cache miss, dan ¥4,50 untuk output. Tarif peak masing-masing naik menjadi ¥0,10, ¥3, dan ¥9. 2 Reuters melaporkan bahwa penyesuaian harga secara keseluruhan berada di rentang 50% hingga 1.100%.
1
8
Evaluasi model, pengindeksan dokumen, pemrosesan ulang data, pembuatan data sintetis, serta pekerjaan agen yang tidak mendesak dapat dimasukkan ke antrean dan dijalankan di luar jam peak. Karena tarif off-peak hanya setengah dari tarif peak, penjadwalan dapat memangkas biaya secara berarti tanpa mengganti model atau mengurangi anggaran token. 2
Ini membuat zona waktu menjadi variabel operasional baru dalam infrastruktur AI. Sistem antrean dapat mempertimbangkan tenggat pekerjaan sekaligus jendela penagihan waktu Beijing, lalu menunda pekerjaan yang fleksibel.
Layanan pelanggan, asisten pemrograman, dan agen real-time biasanya harus bekerja ketika pengguna sedang aktif. Aplikasi semacam ini mungkin tidak dapat menghindari tarif peak, tetapi biaya masih bisa ditekan melalui beberapa cara:
Cache menjadi sangat penting karena input cache hit tetap jauh lebih murah dibandingkan input cache miss pada kedua model. Untuk sistem bervolume tinggi yang berulang kali mengirim instruksi, definisi tool, atau konteks dokumen yang sama, peningkatan rasio cache hit dapat berdampak lebih besar daripada sekadar mengurangi jumlah permintaan.
Jejak penalaran yang panjang, pembuatan laporan, dan respons kode berukuran besar mengonsumsi banyak token output. Pada jam peak, tarif output mencapai ¥9 per satu juta token untuk Flash dan ¥27 untuk Pro. Pengembang dapat merespons dengan menetapkan batas output yang lebih ketat, memakai Flash untuk permintaan rutin, serta menyimpan Pro untuk tugas yang benar-benar membutuhkan kemampuan tambahannya. 1
2
Tarif peak untuk input cache hit V4-Pro menjadi 12 kali lipat dari tarif tetap sebelumnya—kenaikan persentase terbesar dalam jadwal baru. Nilai absolutnya masih kecil dibandingkan input cache miss dan output, tetapi perubahan ini penting bagi aplikasi dengan volume sangat besar dan prompt yang berulang kali memanfaatkan cache. 1
19
Perubahan harga tersebut muncul setelah DeepSeek-V4-Pro-0813 tersedia secara umum melalui endpoint deepseek-v4-pro pada Agustus. Spesifikasi yang dilaporkan mencakup model teks dengan jendela konteks satu juta token, output maksimum 384.000 token, serta arsitektur mixture-of-experts dengan sekitar 1,6 triliun parameter total dan 49 miliar parameter aktif per token. 29
33
Dokumentasi batas konkurensi pada tingkat akun juga membedakan kedua model tersebut:
Satu permintaan menempati satu slot hingga seluruh proses selesai, termasuk ketika respons dikirim secara streaming. 28
Jika digabungkan, struktur harga dan batas konkurensi ini menunjukkan segmentasi produk: Flash lebih cocok untuk lalu lintas rutin ber-throughput tinggi, sedangkan Pro diposisikan sebagai tier dengan kapasitas lebih terbatas untuk penalaran berat dan pekerjaan berkonteks besar. Kesimpulan tersebut merupakan inferensi dari struktur ekonomi dan batas layanan yang dipublikasikan, bukan pernyataan langsung bahwa setiap penggunaan harus mengikuti pembagian tersebut. 2
28
Perubahan DeepSeek menyerupai strategi pengaturan permintaan untuk inferensi GPU. Penyedia AI menghadapi lonjakan permintaan pada jam ketika pengguna interaktif aktif, sedangkan pekerjaan batch sering kali dapat ditunda. Tarif yang lebih tinggi pada periode padat dan lebih rendah pada waktu lain memberi insentif untuk menyebarkan beban komputasi sepanjang hari.
Bagi pengembang, optimasi biaya kini tidak lagi hanya soal memilih model dan menghitung token. Tim produksi juga harus menentukan:
Dalam konteks persaingan model AI skala besar, langkah ini menunjukkan pergeseran dari persaingan harga tetap menuju harga yang mengikuti kelangkaan kapasitas komputasi. DeepSeek tetap menyediakan jalur yang lebih murah bagi beban kerja fleksibel, tetapi membuat biaya inferensi kelas atas lebih sensitif terhadap waktu penggunaannya. Reuters menggambarkan perubahan tersebut sebagai kenaikan besar yang bervariasi menurut model, kategori token, dan periode penggunaan—bukan sekadar biaya tambahan seragam untuk semua permintaan. 1
Pelajaran praktis bagi tim yang memakai DeepSeek V4 cukup jelas: jadikan penjadwalan, caching, routing model, dan pengendalian output sebagai bagian dari perhitungan biaya API. Pekerjaan yang tidak bisa dipindahkan waktunya mungkin memerlukan model berbeda atau anggaran token lebih ketat. Sebaliknya, pekerjaan yang bisa menunggu berpeluang mempertahankan efisiensi biaya dengan dijalankan pada periode off-peak.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Mulai pukul 00.00 waktu Beijing pada 17 Agustus 2026, DeepSeek menerapkan tarif berbasis waktu untuk V4 Flash dan V4 Pro.
Mulai pukul 00.00 waktu Beijing pada 17 Agustus 2026, DeepSeek menerapkan tarif berbasis waktu untuk V4 Flash dan V4 Pro. Jam peak berlangsung setiap hari pada 09.00–12.00 dan 14.00–18.00 waktu Beijing, setara dengan 08.00–11.00 dan 13.00–17.00 WIB.
Pada jam peak, output dikenai tarif ¥9 per satu juta token untuk V4 Flash dan ¥27 untuk V4 Pro.