| Model | Jenis Token | Tarif Tetap Sebelumnya | Off-peak (baru) | Peak (baru) | Perubahan Efektif |
|---|---|---|---|---|---|
| V4-Flash | Input (cache miss) | $0,14 | $0,21 | $0,42 | +50% off-peak, +200% peak |
| V4-Flash | Input (cache hit) | $0,0028 | $0,007 | $0,014 | +150% off-peak, +400% peak |
| V4-Flash | Output | $0,28 | $0,42 | $0,84 | +50% off-peak, +200% peak |
| V4-Pro | Input (cache miss) | $0,435 | $0,99 | $1,98 | +128% off-peak, +355% peak |
| V4-Pro | Input (cache hit) | $0,003625 | $0,03 | $0,06 | +728% off-peak, +1.555% peak |
| V4-Pro | Output | $0,87 | $1,98 | $3,96 | +128% off-peak, +355% peak |
Kenaikan paling ekstrem adalah input cache-hit V4-Pro, dari $0,003625 menjadi $0,06 di jam peak — kenaikan sekitar 1.555% . DeepSeek mengatakan perubahan ini dilakukan untuk mengalokasikan sumber daya secara lebih efisien dan mendorong pengguna menjadwalkan beban kerja yang tidak mendesak selama jendela off-peak
.
Pada Agustus 2026, firma pengujian independen Composio mengevaluasi DeepSeek V4 Flash di delapan kerangka orkestrasi agen yang berbeda pada 30 alur kerja multi-langkah yang sengaja dibuat sulit, mencakup alat langsung seperti Gmail, GitHub, Slack, dan Google Sheets . Setiap tugas memiliki batas waktu 900 detik, dan semua kerangka menggunakan alat MCP Composio yang sama
.
Hasil keseluruhan: dari total 240 kali percobaan, hanya 129 yang berhasil — tingkat keberhasilan keseluruhan 53,8%. Hanya 6 dari 30 alur kerja yang berhasil diselesaikan oleh setiap kerangka .
| Kerangka | Tingkat Keberhasilan (dari 30 tugas) | Biaya per tugas berhasil |
|---|---|---|
| Pi Agent | 20/30 (66,7%) | $0,028 |
| Prime Agent | ~15/24 (62,5% larian valid) | $0,131 |
| OMP (Oh My Pi) | 17/30 (56,7%) | $0,103 |
| Claude Code | 16/30 (53,3%) | $0,195 |
| Codex | 16/30 (53,3%) | $0,081 |
| Deep Agents (LangChain) | 16/30 (53,3%) | $0,045 |
| Hermes Agent | 15/30 (50,0%) | $0,056 |
| OpenCode | 14/30 (46,7%) | $0,067 |
Pi Agent memimpin dalam tingkat keberhasilan (20/30) dan efisiensi biaya ($0,028/tugas) . Kerangka yang berbeda menang di setiap metrik — tingkat keberhasilan, biaya, dan kecepatan — yang berarti pilihan orkestrasi sama pentingnya dengan kemampuan model
. Kesenjangan 20 poin antara kerangka terbaik dan terburuk menunjukkan sensitivitas ekstrem terhadap kerangka agen, konfigurasi alat, caching, percobaan ulang, dan tumpukan penyedia
.
Kombinasi harga yang lebih tinggi dan hasil dunia nyata yang tidak merata telah mengubah pandangan analis tentang kesesuaian DeepSeek V4 untuk perusahaan.
VentureBeat mencatat bahwa model V4 Flash yang sama menghasilkan hasil yang sangat berbeda tergantung pada kerangka, perangkat, dan tumpukan caching — menunjukkan bahwa perusahaan harus berinvestasi dalam kematangan orkestrasi di samping pemilihan model . Komentar Composio sendiri menunjukkan bahwa pilihan kerangka saja mengubah keberhasilan hingga tiga tugas, biaya hampir 3x lipat, dan kecepatan 2,2x lipat
.
Bahkan di off-peak, setiap jenis token lebih mahal dari sebelumnya. Analis mengatakan ini mengubah kalkulasi ROI untuk beban kerja agen volume tinggi, terutama untuk agen layanan pelanggan dan jalur pembuatan kode yang sebelumnya mengandalkan harga DeepSeek yang sangat murah .
Tolok ukur agen resmi DeepSeek (82,7 di Terminal-Bench 2.1, 70,3 di Toolathlon-Verified) terlihat kuat, tetapi tingkat keberhasilan dunia nyata 53,8% adalah pengingat bahwa skor papan peringkat tidak menjamin keandalan di lingkungan produksi dengan API langsung, batas tarif, dan alur kerja stateful .
Lalu lintas API melewati server di China, menciptakan tantangan kepatuhan bagi perusahaan yang diatur. Analis menyarankan perencanaan arsitektur yang cermat untuk tata kelola data, jejak audit, dan kontrol izin alat . Untuk industri teregulasi, self-hosting bobot terbuka tetap menjadi satu-satunya jalur yang layak menuju produksi
.