| Model | Jenis token | Kadar tetap sebelumnya | Luar puncak (baharu) | Puncak (baharu) | Perubahan efektif |
|---|---|---|---|---|---|
| V4-Flash | Input (cache miss) | $0.14 | $0.21 | $0.42 | +50% luar puncak, +200% puncak |
| V4-Flash | Input (cache hit) | $0.0028 | $0.007 | $0.014 | +150% luar puncak, +400% puncak |
| V4-Flash | Output | $0.28 | $0.42 | $0.84 | +50% luar puncak, +200% puncak |
| V4-Pro | Input (cache miss) | $0.435 | $0.99 | $1.98 | +128% luar puncak, +355% puncak |
| V4-Pro | Input (cache hit) | $0.003625 | $0.03 | $0.06 | +728% luar puncak, +1,555% puncak |
| V4-Pro | Output | $0.87 | $1.98 | $3.96 | +128% luar puncak, +355% puncak |
Kenaikan paling drastik ialah input cache-hit V4-Pro, yang naik daripada $0.003625 kepada $0.06 pada waktu puncak — kira-kira peningkatan 1,555% . DeepSeek menyatakan perubahan itu dibuat untuk memperuntukkan sumber dengan lebih cekap dan menggalakkan pengguna menjadualkan beban kerja yang tidak mendesak semasa waktu luar puncak
.
Pada Ogos 2026, firma ujian bebas Composio menilai DeepSeek V4 Flash merentasi lapan rangka kerja orkestrasi ejen berbeza pada 30 aliran kerja pelbagai langkah yang sengaja sukar merangkumi alat langsung termasuk Gmail, GitHub, Slack dan Google Sheets . Setiap tugasan mempunyai tamat masa 900 saat, dan semua rangka kerja menggunakan alat MCP Composio yang dihoskan yang sama
.
Keputusan keseluruhan: daripada 240 jumlah larian, hanya 129 berjaya — kadar lulus keseluruhan 53.8%. Hanya 6 daripada 30 aliran kerja telah diselesaikan dengan jayanya oleh setiap rangka kerja .
| Rangka Kerja | Kadar lulus (daripada 30 tugasan) | Kos setiap tugasan berjaya |
|---|---|---|
| Pi Agent | 20/30 (66.7%) | $0.028 |
| Prime Agent | ~15/24 (62.5% larian sah) | $0.131 |
| OMP (Oh My Pi) | 17/30 (56.7%) | $0.103 |
| Claude Code | 16/30 (53.3%) | $0.195 |
| Codex | 16/30 (53.3%) | $0.081 |
| Deep Agents (LangChain) | 16/30 (53.3%) | $0.045 |
| Hermes Agent | 15/30 (50.0%) | $0.056 |
| OpenCode | 14/30 (46.7%) | $0.067 |
Pi Agent mendahului dalam kedua-dua kadar kejayaan (20/30) dan kecekapan kos ($0.028/tugasan) . Rangka kerja yang berbeza menang pada setiap metrik — kadar kejayaan, kos dan kelajuan — bermakna pilihan orkestrasi sama penting dengan keupayaan model
. Jurang 20 mata antara rangka kerja terbaik dan terburuk menunjukkan sensitiviti melampau terhadap rangka kerja ejen, konfigurasi alat, caching, percubaan semula dan timbunan pembekal
.
Gabungan harga yang lebih tinggi dan keputusan dunia sebenar yang tidak sekata telah membentuk semula pandangan penganalisis terhadap kesesuaian perusahaan DeepSeek V4.
VentureBeat menyatakan bahawa model V4 Flash yang sama menghasilkan keputusan yang berbeza secara substansial bergantung pada rangka kerja, alat dan timbunan caching — mencadangkan perusahaan mesti melabur dalam kematangan orkestrasi bersama pemilihan model . Komen Composio sendiri menunjukkan bahawa pilihan rangka kerja sahaja mengubah kejayaan sebanyak tiga tugasan, kos hampir 3x, dan kelajuan sebanyak 2.2x
.
Walaupun luar puncak, setiap jenis token lebih mahal daripada sebelumnya. Penganalisis mengatakan ini mengubah kalkulasi ROI untuk beban kerja ejen volum tinggi, terutamanya untuk ejen sokongan pelanggan dan saluran paip penjanaan kod yang sebelum ini bergantung pada harga DeepSeek yang sangat rendah .
Penanda aras ejen rasmi DeepSeek (82.7 pada Terminal-Bench 2.1, 70.3 pada Toolathlon-Verified) kelihatan kukuh, tetapi kadar lulus dunia sebenar 53.8% adalah peringatan bahawa skor pendahulu tidak menjamin kebolehpercayaan dalam persekitaran pengeluaran dengan API langsung, had kadar dan aliran kerja keadaan .
Lalu lintas API melalui pelayan di China, mewujudkan cabaran pematuhan untuk perusahaan terkawal. Penganalisis menasihatkan perancangan seni bina yang teliti untuk tadbir urus data, jejak audit dan kawalan kebenaran alat . Untuk industri terkawal, pengehosan sendiri pemberat sumber terbuka kekal sebagai satu-satunya laluan yang boleh dilaksanakan untuk pengeluaran
.