Pada saat yang sama, DeepSeek mulai mengundang pengembang proyek open source untuk mengikuti uji beta tertutup DeepSeek Harness—kerangka kerja yang dirancang agar model bahasa besar dapat beroperasi sebagai agen AI, termasuk mengelola konteks, memanggil alat, dan menyelesaikan tugas secara lebih mandiri .
V4 Flash adalah varian efisiensi dalam keluarga DeepSeek V4. Model ini ditujukan untuk kebutuhan yang membutuhkan biaya rendah, latensi relatif cepat, dan volume permintaan tinggi—misalnya percakapan, ekstraksi informasi, klasifikasi, bantuan pemrograman, serta alur kerja agen.
Arsitektur MoE memungkinkan model memiliki kumpulan “pakar” yang sangat besar tanpa harus mengaktifkan seluruh parameter untuk setiap token. Dengan demikian, V4 Flash memiliki akses ke kapasitas total 284 miliar parameter, tetapi beban komputasi per token lebih terukur karena hanya sekitar 13 miliar parameter yang digunakan .
| Spesifikasi | Detail |
|---|---|
| Parameter total | 284 miliar |
| Parameter aktif | 13 miliar per token |
| Arsitektur | Mixture-of-Experts (MoE) |
| Jendela konteks | 1 juta token |
| Output maksimum | 384 ribu token |
| Presisi | Campuran FP4 dan FP8 |
| Lisensi | MIT |
| Ukuran unduhan | Sekitar 160 GB |
Catatan: total parameter repositori dapat mencapai 304 miliar jika modul draft DSpark untuk speculative decoding turut dihitung .
Keluarga DeepSeek V4 pertama kali hadir sebagai versi pratinjau pada April 2026. Versi produksi V4-Flash-0731 yang dirilis pada 31 Juli menggantikan versi pratinjau tersebut. Menurut catatan rilis, ukuran dan arsitekturnya tidak berubah secara mendasar; peningkatan kemampuan terutama berasal dari proses re-post-training .
Bobot model tersedia melalui platform seperti Hugging Face, sehingga pengembang dan perusahaan dapat mengunduhnya untuk menjalankan model di infrastruktur sendiri. Lisensi MIT juga mengizinkan penggunaan komersial, modifikasi, dan distribusi tanpa biaya royalti .
Namun, lisensi perangkat lunak tidak menghilangkan kebutuhan infrastruktur. Ukuran bobot dan kebutuhan memori untuk konteks 1 juta token tetap membuat penerapan lokal skala penuh membutuhkan perangkat keras kelas pusat data. Pada konfigurasi FP8, bobot model saja diperkirakan membutuhkan sekitar 284 GB memori, sementara konfigurasi yang direkomendasikan untuk konteks penuh 1 juta token adalah empat GPU NVIDIA H200 SXM5 dengan total VRAM 564 GB .
Kemampuan membaca konteks hingga 1 juta token ditopang oleh arsitektur perhatian hibrida yang menggabungkan Compressed Sparse Attention (CSA) dan Heavily Compressed Attention (HCA).
Lapisan perhatian tersebut digunakan secara bergantian. Lapisan genap mulai dari lapisan kedua memakai CSA, sedangkan lapisan ganjil mulai dari lapisan ketiga memakai HCA. Di samping itu, tersedia jendela geser yang selalu mempertahankan 128 token terbaru agar model tetap peka terhadap informasi paling mutakhir .
V4 Flash menggunakan presisi campuran untuk menekan kebutuhan penyimpanan dan memori saat inferensi:
nvidia/DeepSeek-V4-Flash-NVFP4 .Dalam praktiknya, presisi campuran ini membantu mengurangi jejak model dibandingkan checkpoint yang sepenuhnya menggunakan FP8. Meski begitu, “13 miliar parameter aktif” tidak berarti model dapat dijalankan dengan kebutuhan memori setara model 13 miliar parameter biasa. Seluruh kumpulan bobot pakar tetap perlu tersedia ketika model dioperasikan.
DeepSeek V4 Flash menyediakan parameter reasoning_effort yang memungkinkan pengembang menukar kecepatan dengan kedalaman penalaran. Tiga mode yang tersedia adalah:
Pengaturan ini memberi pengembang kontrol yang lebih praktis. Permintaan sederhana tidak harus selalu melewati mode penalaran paling mahal, sementara tugas pemrograman atau perencanaan bertahap dapat diberi anggaran penalaran yang lebih besar .
Harga resmi yang tercantum untuk DeepSeek V4 Flash adalah:
| Jenis token | Harga per 1 juta token |
|---|---|
| Input, cache miss | US$0,14 |
| Input, cache hit | US$0,0028 |
| Output | US$0,28 |
Input yang berasal dari prompt atau awalan yang sudah tersimpan dalam cache mendapatkan potongan sekitar 98 persen dibandingkan harga cache miss . Struktur harga ini sangat menarik untuk aplikasi dengan prompt sistem yang berulang, percakapan berskala besar, atau pipeline agen yang mengirimkan konteks serupa berkali-kali.
Sejumlah laporan menyebut V4 Flash sebagai salah satu API kelas frontier termurah yang tersedia. Berdasarkan perbandingan yang dikutip sumber-sumber tersebut, harga output US$0,28 per 1 juta token sekitar 54 kali lebih rendah daripada Sonnet 4.6 dan 107 kali lebih rendah daripada GPT-5.5 . Perbandingan itu bergantung pada harga model-model pembanding yang berlaku pada saat penghitungan.
Versi produksi V4-Flash-0731 dilaporkan memperoleh peningkatan besar dalam tugas agen dan pemrograman melalui re-post-training, bukan perubahan arsitektur . Catatan pembaruan resmi mencantumkan skor berikut:
Catatan rilis menyatakan bahwa versi ini mencapai tingkat yang sebanding dengan V4-Pro pada benchmark agen dan coding . Artinya, perbedaan antara varian “Pro” dan “Flash” tidak lagi sesederhana anggapan bahwa Pro selalu unggul untuk semua tugas. Untuk beban kerja agen berkecepatan tinggi, V4 Flash berupaya menawarkan kombinasi biaya dan performa yang lebih menarik .
Meski demikian, skor SWE-bench spesifik untuk V4-Flash-0731 tidak ditemukan secara independen dalam sumber yang ditinjau. Karena itu, klaim performa sebaiknya dibaca berdasarkan benchmark yang benar-benar disebutkan, bukan digeneralisasi ke semua ukuran kemampuan pemrograman .
DeepSeek Harness merupakan proyek terpisah yang berfokus pada eksekusi agen. Jika model bahasa berperan sebagai “otak” yang menghasilkan keputusan dan respons, harness dapat dipahami sebagai lapisan orkestrasi yang membantu mengatur konteks, menjalankan langkah-langkah, dan memanggil alat eksternal.
Nama DeepSeek Harness pertama kali muncul dalam catatan perubahan V4-Flash-0731 dengan keterangan “akan segera dirilis” . Pada 1 Agustus 2026, DeepSeek mulai merekrut pengembang proyek open source untuk uji beta tertutup. Peserta diminta memiliki pengalaman dengan proyek terkait Agent Harness serta menyertakan ID GitHub dan karya open source yang mewakili .
Tim Harness disebut dibentuk pada Maret 2026 ketika Cui Tianyi bergabung dengan DeepSeek untuk membangunnya dari awal . Sumber yang tersedia belum mengonfirmasi secara independen seluruh rincian pekerjaan Cui sebelumnya, sehingga informasi tersebut perlu diperlakukan dengan hati-hati. DeepSeek juga belum mengumumkan tanggal rilis publik Harness .
DeepSeek sedang mendorong dua hal sekaligus: model yang murah dan kapabel, serta perangkat lunak yang membuat model dapat bertindak sebagai agen. Lisensi MIT membuka peluang bagi perusahaan untuk menyesuaikan dan menjalankan bobot model sendiri, sedangkan harga API yang sangat rendah menurunkan biaya untuk eksperimen dan operasi berskala besar.
Strategi ini sejalan dengan posisi DeepSeek yang kerap dikaitkan dengan upaya membangun model berkemampuan tinggi dengan biaya serendah mungkin sebagai bagian dari jalur menuju kecerdasan umum buatan (AGI) . Namun, kutipan langsung dari CEO Liang Wenfeng mengenai strategi AGI tersebut belum terverifikasi dalam kumpulan sumber yang ditinjau.
Di China, DeepSeek berhadapan dengan Alibaba melalui seri Qwen, ByteDance melalui Doubao, serta Moonshot AI, MiniMax, dan Z.AI . Keunikan V4 terletak pada kombinasi bobot terbuka, lisensi MIT, konteks 1 juta token, dan harga API yang rendah. Sejumlah laporan juga menyebut persiapan IPO DeepSeek, tetapi belum ada kepastian mengenai jadwal, penjamin emisi, atau detail pengajuan .
DeepSeek V4 Flash bukan hanya model besar dengan angka parameter yang mencolok. Daya tarik utamanya terletak pada kombinasi arsitektur MoE, konteks 1 juta token, perhatian terkompresi, pengaturan tingkat penalaran, lisensi MIT, dan biaya API yang sangat rendah.
Bagi pengembang, model ini menawarkan pilihan untuk membangun aplikasi coding, ekstraksi, dan agen dengan biaya operasional minimal. Bagi perusahaan, bobot terbuka memungkinkan kontrol lebih besar atas penerapan dan penyesuaian model—meski kebutuhan perangkat keras untuk menjalankan konfigurasi penuh tetap tinggi. Sementara itu, DeepSeek Harness menunjukkan bahwa persaingan berikutnya tidak hanya terjadi pada model, tetapi juga pada lapisan perangkat lunak yang membuat AI mampu menyelesaikan tugas secara mandiri.