| Ciri | Butiran |
|---|---|
| Jumlah parameter | 284 bilion |
| Parameter aktif | 13 bilion bagi setiap token |
| Seni bina | Mixture-of-Experts (MoE) |
| Tetingkap konteks | 1 juta token |
| Output maksimum | 384,000 token |
| Ketepatan | Campuran FP4 + FP8 |
| Lesen | MIT |
| Saiz muat turun | Kira-kira 160 GB |
Jika modul draf DSpark untuk speculative decoding turut dikira, jumlah parameter repositori menjadi sekitar 304 bilion .
Versi produksi DeepSeek-V4-Flash-0731 diterbitkan pada 31 Julai 2026 dan menggantikan versi pratonton. Menurut laporan pelancaran, saiz serta seni bina asasnya tidak berubah; peningkatan prestasi datang terutamanya daripada latihan pascapembangunan semula, atau re-post-training .
V4 Flash dan V4 Pro dikeluarkan dengan bobot terbuka di bawah lesen MIT. Secara umum, lesen permisif ini membolehkan pembangun menggunakan, mengubah suai, mengedarkan dan mengkomersialkan model tanpa bayaran royalti, tertakluk kepada syarat lesen tersebut .
Bobot model tersedia melalui Hugging Face, sekali gus membolehkan organisasi memuat turunnya dan menjalankannya pada infrastruktur sendiri. Ini penting untuk syarikat yang perlu mengawal data, menyesuaikan model melalui fine-tuning atau mengurangkan kebergantungan kepada API pihak ketiga.
Namun, “sumber terbuka” tidak bermaksud kos operasi menjadi sifar. Model ini masih memerlukan perkakasan pengkomputeran yang besar untuk penggunaan penuh, khususnya apabila tetingkap konteks 1 juta token digunakan.
Kekuatan teknikal utama V4 Flash terletak pada seni bina perhatian hibrid yang menggabungkan dua kaedah pemampatan:
Lapisan model berselang-seli antara CSA dan HCA. Lapisan genap bermula daripada lapisan kedua menggunakan pemampatan 4:1, manakala lapisan ganjil bermula daripada lapisan ketiga menggunakan pemampatan 128:1. Pada masa sama, tetingkap gelongsor yang merangkumi 128 token mentah terkini dikekalkan untuk memastikan model kekal peka terhadap maklumat paling baharu .
V4 Flash menggunakan ketepatan campuran untuk mengurangkan keperluan memori:
nvidia/DeepSeek-V4-Flash-NVFP4 .Pada FP8, bobot model 284 bilion parameter sahaja memerlukan kira-kira 284 GB. Untuk menjalankan konteks penuh 1 juta token, satu konfigurasi yang disyorkan ialah empat GPU NVIDIA H200 SXM5 dengan jumlah 564 GB VRAM . Ini bermakna model ini lebih mudah diakses melalui API atau penyedia awan berbanding pemasangan tempatan bagi kebanyakan pembangun individu.
V4 Flash turut menyediakan parameter reasoning_effort, yang membolehkan pembangun memilih pertukaran antara kelajuan dan kedalaman penaakulan:
Bagi pembangun, kawalan ini lebih praktikal daripada memilih model berbeza untuk setiap tugasan. Mod pantas boleh digunakan untuk pengelasan atau pengekstrakan data, manakala mod lebih tinggi sesuai untuk penjanaan kod, penyahpepijatan dan perancangan berbilang langkah .
DeepSeek menetapkan harga V4 Flash pada $0.14 bagi setiap 1 juta token input apabila cache tidak digunakan, dan $0.28 bagi setiap 1 juta token output .
Bagi input yang sepadan dengan kandungan yang telah dicache, harganya turun kepada $0.0028 bagi setiap 1 juta token — pengurangan sekitar 98 peratus berbanding input cache miss .
| Jenis penggunaan | Harga setiap 1 juta token |
|---|---|
| Input, cache miss | $0.14 |
| Input, cache hit | $0.0028 |
| Output | $0.28 |
Beberapa perbandingan industri meletakkan kos output V4 Flash kira-kira 54 kali lebih rendah daripada Sonnet 4.6 pada $15 bagi setiap 1 juta token, dan 107 kali lebih rendah daripada GPT-5.5 pada $30 . Oleh itu, beberapa sumber menyifatkannya sebagai antara API kelas frontier paling murah yang tersedia .
Harga rendah ini paling memberi kesan kepada aplikasi yang membuat banyak panggilan model, seperti pembantu pengekodan, penghalaan permintaan, ringkasan dokumen, pengesahan output dan ejen yang menggunakan alat secara berulang.
Kemas kini 31 Julai meningkatkan prestasi V4 Flash dalam tugasan berasaskan ejen dan pengekodan melalui re-post-training, bukan perubahan seni bina . Log kemas kini rasmi melaporkan skor berikut:
DeepSeek menyatakan bahawa versi ini menunjukkan prestasi yang setanding dengan V4 Pro dalam penanda aras pengekodan dan ejen . Ini mencabar andaian lama bahawa model “Pro” sentiasa jauh lebih baik daripada model “Flash” untuk semua jenis tugasan .
Walau bagaimanapun, skor SWE-bench khusus bagi V4-Flash-0731 tidak dapat disahkan secara bebas daripada sumber yang dikaji . Jadi, dakwaan tentang prestasi keseluruhan dalam kejuruteraan perisian perlu dibaca berdasarkan penanda aras yang diumumkan, bukan sebagai bukti bahawa model ini mengatasi semua pesaing dalam setiap kategori.
Pada 1 Ogos 2026, DeepSeek mula merekrut pembangun sumber terbuka untuk menguji DeepSeek Harness dalam beta tertutup .
Harness bukan sekadar model bahasa baharu. Ia ialah rangka kerja pelaksanaan ejen yang beroperasi di luar model utama dan mengurus perkara seperti konteks, panggilan alat serta pelaksanaan tugasan . Ringkasnya, model menjana rancangan dan keputusan, manakala Harness membantu mengatur langkah-langkah yang diperlukan untuk menyelesaikan tugasan secara autonomi.
Nama DeepSeek Harness pertama kali muncul dalam log perubahan V4-Flash-0731 pada 31 Julai dengan catatan bahawa ia akan dikeluarkan tidak lama lagi . Pembangun yang berminat menyertai beta perlu mempunyai pengalaman dengan projek berkaitan Agent Harness dan menghantar ID GitHub berserta contoh hasil kerja mereka .
Pasukan kejuruteraan Harness dilaporkan ditubuhkan pada Mac 2026 selepas Cui Tianyi menyertai DeepSeek untuk membinanya dari awal . Sumber yang dikaji tidak mengesahkan secara bebas butiran khusus tentang jawatan terdahulu beliau di TSY Capital dan Jane Street, manakala DeepSeek juga belum mengumumkan tarikh pelancaran rasmi Harness .
Kemunculan V4 Flash memperjelas pendekatan DeepSeek di bawah Ketua Pegawai Eksekutif Liang Wenfeng: menggabungkan keupayaan tinggi dengan kos rendah, kemudian menjadikan teknologi itu lebih mudah diakses melalui bobot terbuka dan lesen permisif . Harga $0.14 untuk input dan $0.28 untuk output, digandingkan dengan lesen MIT, menjadi bukti operasi paling jelas kepada strategi tersebut .
DeepSeek bersaing dengan Alibaba melalui siri Qwen, ByteDance melalui Doubao, Moonshot AI, MiniMax dan Z.AI . Dalam kelompok modelnya, keluarga V4 menonjol kerana menawarkan bobot terbuka dengan konteks 1 juta token di bawah lesen MIT .
Laporan industri turut menyebut persediaan IPO DeepSeek, tetapi tiada tarikh, penaja jamin atau butiran pemfailan yang dapat disahkan daripada sumber yang dikaji . Begitu juga, tiada petikan langsung Liang Wenfeng tentang strategi AGI yang berjaya disahkan dalam bahan penyelidikan ini.
Bagi pembangun, V4 Flash menawarkan tiga kelebihan utama: kos API yang rendah, konteks yang sangat panjang dan kebebasan menggunakan bobot terbuka. Ia boleh menjadi pilihan menarik untuk aplikasi yang memerlukan jumlah permintaan tinggi atau pemprosesan dokumen panjang.
Bagi perusahaan, lesen MIT membuka ruang untuk penggunaan komersial dan pemasangan sendiri. Namun, keperluan perkakasan, pengurusan data, keselamatan alat dan kos operasi perlu dikira sebelum memindahkan model ke persekitaran produksi.
Kemunculan DeepSeek Harness pula menunjukkan bahawa persaingan AI kini semakin beralih daripada “siapa mempunyai model paling pintar” kepada “siapa boleh membina sistem ejen yang paling boleh dipercayai”. Model yang murah menjadi lebih bernilai apabila ia boleh merancang, memanggil alat dan menyelesaikan tugasan berulang dengan campur tangan manusia yang minimum.