DeepSeek V4.1 Flash mendukung konteks hingga satu juta token, dengan sekitar 8 miliar parameter aktif per token saat membaca input dan 16 miliar saat menghasilkan jawaban. DeepSeek melaporkan cache KV global sebesar 890 byte per token, sekitar seperempat dari V4 Flash; kebutuhan cache yang disimpan secara persisten...
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Bagi agen AI yang harus membaca riwayat percakapan, dokumen, atau hasil kerja yang terus bertambah, tantangannya bukan sekadar memuat input panjang. Model juga perlu memprosesnya dan menyimpan informasi yang diperlukan untuk melanjutkan sesi. DeepSeek-V4.1-Flash dirancang untuk beban kerja seperti ini: model multimodal berbobot terbuka berbasis mixture-of-experts (MoE) tersebut mendukung konteks hingga satu juta token. Namun, batas konteks itu tidak berarti model pasti dapat menemukan kembali setiap detail secara andal dari sesi yang sangat panjang. 2
8
Komputasinya berbeda saat membaca dan menulis. Model ini memiliki arsitektur causal encoder–decoder dengan tulang punggung 552 miliar parameter: 20 lapisan encoder diikuti 20 lapisan decoder. Cache key–value (KV) global pada decoder diproyeksikan dari keadaan akhir encoder, bukan dibuat tersendiri oleh setiap lapisan decoder. Menurut DeepSeek, sekitar 8 miliar parameter aktif per token pada tahap prefill—ketika input diproses—dan 16 miliar pada tahap decode, ketika jawaban dihasilkan. Perbedaan ini penting untuk agen yang membaca jauh lebih banyak teks daripada yang ditulisnya. 2
8
Riwayat panjang membutuhkan cache yang lebih kecil. Teknik Compressed Sparse Attention 2 (CSA2) menetapkan salah satu dari tiga mode pada tiap lapisan atensi: Full, Reindex, atau Reuse. Dengan begitu, lapisan dapat berbagi informasi yang telah disimpan dan menggunakan kembali pilihan atensi jarang. Dipadukan dengan penyimpanan FP4 untuk cache KV utama, DeepSeek melaporkan ukuran cache KV global 890 byte per token, sekitar seperempat ukuran pada DeepSeek-V4-Flash. Angka itu membandingkan kebutuhan cache, bukan membuktikan bahwa biaya total setiap penerapan turun sebesar tiga perempat. 6
8
Sebagian informasi dibangun ulang, bukan terus disimpan. SWA Bounded Replay merekonstruksi keadaan KV yang diperlukan untuk sliding-window attention dengan memproses ulang hanya jendela token terbaru. Cara ini menghindari penyimpanan keadaan tersebut secara persisten di SSD. Kartu model DeepSeek menyebut ukuran cache KV persisten sekitar seperdelapan dari V4-Flash. Perbandingan penyimpanan persisten ini berbeda dari angka seperempat untuk cache KV global di atas. 5
9
Sebuah daftar kartu model menyebut DeepSeek-V4.1-Flash dilatih dari awal menggunakan korpus multimodal 45 triliun token. Pelatihan atensi jarangnya menggunakan panjang urutan 64.000 token, sementara konteks diperluas menjadi satu juta token pada titik 34 triliun token. DeepSeek juga mengaitkan peningkatan model dengan metode prapelatihan baru dan pascapelatihan reinforcement learning dalam skala lebih besar; materi yang dikutip tidak merinci resep pascapelatihan tersebut. 9
16
Model ini menangani gambar dan teks secara native, dan DeepSeek menyatakan dukungan multimodal tersedia melalui API-nya. Kutipan sumber yang tersedia tidak memberikan hasil terperinci untuk tolok ukur kemampuan visual. 2
16
Dalam evaluasi DeepSeek, model dasar V4.1-Flash disebut sebanding dengan V4-Pro-Base dalam pengetahuan, penalaran, dan pemrograman. DeepSeek melaporkan peningkatan 5%–10% pada evaluasi yang tidak digunakan selama pengembangan, dengan sekitar sepertiga jumlah parameter total dan seperempat parameter aktif. Perusahaan itu juga menyatakan model yang dirilis melampaui V4-Pro pada tugas agen AI. Namun, sumber yang dikutip tidak cukup untuk menyusun perbandingan tepercaya bagi tiap tolok ukur agen. Ini adalah hasil yang dilaporkan DeepSeek, bukan pengujian langsung yang independen. 1
16
Nama model untuk API DeepSeek adalah deepseek-flash, sedangkan bobot yang dipublikasikan tercantum dengan lisensi MIT. Materi model menjelaskan cara menjalankannya melalui SGLang; daftar model juga mencantumkan dukungan inferensi Transformers dan vLLM. Sebelum menerapkan model, periksa persyaratan perangkat lunak yang dipakai—jangan berasumsi semua fitur multimodal dan konteks panjang didukung dengan cara yang sama. 8
9
16
DeepSeek menyatakan V4-Flash dan V4-Flash-Vision-Exp telah dihentikan, sementara nama API lamanya untuk sementara diarahkan ke V4.1-Flash. Perusahaan itu juga mengumumkan bahwa mulai 14 September 2026, permintaan ke deepseek-v4-pro akan diarahkan ke V4.1-Flash dengan tarif Flash sambil menunggu peluncuran V4.1-Pro. Jika aplikasi bergantung pada perilaku khusus Pro, periksa model yang benar-benar melayani permintaan—jangan hanya mengandalkan nama aliasnya. 16
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
DeepSeek V4.1 Flash mendukung konteks hingga satu juta token, dengan sekitar 8 miliar parameter aktif per token saat membaca input dan 16 miliar saat menghasilkan jawaban.
DeepSeek V4.1 Flash mendukung konteks hingga satu juta token, dengan sekitar 8 miliar parameter aktif per token saat membaca input dan 16 miliar saat menghasilkan jawaban. DeepSeek melaporkan cache KV global sebesar 890 byte per token, sekitar seperempat dari V4 Flash; kebutuhan cache yang disimpan secara persisten merupakan ukuran berbeda.
Model tersedia melalui API dengan nama deepseek flash. Klaim peningkatan kinerjanya berasal dari evaluasi yang dilaporkan DeepSeek, bukan uji banding independen.