DeepSeek V4.1 Flash menyokong konteks hingga sejuta token dan mengaktifkan kira kira 8 bilion parameter bagi setiap token input, berbanding 16 bilion ketika menjana output. Menurut DeepSeek, CSA2 bersama cache KV FP4 mengecilkan cache KV global kepada 890 bait bagi setiap token, kira kira satu perempat daripada V4 F...
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Bagi ejen AI yang perlu meneliti sejarah perbualan atau bahan rujukan yang panjang sebelum memberikan jawapan ringkas, kos memproses input dan menyimpan konteks boleh menjadi cabaran. DeepSeek-V4.1-Flash dibina untuk corak kerja ini: ia ialah model multimodal mixture-of-experts (MoE) dengan pemberat terbuka dan had konteks sehingga sejuta token. Had itu bermaksud input sepanjang itu disokong, bukan setiap butiran dalam sesi panjang pasti dapat diingati semula dengan tepat. 2
8
Model ini mempunyai tulang belakang 552 bilion parameter, tetapi tidak mengaktifkan semuanya bagi setiap token. Seni bina causal encoder–decodernya membahagikan 40 lapisan kepada 20 lapisan encoder dan 20 lapisan decoder. Cache kunci–nilai (KV) global decoder pula dibentuk daripada keadaan akhir encoder, bukannya dijana secara berasingan oleh setiap lapisan decoder. DeepSeek melaporkan kira-kira 8 bilion parameter aktif bagi setiap token semasa prefill—fasa membaca input—dan 16 bilion semasa decode, iaitu fasa menjana jawapan. Perbezaan ini paling relevan apabila ejen membaca jauh lebih banyak teks daripada yang ditulisnya. 2
8
Pertama, berkongsi dan memampatkan cache. Compressed Sparse Attention 2 (CSA2) menetapkan setiap lapisan perhatian kepada satu daripada tiga mod: Full, Reindex atau Reuse. Susunan ini membolehkan lapisan berkongsi maklumat cache dan menggunakan semula pilihan perhatian jarang. Digabungkan dengan penyimpanan FP4 untuk cache KV utama, DeepSeek melaporkan jejak cache KV global sebanyak 890 bait bagi setiap token—kira-kira satu perempat daripada DeepSeek-V4-Flash. Itu perbandingan saiz cache, bukan bukti bahawa jumlah kos setiap pelaksanaan turun pada kadar yang sama. 6
8
Kedua, bina semula apabila perlu. SWA Bounded Replay membina semula keadaan KV yang tiada untuk perhatian tetingkap gelongsor dengan memproses semula hanya tetingkap token terkini. Ini mengelakkan keperluan menyimpan keadaan tersebut pada SSD. Menurut kad model DeepSeek, jejak cache KV yang disimpan secara berterusan menjadi kira-kira satu perlapan daripada V4-Flash. Angka ini mengukur penyimpanan berterusan; ia berbeza daripada angka satu perempat bagi cache KV global di atas. 5
9
Penyenaraian kad model menerangkan latihan dari awal menggunakan korpus multimodal 45 trilion token, latihan perhatian jarang pada panjang jujukan 64,000 token, serta peluasan konteks kepada sejuta token pada tahap 34 trilion token. DeepSeek turut mengaitkan peningkatan model dengan kaedah pralatihan baharu dan pascalatihan pembelajaran pengukuhan pada skala lebih besar; bahan yang dipetik tidak memperincikan resipi pascalatihan itu. 9
16
Model ini mengendalikan imej dan teks secara natif, dan DeepSeek menyatakan sokongan multimodal turut tersedia melalui APInya. Namun, petikan sumber yang tersedia tidak memberikan keputusan terperinci untuk penanda aras penglihatan. 2
16
Dalam penilaian DeepSeek, model asas V4.1-Flash setanding dengan V4-Pro-Base bagi pengetahuan, penaakulan dan pengekodan. Ia turut mencatat peningkatan 5%–10% dalam penilaian yang diasingkan daripada latihan, sambil menggunakan kira-kira satu pertiga jumlah parameter dan satu perempat parameter aktif. DeepSeek juga mengatakan model yang dikeluarkan mengatasi V4-Pro dalam tugasan ejen AI, tetapi petikan yang tersedia tidak cukup untuk membuat perbandingan kukuh bagi setiap penanda aras. Semua ini ialah hasil yang dilaporkan, bukan ujian perbandingan bebas. 1
16
Nama model untuk API DeepSeek ialah deepseek-flash, manakala pemberat yang diterbitkan disenaraikan di bawah lesen MIT. Bahan model menerangkan cara menjalankannya dengan SGLang; penyenaraian model turut mengenal pasti sokongan inferens Transformers dan vLLM. Semak keperluan persekitaran yang digunakan sebelum menganggap semua ciri multimodal dan konteks panjang berfungsi dengan cara yang sama. 8
9
16
DeepSeek menyatakan V4-Flash dan V4-Flash-Vision-Exp telah ditamatkan; nama API lama mereka dihalakan sementara kepada V4.1-Flash. Syarikat itu juga mengumumkan bahawa mulai 14 September 2026, permintaan kepada deepseek-v4-pro akan dihalakan kepada V4.1-Flash pada kadar Flash sementara menunggu pelancaran V4.1-Pro. Jika aplikasi bergantung pada tingkah laku khusus Pro, sahkan model yang benar-benar memproses permintaan—jangan bergantung pada nama alias semata-mata. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash menyokong konteks hingga sejuta token dan mengaktifkan kira kira 8 bilion parameter bagi setiap token input, berbanding 16 bilion ketika menjana output.
DeepSeek V4.1 Flash menyokong konteks hingga sejuta token dan mengaktifkan kira kira 8 bilion parameter bagi setiap token input, berbanding 16 bilion ketika menjana output. Menurut DeepSeek, CSA2 bersama cache KV FP4 mengecilkan cache KV global kepada 890 bait bagi setiap token, kira kira satu perempat daripada V4 Flash.
Model ini tersedia melalui nama API deepseek flash. Dakwaan prestasinya berbanding V4 Pro ialah hasil yang dilaporkan, bukan perbandingan bebas.