DeepSeek V4.1 Flash dirilis pada 10 September 2026 sebagai model Flash multimodal terbaru DeepSeek. V4 Flash dan V4 Flash Vision Exp telah dihentikan; ID lama untuk sementara tetap diterima tetapi dialihkan ke V4.1 Flash dengan tarif Flash.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash adalah model open-weight multimodal yang dirilis pada 10 September 2026. Sorotan utamanya bukan hanya skala model, melainkan cara DeepSeek menggabungkan arsitektur mixture-of-experts (MoE) 552 miliar parameter, aktivasi jarang, dan cache KV yang jauh lebih kecil agar inferensi dengan konteks sangat panjang lebih realistis dijalankan. 17
35
Untuk integrasi baru di API DeepSeek, gunakan ID model deepseek-flash. ID ini memanggil V4.1 Flash, yang kini mendukung pemahaman visual secara native selain teks. 15
17
Model sebelumnya, V4 Flash dan V4 Flash Vision Exp, sudah dipensiunkan. Namun, untuk kompatibilitas, ID lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih diterima sementara. Permintaan yang masuk melalui keduanya akan dilayani oleh V4.1 Flash dan ditagih dengan tarif Flash. 15
23
Status V4 Pro berbeda. Laporan transisi awal menyebut trafiknya akan dialihkan ke V4.1 Flash sambil menunggu V4.1 Pro. Akan tetapi, catatan perubahan API resmi yang lebih baru menyatakan DeepSeek tetap menyediakan layanan API V4 Pro setelah 14 September 2026, dengan skema penagihan tidak berubah, menyusul permintaan pengguna. Karena itu, pengembang yang membutuhkan hasil konsisten sebaiknya memakai ID model yang terdokumentasi saat ini dan menjalankan uji regresi—jangan berasumsi rute lama selalu bermuara ke V4.1 Flash. 15
23
V4.1 Flash adalah model Mixture-of-Experts (MoE) dengan 552 miliar parameter backbone. Pada sistem MoE, tidak semua parameter dijalankan untuk setiap token; model hanya memilih sebagian "ahli" yang relevan untuk langkah komputasi tertentu.
DeepSeek menyatakan V4.1 Flash mengaktifkan 8 miliar parameter saat memproses masukan (prefill) dan 16 miliar parameter saat menghasilkan keluaran (decoding). Arsitektur ini disebut Causal Encoder–Decoder. Perbedaan tahap tersebut penting: prompt panjang dan jawaban panjang membebani sistem inferensi dengan cara yang berbeda. 17
35
Aktivasi jarang tidak otomatis menjadikan model murah atau cepat dalam semua kondisi. Kecepatan nyata tetap dipengaruhi GPU, batching, kuantisasi, perangkat lunak penyajian model, panjang konteks, dan jenis permintaan. Namun, inilah fondasi utama klaim efisiensi V4.1 Flash.
V4.1 Flash mendukung konteks hingga 1 juta token. 35
Tantangan utama konteks panjang adalah cache key-value (KV), yaitu memori status perhatian (attention) yang disimpan ketika model menghasilkan token berikutnya. Makin panjang prompt dan respons, makin besar pula kebutuhan memorinya.
Menurut model card DeepSeek, arsitektur Causal Encoder–Decoder memproyeksikan cache KV global decoder dari status tersembunyi encoder terakhir, alih-alih membangunnya terpisah dari setiap lapisan decoder. Rilis ini juga menggabungkan Compressed Sparse Attention 2 dan FP4 KV caching. Hasil yang dilaporkan DeepSeek: jejak cache KV global sekitar 890 byte per token, kira-kira seperempat dari jejak V4 Flash. 35
39
Namun, kapasitas konteks bukan jaminan bahwa model selalu mampu mengambil informasi, bernalar, atau mengikuti instruksi secara akurat di seluruh isi prompt sepanjang satu juta token. Tim yang mengolah basis kode besar, kumpulan dokumen, atau riwayat agen AI tetap perlu menguji recall, latensi, dan biaya menggunakan beban kerja yang representatif.
DeepSeek telah menerbitkan bobot V4.1 Flash di Hugging Face dengan lisensi MIT. Artinya, organisasi dapat mengunduh dan menerapkan model sendiri sesuai ketentuan lisensi tersebut. 35
Ini memberi alternatif terhadap model yang hanya tersedia lewat API: tim dapat mengevaluasi model di infrastruktur sendiri dan mengendalikan tumpukan penyajiannya. Meski begitu, self-hosting tetap bukan pekerjaan ringan—terutama karena model ini memiliki backbone 552 miliar parameter—tetapi jalur untuk optimasi dan kontrol yang lebih dalam tersedia.
DeepSeek menyebut metode pretraining baru dan post-training reinforcement learning dalam skala lebih besar menghasilkan skor benchmark yang melampaui model andalan, termasuk V4 Pro. Perusahaan juga mengutip pengujian oleh beberapa pihak yang menempatkan V4.1 Flash di depan V4 Pro dari sisi performa, biaya, kecepatan, dan waktu proses total. 17
Klaim tersebut penting, tetapi bukan putusan universal. Hasil benchmark dapat berubah bergantung pada pemilihan tugas, prompt, konfigurasi alat, metode penilaian, dan versi model yang diuji. Sebelum memindahkan sistem produksi, bandingkan keduanya pada pekerjaan yang benar-benar relevan: penalaran sulit, tingkat penerimaan kode, penggunaan alat, akurasi multimodal, keandalan, kontrol keamanan, latensi, serta biaya total.
V4.1 Flash masuk ke pasar ketika DeepSeek dan penyedia model asal Tiongkok lain sudah memiliki trafik besar pada platform perutean model. OpenRouter menyusun peringkat berdasarkan token prompt dan token keluaran yang diproses melalui API-nya sendiri. Pada peringkat 13 September, OpenRouter mencatat DeepSeek V4.1 Flash di 4,94 triliun token dan menandainya sebagai model baru; DeepSeek V4 Flash 0731 berada di 11,6 triliun token, V4 Flash 0423 di 4,36 triliun token, sedangkan Xiaomi MiMo-V2.5 di 7,77 triliun token. 57
Laporan pada Agustus juga menunjukkan betapa cepatnya peringkat pemakaian berubah. Dalam satu potret mingguan, V4 Flash mencatat 7,1 triliun token dan sembilan dari 10 model paling banyak digunakan di peringkat itu berasal dari Tiongkok. 50
Catatan pentingnya adalah cakupan data. Angka token OpenRouter mencerminkan trafik yang dirutekan melalui OpenRouter, bukan total penggunaan AI dunia, jumlah implementasi perusahaan, pendapatan, ataupun mutu model secara keseluruhan. Data ini berguna sebagai sinyal permintaan di platform pengembang, bukan bukti bahwa suatu model telah memenangkan pasar AI secara luas.
Alasan utama untuk mengevaluasi V4.1 Flash adalah gabungan dukungan multimodal native, konteks satu juta token, bobot terbuka, dan desain yang ditujukan untuk menekan biaya memori pada inferensi jangka panjang. 17
35
Langkah migrasi yang masuk akal:
deepseek-flash untuk integrasi Flash baru.Klaim teknis V4.1 Flash cukup besar, terutama angka cache KV global 890 byte per token dan desain aktivasi jarangnya. Arti sesungguhnya bagi pengembang akan ditentukan oleh apakah keunggulan itu benar-benar menghasilkan performa yang andal dan terjangkau pada beban kerja nyata.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
DeepSeek V4.1 Flash dirilis pada 10 September 2026 sebagai model Flash multimodal terbaru DeepSeek.
DeepSeek V4.1 Flash dirilis pada 10 September 2026 sebagai model Flash multimodal terbaru DeepSeek. V4 Flash dan V4 Flash Vision Exp telah dihentikan; ID lama untuk sementara tetap diterima tetapi dialihkan ke V4.1 Flash dengan tarif Flash.
Peringkat OpenRouter per 13 September mencatat V4.1 Flash memproses 4,94 triliun token, sementara varian V4 Flash lama dan Xiaomi MiMo V2.5 juga masih tinggi penggunaannya.