Model bir milyon tokena kadar bağlam destekliyor; girdi işleme aşamasında token başına 8 milyar, çıktı üretiminde 16 milyar parametre etkinleştiriyor. DeepSeek’e göre CSA2 ve FP4 depolama, küresel KV önbelleğini token başına 890 bayta indiriyor; SWA Bounded Replay ise kalıcı depolama ihtiyacını ayrıca azaltıyor.
YayımlayanGPT-6 Sol ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Bir yapay zekâ aracısının uzun bir oturumda belge, araç çıktısı ve önceki konuşmaları tekrar tekrar okuduğunu düşünün. DeepSeek-V4.1-Flash’ın hedeflediği yük tam olarak bu: çok girdi, görece az çıktı. Açık ağırlıklı, görüntü ve metin işleyebilen uzmanlar karışımı (MoE) model, bir milyon tokena kadar bağlam destekliyor. Ancak bu üst sınır, oturumun başındaki her ayrıntıyı her zaman doğru hatırlayacağı anlamına gelmiyor. 2
8
Okurken ve yazarken farklı miktarda hesaplama yapıyor. Modelin 552 milyar parametrelik ana gövdesi, 20 katmanlı nedensel bir kodlayıcı ile onu izleyen 20 katmanlı bir çözücüden oluşuyor. Çözücünün küresel anahtar-değer (KV) önbelleği, her çözücü katmanında ayrı ayrı oluşturulmak yerine kodlayıcının son durumlarından türetiliyor. DeepSeek’in verdiği değerlere göre model, girdiyi ilk işlerken (prefill) token başına yaklaşık 8 milyar, çıktı üretirken (decode) 16 milyar parametre etkinleştiriyor. Uzun metinler okuyup kısa yanıtlar veren aracılar için bu fark önem taşıyor. 2
8
Geçmişi daha küçük bir önbellekte tutuyor. Compressed Sparse Attention 2 (CSA2), dikkat katmanlarına üç sabit çalışma biçiminden birini atıyor: Full, Reindex veya Reuse. Böylece katmanlar önbellekteki bilgileri ve seyrek dikkat seçimlerini yeniden kullanabiliyor. Ana KV önbelleğinin FP4 biçiminde saklanmasıyla DeepSeek, küresel KV önbelleği için token başına 890 bayt bildiriyor; bu, önceki DeepSeek-V4-Flash’ın yaklaşık dörtte biri. Söz konusu oran, her kurulumun toplam maliyetinde ölçülmüş dörtte üçlük bir düşüş demek değil. 6
8
Bir kısmını saklamak yerine yeniden oluşturuyor. SWA Bounded Replay, kayan pencere dikkatine ait eksik KV durumlarını yalnızca en yakın token penceresini yeniden işleyerek oluşturuyor; bu durumları SSD’de sürekli saklama gereğini ortadan kaldırıyor. Model kartına göre kalıcı KV önbelleği ayak izi, V4-Flash’ın yaklaşık sekizde birine iniyor. Bu, yukarıdaki küresel KV önbelleği için verilen dörtte bir oranından farklı bir karşılaştırma. 5
9
Bir model kartı listelemesine göre model, 45 trilyon tokenlık çok modlu bir veri kümesiyle sıfırdan eğitildi. Seyrek dikkat eğitimi 64 bin tokenlık dizilerde yapıldı; bağlam sınırı, eğitimin 34 trilyon token noktasında bir milyon tokena genişletildi. DeepSeek ayrıca yeni ön eğitim yöntemleri ve daha büyük ölçekli pekiştirmeli öğrenme sonrası eğitimden söz ediyor; sağlanan kaynaklar bu sonraki aşamanın ayrıntılı reçetesini ortaya koymuyor. 9
16
Model metin ve görüntüleri yerel olarak işleyebiliyor; DeepSeek, API sürümünün de çok modlu desteğe sahip olduğunu belirtiyor. Sağlanan kaynak parçaları, görüntü görevlerine ilişkin ayrıntılı karşılaştırma sonuçları vermiyor. 2
16
DeepSeek’in değerlendirmesinde temel model, bilgi, akıl yürütme ve kodlama alanlarında V4-Pro-Base ile karşılaştırılabilir düzeyde; değerlendirme için ayrı tutulan testlerde ise %5–10 iyileşme gösteriyor. Şirket, bunu toplam parametrelerin yaklaşık üçte biri ve etkinleştirilen parametrelerin dörtte biriyle elde ettiğini söylüyor. Yayımlanan modelin aracı görevlerinde V4-Pro’yu geçtiği de DeepSeek’in iddiası; sağlanan alıntılar görev bazında güvenilir bir karşılaştırma kurmaya yetmiyor. Bunlar bağımsız bir başa baş testin değil, şirketin bildirdiği sonuçların özeti. 1
16
DeepSeek API’sinde model adı deepseek-flash. Yayımlanan ağırlıklar MIT lisansı altında listeleniyor. Model belgeleri SGLang ile sunma yolunu tarif ederken model listelemeleri Transformers ve vLLM çıkarım desteğini de belirtiyor. Uzun bağlam ve çok modlu özelliklerin her çalışma ortamında aynı şekilde desteklendiğini varsaymadan önce ilgili ortamın gereksinimlerini kontrol etmek gerekiyor. 8
9
16
DeepSeek, V4-Flash ve V4-Flash-Vision-Exp modellerinin kullanımdan kaldırıldığını; eski API adlarının geçici olarak V4.1-Flash’a yönlendirildiğini bildiriyor. Şirket ayrıca 14 Eylül 2026 itibarıyla deepseek-v4-pro isteklerinin, V4.1-Pro çıkana kadar Flash tarifesiyle V4.1-Flash’a yönlendirileceğini duyurdu. Pro’ya özgü davranışlara dayanan uygulamalar, yalnızca model adına bakmak yerine isteği gerçekte hangi modelin karşıladığını doğrulamalı. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Model bir milyon tokena kadar bağlam destekliyor; girdi işleme aşamasında token başına 8 milyar, çıktı üretiminde 16 milyar parametre etkinleştiriyor.
Model bir milyon tokena kadar bağlam destekliyor; girdi işleme aşamasında token başına 8 milyar, çıktı üretiminde 16 milyar parametre etkinleştiriyor. DeepSeek’e göre CSA2 ve FP4 depolama, küresel KV önbelleğini token başına 890 bayta indiriyor; SWA Bounded Replay ise kalıcı depolama ihtiyacını ayrıca azaltıyor.
API model adı deepseek flash. V4 Pro ile performans karşılaştırmaları DeepSeek’in bildirdiği sonuçlar; bağımsız bir başa baş test değil.