Aynı dönemde şirket, büyük dil modellerini araç çağırabilen ve çok adımlı görevleri kendi başına yürütebilen ajanlara dönüştürmeyi amaçlayan DeepSeek Harness için açık kaynak geliştiricilerinden kapalı beta başvuruları toplamaya başladı . Bu iki gelişme, DeepSeek’in yalnızca model boyutunda değil, yapay zekâ ajanlarının çalıştırılacağı yazılım katmanında da rekabet etmeye hazırlandığını gösteriyor.
V4 Flash, DeepSeek V4 ailesinin hız ve yüksek hacimli kullanım odaklı modeli. MoE mimarisi sayesinde model, toplamda 284 milyar parametreye erişebiliyor; ancak her token işlenirken bunların yaklaşık 13 milyarı etkinleşiyor .
Bu yaklaşım, modelin büyük bir uzman havuzundan yararlanırken her işlemde tüm parametreleri çalıştırmamasını sağlıyor. Bu nedenle V4 Flash; sohbet, sınıflandırma, bilgi çıkarma, kodlama desteği ve yüksek trafikli ajan iş akışları gibi gecikmenin ve işlem maliyetinin önemli olduğu senaryolara konumlandırılıyor .
| Özellik | Değer |
|---|---|
| Toplam parametre | 284 milyar |
| DSpark taslak modülüyle depo parametresi | 304 milyar |
| Token başına aktif parametre | 13 milyar |
| Mimari | Mixture-of-Experts (MoE) |
| Bağlam penceresi | 1 milyon token |
| Azami çıktı | 384 bin token |
| Hassasiyet | FP4 + FP8 karma |
| Lisans | MIT |
| İndirme boyutu | Yaklaşık 160 GB |
Kaynaklar:
V4 Flash’ın ağırlıkları Hugging Face üzerinden indirilebiliyor ve model özel altyapıda çalıştırılabiliyor. MIT lisansı; ticari kullanım, değiştirme ve yeniden dağıtım için oldukça izin verici bir çerçeve sunuyor. Kullanıcıların telif ücreti ödemesi veya model çıktısı başına lisans bedeli vermesi gerekmiyor .
Bu, kapalı API’lere kıyasla önemli bir fark yaratıyor. Şirketler modeli kendi sunucularında barındırabilir, iş akışlarına göre uyarlayabilir veya modelin üzerine ticari ürünler inşa edebilir. Bununla birlikte açık ağırlıklara sahip olmak, modeli büyük ölçekli ve düşük gecikmeyle çalıştırmanın donanım maliyetini ortadan kaldırmıyor.
V4 Flash’ın öne çıkan teknik özelliklerinden biri, 1 milyon tokenlık bağlam penceresi. Bu kapasite; uzun belgeler, büyük kod depoları veya çok adımlı ajan görevleri gibi geniş bir geçmişin tek oturumda işlenmesine imkân tanıyabilir .
DeepSeek, bu amaçla iki farklı sıkıştırılmış dikkat mekanizmasını birleştiriyor:
Model, ilk katmanlardan sonra CSA ve HCA katmanlarını dönüşümlü kullanıyor. Ayrıca son 128 ham tokenı izleyen kayan pencere kolu, yakın geçmişteki bilgilerin korunmasına yardımcı oluyor .
Model ağırlıklarının bellekte kapladığı alanı azaltmak için farklı bölümlerde farklı sayısal hassasiyetler kullanılıyor:
Tamamen FP8 bir kurulumda model ağırlıkları tek başına yaklaşık 284 GB bellek gerektiriyor. Bir milyon tokenlık bağlamla kendi altyapısında çalıştırma için önerilen yapılandırmalardan biri, toplam 564 GB VRAM’e sahip dört NVIDIA H200 SXM5 GPU kullanmak . Dolayısıyla modelin API üzerinden düşük maliyetli olması, yerel kurulumun herkes için kolay veya ucuz olduğu anlamına gelmiyor.
V4 Flash, geliştiricilere reasoning_effort parametresi üzerinden üç farklı çalışma modu sunuyor:
Bu seçenek, geliştiricilerin yanıt süresi ile analiz derinliği arasında kullanım senaryosuna göre tercih yapmasını sağlıyor. Basit bir yönlendirme veya sınıflandırma işleminde hızlı mod yeterli olabilirken, çok adımlı kodlama ve planlama görevlerinde daha yüksek bir mod tercih edilebilir .
DeepSeek’in fiyatlandırmasına göre V4 Flash’ın maliyeti:
Önbellekte bulunan girdilerdeki fiyat, standart giriş fiyatına göre yüzde 98 daha düşük. Tekrarlanan sistem talimatları veya ortak prompt önekleri kullanan uygulamalar bu indirimden yararlanabiliyor .
Karşılaştırma amacıyla bazı kaynaklar, V4 Flash’ın çıktı tokenı fiyatının Sonnet 4.6’dan 54 kat, GPT-5.5’ten ise 107 kat düşük olduğunu belirtiyor . Bu nedenle V4 Flash, birçok sektör raporunda “ulaşılabilir en ucuz frontier sınıfı API’lerden biri” olarak tanımlanıyor .
31 Temmuz’da yayımlanan V4-Flash-0731 sürümünde mimari boyut değiştirilmedi; performans artışının temel kaynağı yeniden eğitim ve sonradan yapılan optimizasyonlar oldu . DeepSeek’in güncelleme kayıtlarında paylaşılan puanlar şöyle:
Yayın notuna göre yeni sürüm, ajan ve kodlama testlerinde daha büyük V4-Pro modeline benzer seviyede performans gösteriyor . Bu sonuç, geleneksel “Pro daha güçlü, Flash daha zayıf” ayrımını özellikle ajan görevlerinde daha az belirgin hâle getiriyor . Ancak incelenen kaynaklarda V4-Flash-0731 için bağımsız biçimde doğrulanmış kesin SWE-bench puanları bulunmuyor .
DeepSeek Harness, büyük dil modelinin etrafında çalışan bir ajan yürütme çerçevesi olarak tanımlanıyor. Çerçevenin; bağlam yönetimi, araç çağrıları ve görevlerin tamamlanması gibi işleri modelin dışındaki yazılım katmanında ele alması bekleniyor .
Harness adı ilk kez 31 Temmuz tarihli V4-Flash-0731 değişiklik günlüğünde, “yakında yayımlanacak” notuyla göründü . 1 Ağustos 2026’da DeepSeek, Agent Harness ile ilgili açık kaynak projelerde deneyimi olan geliştiricileri kapalı beta testine katılmaya davet etti . Başvurularda GitHub kimliği ve geliştiricinin temsil niteliğindeki açık kaynak çalışmaları isteniyor .
Cui Tianyi’nin Mart 2026’da DeepSeek’e katılarak Harness mühendislik ekibini kurduğu bildiriliyor . Ancak Cui’nin daha önce TSY Capital ve Jane Street’teki spesifik görevlerine ilişkin bilgiler, incelenen kaynaklarda bağımsız biçimde doğrulanmış değil . Harness için kesin bir genel kullanıma açılma tarihi de açıklanmadı .
DeepSeek’in CEO’su Liang Wenfeng etrafındaki stratejik anlatı, düşük maliyetli ancak yetenekli modelleri genel yapay zekâ hedefi için bir basamak olarak konumlandırıyor . V4 Flash’ın MIT lisansı ve 0,14/0,28 dolarlık giriş-çıkış fiyatları, bu yaklaşımın pratikteki en görünür örnekleri arasında.
Şirket Çin’de Alibaba’nın Qwen serisi, ByteDance’in Doubao’su, Moonshot AI, MiniMax ve Z.AI gibi rakiplerle yarışıyor . V4 ailesi, bu segmentte 1 milyon tokenlık bağlam penceresini izin verici MIT lisansıyla sunan tek açık ağırlıklı model ailesi olarak öne çıkarılıyor .
DeepSeek’in olası halka arz hazırlıkları da çeşitli kaynaklarda gündeme geliyor; ancak halka arz tarihi, aracı kurumlar veya doğrulanmış başvuru ayrıntıları konusunda kesin bilgi bulunmuyor .
DeepSeek V4 Flash’ın asıl etkisi yalnızca 284 milyar parametrelik boyutundan kaynaklanmıyor. Model; açık ağırlıkları, ticari kullanıma izin veren MIT lisansı, milyon tokenlık bağlam penceresi, ayarlanabilir akıl yürütme modları ve düşük API fiyatını tek pakette birleştiriyor.
Buna DeepSeek Harness’ın eklenmesi, şirketin rekabeti yalnızca “hangi model daha iyi yanıt veriyor?” sorusuyla sınırlamadığını gösteriyor. Bir sonraki mücadele alanı; modellerin araçları nasıl kullandığı, uzun görevleri nasıl yönettiği ve gerçek dünyadaki işleri ne kadar bağımsız tamamlayabildiği olacak.
Bununla birlikte V4 Flash’ın kesin SWE-bench sonuçları, Liang Wenfeng’in doğrudan strateji açıklamaları, DeepSeek’in olası halka arz takvimi ve Cui Tianyi’nin önceki görevleri için daha güçlü bağımsız doğrulamalara ihtiyaç var. Bu başlıklardaki bilgiler şu aşamada temkinli değerlendirilmelidir.