Görseller; API belgelerinde açıklanan şekilde doğrudan veri olarak, harici URL üzerinden veya Files API aracılığıyla gönderilebiliyor. Responses API belgeleri de bu modelle görüntü aktarımını ayrıca açıklıyor.
Bu yapı, modeli ajan geliştiren ekipler için özellikle ilgi çekici kılıyor. Bir yazılım veya tarayıcı ajanı, sonraki aracı çağırmadan önce ekran görüntüsünü, grafiği, taranmış belgeyi ya da web sayfasını yorumlayabiliyor. DeepSeek’in Codex entegrasyon belgelerinde de Vision Exp, görüntü girdisini destekleyen seçeneklerden biri olarak yer alıyor.
DeepSeek Harness 0.1.1 sürümünün de modele yerleşik destek sunduğu belirtiliyor. Buna karşılık şirketin GitHub Copilot belgeleri, model seçicisinde V4 Pro ve V4 Flash’ı açıkça listeliyor; Vision Exp’in bu seçicide doğrudan bulunduğunu doğrulamıyor. Belgede görsellerin başka bir kurulu Copilot modeli üzerinden işlenebildiği anlatılıyor.
DeepSeek’in ana iddiası iki bölümden oluşuyor: Vision Exp, metin yeteneklerinde V4-Flash seviyesini koruyor ve görsel girdiye ihtiyaç duyan multimodal ajan testlerinde büyük bir sıçrama yapıyor. Şirket, modelin bu alandaki performansının Claude Opus 4.8’e yaklaştığını belirtiyor.
DeepSeek’in duyurusunu aktaran bazı haberlerde Chartography için 64,3; ApexBench Pass@1 için 36,5; Agents’ Last Exam için 27,3 ve ZeroBench Pass@5 için 35,0 puanları veriliyor. Ancak bu rakamlar, aynı istemler, araç ortamları, gecikme süreleri, hata oranları ve maliyetlerle yapılmış bağımsız bir çapraz model incelemesinden değil, DeepSeek’in duyurusuna dayanan ikincil haberlerden geliyor.
Bu ayrım kritik. “Opus 4.8’e yakın” ifadesi modelin Claude’u genel olarak geçtiği, her görevde eşdeğer sonuç verdiği veya üretim ortamında aynı güvenilirliği sunduğu anlamına gelmiyor. Mevcut kaynaklar, DeepSeek ve Anthropic modellerini aynı koşullarda karşılaştıran tarafsız bir değerlendirme sunmuyor.
Şu aşamada savunulabilecek en temkinli sonuç şu: DeepSeek, görsel girdiyi destekleyen gerçek ve belgelenmiş bir API modeli yayımladı. Şirketin sonuçları, görsel bilginin önemli olduğu görevlerde V4-Flash’a kıyasla anlamlı bir gelişmeye işaret ediyor. Ancak modelin Claude, OpenAI, Google veya diğer Çinli yapay zekâ laboratuvarları karşısındaki kesin konumu henüz net değil.
Mevcut model listelerinde Vision Exp’in fiyatı 1 milyon giriş token’ı için 0,22 dolar, 1 milyon çıkış token’ı için 0,66 dolar olarak gösteriliyor. Modelin bağlam penceresi 1 milyon token. DeepSeek’in resmi fiyatlandırma belgeleri de ücretlendirmeyi 1 milyon token üzerinden yapıyor ve deepseek-v4-flash-vision-exp modelini fiyat tablosuna dahil ediyor.
Görseller API faturalandırmasında token’a dönüştürülüyor. DeepSeek’in yayımlanmış yönlendirmelerine atıfta bulunan bir habere göre tek bir görsel en fazla 384 token tüketebiliyor ve Vision Exp, V4-Flash’ın fiyatlandırma yapısını kullanıyor. Bu nedenle gerçek maliyet; görsel sayısına ve boyutuna, çevresindeki metne, modelin yanıt uzunluğuna ve aynı bağlamın kaç kez gönderildiğine bağlı.
Anthropic ise Claude Opus 4.8 için standart kullanımda 1 milyon giriş token’ına 5 dolar, 1 milyon çıkış token’ına 25 dolar ücret alıyor. Şirket ayrıca önbellek ve hızlı mod için farklı fiyatlar açıklıyor.
Başlık fiyatı açısından DeepSeek açık ara daha ucuz görünüyor. Bu, modeli denemek için güçlü bir gerekçe. Ancak yalnızca token fiyatına bakmak toplam sahip olma maliyetini göstermez. Daha fazla yeniden deneme gerektiren, araç kullanımında daha çok hata yapan veya görüntüleri ön işleme tabi tutmayı zorunlu kılan bir model, uçtan uca iş akışında beklenenden pahalı olabilir.
İki model benzer kullanım alanlarına dokunsa da farklı konumlarda duruyor:
DeepSeek’in stratejik vaadi net: Görsel anlama özelliğini daha düşük maliyetli bir Flash modeline eklemek ve multimodal ajan görevlerinde premium sınıftaki bir modelin seviyesine yaklaşmak. Mevcut kanıtlar Claude’un her testte üstün olduğunu kanıtlamadığı gibi DeepSeek’in Opus’a genel olarak eşdeğer olduğunu da göstermiyor. Claude’un bu karşılaştırmadaki daha güçlü tarafı, performanstan çok belgelenmiş olgunluğu, ürün kapsamı ve araç ekosisteminin yerleşik olması.
Bu nedenle karşılaştırma görev bazında yapılmalı. Ekran görüntüsünden yazı okuma veya grafikten veri çıkarma gibi işlerde Vision Exp, yeterli kaliteyi çok daha düşük token maliyetiyle sunabilir. Yüksek riskli otonom iş akışlarında ise tutarlılık, araç seçimi, hatalı çağrılar, reddetme davranışı, izlenebilirlik, destek ve hatadan kurtarma kabiliyeti daha belirleyici olacaktır.
Bu duyurunun önemi, görsel yeteneklerin artık yalnızca “fotoğrafa soru sorma” özelliği olmaktan çıkıp ajan iş akışlarının parçası haline gelmesi. Kodlama ajanları ekran görüntülerini okuyabilir, tarayıcı ajanları web sayfalarını yorumlayabilir, kurumsal sistemler ise belgeleri, grafikleri ve araç çağrılarını aynı akışta birleştirebilir.
DeepSeek V4 ailesi uzun bağlam ve ajan görevlerine odaklanıyor. Şirketin V4 belgeleri Flash’ı ailenin daha hızlı ve ekonomik seçeneği olarak konumlandırıyor. Vision Exp de ayrı bir görüntü modeli sunmak yerine bu yönelimi metin-görüntü tabanlı ajanlara genişletiyor.
Yine de mevcut kanıtlar DeepSeek’in Anthropic, OpenAI, Google veya önde gelen Çinli laboratuvarların önüne geçtiğini söylemek için yeterli değil. Kaynaklarda bağımsız ve tüm modelleri aynı koşullarda karşılaştıran bir değerlendirme bulunmuyor; deneysel bir API sürümü de olgun bir amiral gemisi ürünle aynı anlama gelmiyor.
Evet, fakat kontrollü bir değerlendirmeyle.
İyi bir pilot çalışmada Vision Exp; Claude Opus 4.8 ve hâlihazırda kullanılan üretim modeliyle aynı görsel-artı-araç görevlerinde karşılaştırılmalı. Şu ölçütler takip edilebilir:
Sonuç şimdilik temkinli biçimde olumlu: DeepSeek V4 Flash Vision Exp, cazip fiyatlı ve geliştirici arayüzleri güçlü görünen yeni bir multimodal API deneyi. Claude Opus 4.8’e yakın multimodal ajan performansı iddiası test edilmeye değer; ancak bağımsız biçimde kanıtlanmış bir gerçek olarak kabul edilmek için henüz erken.