DeepSeek V4 Pro 0813, üç çalışmanın sonuçları birleştirildiğinde 32 güvenlik açığının 28’ini buldu; yaklaşık 295 dolarlık maliyetle testin en yüksek kapsam sonucuna ulaştı. Test, güvenlikte tek bir modelin ilk yanıtına güvenmek yerine geniş tarama yapan ajanları; doğrulama, tekilleştirme ve insan denetimiyle birleşt...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikido’nun Ağustos 2026’da yayımladığı değerlendirme, 10 yapay zekâ modelini yakın zamanda açıklanmış 32 güvenlik açığını yeniden bulma göreviyle karşılaştırdı. Her model, internete kapalı bir ortamda 30 turluk üç ayrı çalıştırmada test edildi. Sonuçların en dikkat çekici yanı DeepSeek V4 Pro 0813’ün üç çalışmada toplam 32 açığın 28’ine ulaşmasıydı. Ancak bu tablo, “en iyi model belli oldu” demekten çok güvenlik sisteminin nasıl tasarlandığının model seçiminden daha önemli olabileceğine işaret ediyor. 3
DeepSeek V4 Pro 0813, üç çalışmanın sonuçları birleştirildiğinde 32 açığın 28’ini, yani %87,5 havuzlanmış geri çağırma (recall) oranını yakaladı. Bu, modeli keşif aşamasında testin en güçlü seçeneği yaptı.
Buradaki kritik ayrıntı şu: 28/32 sonucu tek bir çalıştırmanın garantisi değil, pass@3 olarak hesaplanan toplam sonuç. Farklı çalışmalar farklı dosyaları, kod yollarını ve istismar ihtimallerini inceleyebilir. Sonuçları birleştirmek, bu arama çeşitliliğinden yararlanarak toplam kapsama alanını artırıyor. Pratik karşılığı ise basit: Bir modelin ilk yanıtını nihai güvenlik raporu kabul etmek yerine, birbirinden bağımsız birkaç araştırma yürütmek daha anlamlı olabilir. 3
DeepSeek Pro, üç çalıştırmada yaklaşık 295 dolar maliyetle 28/32 sonucuna ulaştı. Avantajı, farklı çalışmalar bir araya getirildiğinde daha geniş bir açık kümesini ortaya çıkarabilmesi oldu.
Bu nedenle model, güvenlik iş akışının ilk aşamasında güçlü bir aday. Yine de ürettiği bulgular, üretim sistemlerine uyarı olarak gönderilmeden önce kanıtlarla doğrulanmalı, yinelenen raporlar birleştirilmeli ve önem dereceleri yeniden değerlendirilmelidir.
DeepSeek Flash’ın üç çalıştırması yaklaşık 108 dolar maliyetle 32 açıktan 24’ünü buldu. Bu sonuç, modelin maliyet başına kapsama oranını oldukça cazip hale getiriyor.
Flash; düşük bütçeyle paralel taramalar yapmak veya ek denemeler başlatmak için uygun görünüyor. Ancak bu, onu otomatik olarak en iyi nihai inceleyici yapmıyor. Daha mantıklı kullanım, daha fazla araştırma denemesini düşük maliyetle gerçekleştirmek ve birleşik bulguları daha seçici bir doğrulama aşamasına aktarmak. 3
Grok 4.6, 21 güvenlik açığının üç çalıştırmanın tamamında bulunmasıyla tutarlılık açısından öne çıktı. Ekiplerin düzenli izleme, öngörülebilir raporlama ve taramalar arasında daha istikrarlı davranış aradığı senaryolarda bu özellik, en yüksek toplam kapsama oranından daha değerli olabilir.
Grok’un gücü DeepSeek Pro’dan farklı. DeepSeek daha keşifçi bir profil çizerken Grok, aynı bulguları tekrar tekrar üretme konusunda daha istikrarlı bir görünüm sergiledi.
Claude Opus 5, sonuçlar birleştirildiğinde 26/32, GPT-5.6 Sol ise 25/32 seviyesine ulaştı. Her iki model de yüksek performanslı seçenekler olarak kaldı. Bununla birlikte test, en pahalı kapalı modelin mutlaka en geniş güvenlik açığı kapsamını sunacağı varsayımını zayıflattı.
Dolayısıyla bu modelleri seçmenin gerekçesi yalnızca marka veya genel benchmark itibarı olmamalı. Asıl soru, modelin güvenlik hattına ek olarak ne sunduğu: daha iyi akıl yürütme, daha anlaşılır raporlar ya da daha güvenilir bir inceleme davranışı mı? 3
Kimi K3’ün öne çıkan sonucu %92,3 havuzlanmış hassasiyet (precision) oldu. Hassasiyet, modelin toplam kaç açık bulduğunu değil, raporladığı bulguların ne kadarının kabul edildiğini ölçer.
Bu ayrım, Kimi’nin geniş tarama yapan bir modelden farklı bir görevde değerli olabileceğini gösteriyor. Yüksek geri çağırma oranına sahip bir ajan daha geniş arama yaparken daha fazla gürültü üretebilir. Yüksek hassasiyetli bir model ise bulguları doğrulamak, rapor hazırlamak ve mühendislere ulaşan gereksiz uyarıların sayısını azaltmak için kullanılabilir.
Aikido, Qwen3.8-Max’in aynı CVE’yi veya benzer bir akıl yürütme yolunu yeniden ziyaret ettiğini gözlemledi. Bu davranış, yeni bir bulgu üretmeden inceleme turlarını tükettiğinde verimsiz. Öte yandan ikinci bir inceleme, ilk çalışmada kaçırılmış bir koşulu, çalıştırma yolunu veya doğrulama ayrıntısını ortaya çıkarabilir.
Çözüm, modelden çok onu çalıştıran altyapıda yatıyor. Ajanın hangi dosyaları incelediği, hangi varsayımları test ettiği ve hangi bulguları raporladığı izlenmeli; tekrarlanan dallara sınır konulmalı ve çözülemeyen vakalar otomatik tekrar yerine yeni bir araştırmaya yönlendirilmelidir.
Güncellenen karşılaştırmada GLM-5.3’ün sonucu 24/32’den 25/32’ye yükseldi. Model, testte ele alınan kapalı ve üst seviye alternatiflere kıyasla daha düşük maliyet profiliyle birlikte değerlendirildiğinde, yüksek hacimli taramalarda veya model topluluklarının bir parçası olarak kullanılabilecek bir seçenek haline geliyor.
Buradaki değer, tek bir çalıştırmadan mucizevi sonuç beklemekten çok, daha düşük maliyet ve daha esnek dağıtım sayesinde daha fazla araştırma yürütülebilmesinde ortaya çıkıyor.
Bir güvenlik açığı keşif sistemini tek bir skorla değerlendirmek yanıltıcı olabilir:
Bu ölçütler farklı operasyonel ihtiyaçlara yanıt verir. Keşif aşaması yüksek geri çağırma ve farklı araştırma yollarından yararlanır. Üretim ortamına uyarı göndermek ise yüksek hassasiyet, kanıt, tekilleştirme ve doğru risk sıralaması gerektirir.
Bu yüzden çok sayıda ihtimali bulmakta başarılı bir model, doğrulanmamış uyarıları doğrudan yazılım geliştiricilere göndermek için kötü bir tercih olabilir. Aynı şekilde Kimi K3 doğrulama ve önceliklendirmede, DeepSeek Pro ise ilk taramada daha yararlı olabilir.
Benchmark’ın en önemli sistem dersi, model performansının rastlantısal ve değişken olması. Tek bir çalışma, yalnızca tek bir araştırma yolunu örnekliyor. Birkaç bağımsız çalışma ise modelin farklı varsayımları ve istismar ihtimallerini inceleme şansını artırıyor.
Bu nedenle nispeten düşük maliyetli üç DeepSeek çalıştırması, daha pahalı üst seviye modellerin tek geçişteki toplam kapsamını yakalayabildi veya aşabildi. Değerlendirilmesi gereken birim yalnızca model çağrısı değil; model, araçlar, istem, tur bütçesi, hafıza, tekrar çalıştırmalar ve doğrulama sürecinden oluşan bütün araştırma. 3
Bu sonuçlara dayanan bir sistem, keşif ile karar verme aşamalarını birbirinden ayırabilir:
Bu model yönlendirme yaklaşımı, açık ağırlıklı veya kapalı modelleri birbirinin basit ve doğrudan alternatifi olarak görmekten daha sağlamdır.
Aikido’nun sonuçları yararlı olsa da yapay zekâ destekli güvenlik modelleri için evrensel bir sıralama sunmuyor. Testte 32 yakın tarihli güvenlik açığı, model başına üç deneme ve belirli bir ajan altyapısı kullanıldı. Sonuçlar; programlama diline, depo yapısına, araç erişimine, tehdit modeline, inceleme bütçesine ve kurumun yanlış pozitiflere toleransına göre değişebilir. 3
Bu nedenle savunulabilir sonuç daha dar ama daha kullanışlı: Bu test ortamında, özellikle DeepSeek V4 Pro gibi açık ağırlıklı modeller, tekrar ve orkestrasyonla kapalı üst seviye modellere yaklaşabildi veya onları geçebildi. Güvenlikte kazanan ürün, manşet skorunu alan model olmak zorunda değil. Asıl kazanan; geniş keşfi, güvenilir doğrulamayı ve mühendislerin harekete geçebileceği kanıtları aynı sistemde birleştiren yapı.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813, üç çalışmanın sonuçları birleştirildiğinde 32 güvenlik açığının 28’ini buldu; yaklaşık 295 dolarlık maliyetle testin en yüksek kapsam sonucuna ulaştı.
DeepSeek V4 Pro 0813, üç çalışmanın sonuçları birleştirildiğinde 32 güvenlik açığının 28’ini buldu; yaklaşık 295 dolarlık maliyetle testin en yüksek kapsam sonucuna ulaştı. Test, güvenlikte tek bir modelin ilk yanıtına güvenmek yerine geniş tarama yapan ajanları; doğrulama, tekilleştirme ve insan denetimiyle birleştiren orkestre edilmiş sistemlerin daha sağlam olduğunu gösteriyor.