Benchmark liderliği. Atlas, UC Berkeley araştırmacıları tarafından geliştirilen ve yapay zeka ajanlarının 188 açık kaynak projesinden 1.507 görev üzerinde gerçek dünya güvenlik açıklarını yeniden üretme ve keşfetme yeteneğini ölçen CyberGym benchmarkında %90,9 puan aldı . Karşılaştırma yapmak gerekirse, en iyi tek model sistemleri – GPT-5.5 Cyber (%85,6) ve Anthropic Mythos (%83) – 5 ila 8 puan geride kaldı . Mayıs 2026'da 100'den fazla uzman ajanla %88,45 puan alan Microsoft'un MDASH sistemi bile geride bırakıldı .
200'den fazla sıfırıncı gün açığı keşfi. Kendi testlerinde Atlas, yıllardır yoğun şekilde fuzz testine ve denetime tabi tutulan Linux çekirdeği, Kubernetes, gVisor, containerd ve dnsmasq gibi yaygın kullanılan açık kaynak projelerinde 200'den fazla daha önce bilinmeyen güvenlik açığı keşfetti . Kritik olarak, her bulgu ajan sistem tarafından uçtan uca otonom olarak doğrulandı ve modelin ürettiği şüphenin ötesine geçilerek gerçek bir güvenlik sorununun tekrarlanabilir kanıtı sunuldu .
CVE-2026-3854 – Kritik GitHub RCE açığı. Atlas'ın erken bir sürümü, GitHub'ın dahili git altyapısında kritik bir uzaktan kod yürütme açığı (CVE-2026-3854, CVSS 8.8) tespit etti . Bu açık, push yetkisine sahip herhangi bir kimlik doğrulamış kullanıcının, tek bir git push komutuyla GitHub'ın arka uç sunucularında keyfi komutlar çalıştırmasına ve özel depolara tam okuma/yazma erişimi elde etmesine olanak tanıyordu . Wiz, bu açığı 4 Mart 2026'da GitHub'ın hata ödül programı aracılığıyla bildirdi . GitHub, sorunu 40 dakikada yeniden üretti, iki saatten kısa sürede github.com'a bir düzeltme dağıttı ve vahşi ortamda herhangi bir istismar olmadığını doğruladı .
100.000 dolar ödül. GitHub, bu keşif için 100.000 dolar ödül verdi – bu, program tarihindeki en yüksek ödemelerden biri; ancak Wiz'in toplam ödülü, kamu programının kesilmesinden önceki Temmuz 2026 öncesi oranlar üzerinden yapılandırılmış olabilir .
Asıl mimari hikaye burada yatıyor. Atlas tek bir yapay zeka modeli değil – çok modelli, ajan tabanlı bir sistemdir . GPT-5.5 Cyber ve Mythos'un kullandığı tek model yaklaşımından farkı şöyle:
| Boyut | Proje Atlas (çoklu ajan) | GPT-5.5 Cyber / Mythos (tek model) |
|---|---|---|
| Mimari | Paralel çalışan birçok uzman yapay zeka ajanını (kod analizi, fuzzing, statik analiz, bağımlılık izleme için alt ajanlar) yönetir | Siber görevler için eğitilmiş, tek başına çalışan büyük bir dil modeli |
| Model çeşitliliği | Birden fazla öncü modeli birleştirir (örneğin, CyberGym koşusunda Claude Opus 4.6 + GPT-5.5) – her alt görev için en iyi modeli seçer | Tek bir model ailesine ve ağırlık setine bağlı |
| İş akışı | Her bulgu, ayrı bir doğrulama ajanı tarafından bağımsız olarak doğrulanır ve yanlış pozitifler neredeyse tamamen ortadan kalkar | Tek model çıktısı, kendi kendini doğrulaması daha zor |
| Ölçeklenebilirlik | Aynı anda binlerce hedefte yüzlerce ajan çalıştırabilir | Tek model çıkarım verimiyle sınırlı |
| Temel fikir | "Güvenlik açığı araştırması için en iyi model mimarisi tek bir model değil, farklı uzmanlıklara sahip bir orkestre edilmiş model ekibidir" | Tek model yaklaşımı, karmaşık çok adımlı iş akışlarında bir tavana takılır |
Wiz, sistem mimarisinin ham model yeteneğinden daha önemli olduğunu savunuyor – Atlas, GPT-5.5 Cyber ve Mythos'u daha iyi bir temel modele sahip olarak değil, birden fazla modeli ve ajanı sıkı doğrulama döngüleriyle akıllıca birleştirerek yendi .
Yapay zeka güvenlik yarışının zaman çizelgesi, tek model hakimiyetinden çoklu ajan üstünlüğüne doğru net bir yörünge gösteriyor:
2026 başları–ortaları: Tek model tırmanışı. OpenAI, Haziran 2026'da Daybreak savunma programının bir parçası olarak tam GPT-5.5-Cyber'ı (%85,6 CyberGym) yayınladı . Anthropic'in Claude Mythos Önizlemesi de yüksek puan alarak İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) ve Palo Alto Networks araştırmacılarının modellerin "otonom hacking benchmarklarını aştığı" konusunda uyarmasına yol açtı .
Mayıs 2026: Çoklu ajan potansiyelini kanıtlıyor. Microsoft'un MDASH sistemi (100+ uzman ajan, CyberGym'de %88,45), çoklu ajan sistemlerinin tek modellerden daha iyi performans gösterebileceğini gösterdi .
Temmuz 2026: Çoklu ajan kazanıyor. Wiz'in Atlas'ı (%90,9) her ikisini de geçerek birden fazla öncü modelin orkestrasyonunun herhangi bir tek modelden daha iyi performans gösterdiğini kanıtladı .
Yapay zeka ajanlarının sistematik fuzzing, statik analiz ve kod incelemesiyle birleşimi, benzeri görülmemiş bir ölçekte sıfırıncı gün açıkları üretiyor – Atlas tek başına sıkı denetlenen açık kaynak kodunda 200'den fazla açık buldu . Bu yapay zeka keşfi açık yağmuru, güvenlik açığı ifşa programlarının ekonomisini zorluyor. GitHub, 27 Temmuz 2026'da kamuya açık hata ödül ödemelerini en az yarı yarıya kesti (kritik bulgular 20.000-30.000 dolardan sabit 10.000 dolara düşürüldü), ancak davetli VIP katmanı hala 30.000 doların üzerinde ödüyor . Bu tarihten önce yapılan bildirimler, Atlas tarafından keşfedilen CVE-2026-3854 dahil, önceki ödeme koşullarını korudu .
Wiz'in Proje Atlas'ı, yapay zeka güvenlik açığı araştırmasında şu anki en son teknolojiyi temsil ediyor – bunun nedeni daha iyi bir model kullanması değil, bağımsız doğrulamaya sahip çoklu ajan, çoklu model mimarisinin tek model sistemlerini önemli bir farkla (%90,9'a karşı %85,6 ve %83) geçmesi. Bu, yapay zeka güvenlik ortamında 'hangi model en iyi' sorusundan 'modeller nasıl etkili bir şekilde orkestre edilir' sorusuna daha geniş bir geçişi yansıtıyor. Wiz ve Google'ın belirttiği gibi, yapay zeka güvenlik yarışında kazanan yaklaşım tek bir süper model değil, modelleri, insan uzmanlığını ve titiz doğrulama hatlarını birleştiren sistemler olacak .