OpenAI'ye göre GPT 6 Astra, GPT 5.6 Sol'a kıyasla daha az olgusal hata üretiyor; jailbreak ve prompt injection girişimlerine, uzun saldırı dizileri dâhil, belirgin biçimde daha dirençli. Gray Swan'ın IPI Arena testinde 13 öncü model, 41 ajan senaryosu ve 272.000'den fazla saldırı denendi; test edilen hiçbir model gi...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI'nin kendi değerlendirmelerine göre GPT-6 Astra, GPT-5.6 Sol'a kıyasla güvenlik açısından anlamlı bir ilerleme sunuyor: daha az olgusal hata üretiyor, prompt injection girişimlerine daha dirençli davranıyor ve özellikle uzun etkileşimlere yayılan jailbreak saldırılarına karşı belirgin biçimde daha sağlam. 25
30
Ancak asıl sınır, modelin çalıştığı ortamda ortaya çıkıyor. Bir modelin davranışının iyileşmesi; okuduğu web sayfalarında, belgelerde, e-postalarda, kod depolarında veya araç çıktılarında saklanan kötü niyetli talimatlara karşı ajanı bağışık hâle getirmiyor. Gray Swan'ın dolaylı prompt injection (IPI) testinde, incelenen hiçbir model bu saldırı türüne karşı tamamen bağışık bulunmadı. 4
OpenAI, Astra'nın GPT-5.6 Sol'a göre jailbreak girişimlerine karşı önemli ölçüde daha dayanıklı olduğunu; bu farkın, daha uzun saldırı dizilerinde de görüldüğünü belirtiyor. Bu önemli bir ayrım: Gelişmiş saldırganlar tek bir açık talimatla yetinmek zorunda değil; çok turlu bir konuşmada yöntemlerini uyarlayabilir ve giderek biriken bağlamı kullanmaya çalışabilir. 25
Şirket ayrıca Astra'nın web tarama ve işyeri benzeri kullanımlarda prompt injection saldırılarına daha dayanıklı olduğunu, Sol'dan daha az olgusal hata yaptığını bildiriyor. Ancak olgusallık karşılaştırması dikkatle okunmalı: Bildirilen hata tekrarı testleri, kullanıcıların daha önce yanlış diye işaretlediği konuşmalara odaklanıyor. Bu nedenle sonuçlar, günlük kullanım için genel bir halüsinasyon oranı olarak yorumlanmamalı. 25
30
Bu kazanımlar; araştırma yapan, kod yazan, internette gezinen ve çok aşamalı işleri tamamlayan ajanlar açısından kayda değer. OpenAI'nin sürüm notlarına göre Astra; karmaşık, çok adımlı işler yürütebiliyor ve verilen şablonlara göre belge, hesap tablosu ile sunum hazırlayabiliyor. 19
Eldeki kanıtlar, Astra'nın olgusallık, doğrudan jailbreak'ler veya dolaylı prompt injection bakımından Anthropic'in Claude Opus 5 modelinden her koşulda daha güvenli olduğunu söylemeye yeterli değil.
Modeller arasında anlamlı bir güvenlik sıralaması için ortak bir test kümesi, eşdeğer ajan araçları, aynı sistem talimatları, saldırı başarısının ortak tanımı ve benzer şekilde uyum sağlayabilen saldırganlar gerekir. Üretici değerlendirmeleri ve açık kırmızı takım testleri bu değişkenlerin her birinde farklılaşabilir. Gray Swan materyalleri Claude Opus 5'i Arena'da sunulan modeller arasında gösterse de, sağlanan sonuçlarda Astra ve Opus 5 için bire bir karşılaştırılabilir bir skor kartı yok. 1
4
Bu yüzden savunulabilir sonuç daha dar: OpenAI'nin en güçlü kanıtı, Astra'nın kendi selefi GPT-5.6 Sol'a göre iyileştiği yönünde.
Doğrudan jailbreak saldırısında, saldırganın modele verdiği istek görünür durumdadır: kuralları geçersiz kılmaya veya yasak bir eyleme yönlendirmeye çalışır. Astra'nın uzun saldırı dizilerine karşı bildirilen gelişimi, ısrarcı ve çok turlu biçimde uyum sağlayan bu tür saldırganlar için özellikle önem taşıyor. 25
Dolaylı prompt injection ise ajanın tükettiği içerik üzerinden gelir. Kötü niyetli bir talimat; web sayfası, e-posta, belge, arama sonucu, kodlama izi ya da araç çıktısına gömülerek ajanın kullanıcı hedefinden sapmasını amaçlayabilir. Gray Swan'ın IPI testi de gizli talimatların web içeriği, araç çıktıları ve kodlama ajanı izleri gibi gerçekçi ortamlarda görünmesi durumunda ajanların nasıl davrandığına odaklandı. 5
Kritik nokta şu: Ajanı kullanan kişi kötü niyetli talimatı hiç görmeyebilir.
Gray Swan, IPI Arena'da 13 öncü model, 464 kırmızı takım katılımcısı, 41 senaryo ve 272.000'i aşkın saldırı girişimi üzerinde test yaptığını açıkladı. Kuruluşun vardığı sonuç, test edilen hiçbir modelin dolaylı prompt injection saldırılarına karşı bağışık olmadığı yönünde. 4
Bu sonuç, ajan kullanan sistemlerde IPI sorununun çözülmediğine dair güçlü bir işaret. Ancak tüm güvenlik boyutlarını kapsayan, üreticiden bağımsız ve eksiksiz bir liderlik tablosu değil. Her modelin aynı oranda başarısız olduğunu kanıtladığı veya model özelindeki olgusallık ve doğrudan jailbreak değerlendirmelerinin yerini aldığı şeklinde okunmamalı.
Tek başına kullanılan bir sohbet asistanında başarılı bir enjeksiyon, yanıltıcı bir yanıtla sonuçlanabilir. İş sistemlerine bağlı kurumsal bir ajanda ise etki çok daha büyük olabilir.
OpenAI, Astra'nın Preparedness Framework kapsamındaki siber güvenlik yetenek eşiğinde Critical seviyesini karşıladığını sınıflandırıyor. Şirkete göre Astra, uygun araçlara ve erişime sahip olduğunda insanın her adımı yönlendirmesine gerek kalmadan, iyi korunan çok sayıda sistemde daha önce bilinmeyen güvenlik açıklarını bulup bunlardan yararlanma yolları geliştirebiliyor. 27
Bu yetenek, yetkili savunma çalışmaları için değerli olabilir. Fakat ajan tabanlı bir iş akışı ele geçirildiğinde sonuçları da büyütür: Güvenilmeyen içerik üzerinden ajanı yönlendirebilen bir saldırgan, ajanın neyi aradığını, hangi aracı çağırdığını veya hangi eylemleri önerdiğini etkilemeye çalışabilir. Ajanın hassas verilere, kod depolarına, bulut ortamlarına, tarayıcıya ya da iş uygulamalarına erişimi arttıkça risk de büyür.
Prompt injection direncini güvenlik sınırı değil, savunma katmanlarından biri olarak ele almak gerekir. Yüksek etkili ajan iş akışlarında kuruluşlar şunları uygulamalı:
OpenAI de daha yetenekli sistemler için daha güçlü yalıtım, sınırlı ağ ve araç erişimi, izleme ve sandbox içinde çalıştırma gibi önlemler tanımlıyor. 34
Astra'nın bildirilen daha düşük olgusal hata oranı ve doğrudan jailbreak'lere karşı daha yüksek direnci, onu GPT-5.6 Sol'un daha güçlü bir devamı hâline getiriyor. 25
30 Ancak sağlanan veriler Astra'nın Claude Opus 5'ten her senaryoda kesin olarak daha güvenli olduğunu göstermiyor. Ayrıca dolaylı prompt injection, ajan ekosistemi için hâlâ önemli bir zafiyet.
4
Kurumlar açısından pratik ders açık: En güçlü modeli seçmek gerekli olabilir, ama yeterli değildir. Sistem; kötü niyetli bir belge veya web sayfasının, modelin yeteneklerini ve bağlı araçlarını saldırganın yönettiği bir kanala dönüştürmesini engelleyecek şekilde tasarlanmalıdır.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI'ye göre GPT 6 Astra, GPT 5.6 Sol'a kıyasla daha az olgusal hata üretiyor; jailbreak ve prompt injection girişimlerine, uzun saldırı dizileri dâhil, belirgin biçimde daha dirençli.
OpenAI'ye göre GPT 6 Astra, GPT 5.6 Sol'a kıyasla daha az olgusal hata üretiyor; jailbreak ve prompt injection girişimlerine, uzun saldırı dizileri dâhil, belirgin biçimde daha dirençli. Gray Swan'ın IPI Arena testinde 13 öncü model, 41 ajan senaryosu ve 272.000'den fazla saldırı denendi; test edilen hiçbir model gizli dolaylı prompt injection saldırılarına bağışık çıkmadı.
Sağlanan veriler, Astra ile Anthropic Claude Opus 5 arasında olgusal doğruluk veya jailbreak direnci bakımından kesin ve karşılaştırılabilir bir genel sıralama kurmaya yetmiyor.