Anthropic’in kontrollü ExploitBench testinde GLM 5.3, 410 denemenin 50’sinde; Claude Mythos Preview ise 56’sında çalışan bir açık istismarı üretti. Anthropic, basit yöntemlerin GLM 5.3’ün güvenlik önlemlerini simülasyonlarda testlerin %64 ila %100’ünde aşabildiğini bildirdi.
YayımlayanGPT-6 Luna ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Anthropic’in Eylül 2026’da yayımladığı değerlendirmeye göre Z.ai’nin açık ağırlıklı GLM-5.3 modeli, bir siber güvenlik testinde Claude Mythos Preview’a yakın oranda uçtan uca çalışan açık istismarları geliştirdi. Aynı raporda, GLM-5.3’ün güvenlik önlemlerinin simülasyonlarda basit yöntemlerle aşılabildiği belirtildi. Bulgular, güçlü siber yeteneklerin ne kadar geniş erişime açılması gerektiği tartışmasını yeniden gündeme getiriyor; ancak gerçek hedeflere yönelik başarılı saldırıların kanıtı değil, kontrollü test sonuçları. 12
Anthropic’in ExploitBench değerlendirmesinde GLM-5.3, 410 denemenin 50’sinde çalışan bir istismar üretti. Claude Mythos Preview aynı testte 56 başarılı sonuca ulaştı. Bu, test özelinde yaklaşık %12’ye karşı %14’lük bir başarı oranına denk geliyor. Değerlendirme, bilinen güvenlik açıklarına karşı istismar geliştirmeyi kontrollü bir ortamda ölçüyordu; dolayısıyla bu yakın sonuçlar modellerin tüm siber güvenlik görevlerinde denk olduğu anlamına gelmiyor. 5
12
Anthropic, GLM-5.3’ün uçtan uca istismar geliştirme becerisini önceki modellere kıyasla önemli bir ilerleme olarak nitelendirdi. Şirket ayrı bir ikili istismar testinde de GLM-5.3’ün görevlerin %4’ünde tam denetim akışı ele geçirme başarısı gösterdiğini, Mythos Preview’ın ise %6’ya ulaştığını bildirdi. Bu sonuçlar belirli testlerdeki performansa işaret ediyor; her alanda eşdeğerliğe değil. 3
7
12
NIST bünyesindeki Yapay Zekâ Standartları ve İnovasyon Merkezi (CAISI), GLM-5.3’ü değerlendirdiği açık ağırlıklı modeller arasında siber yetenekleri en yüksek model olarak tanımladı. Öte yandan modelin, CAISI’nin siber güvenlik ölçütlerinin toplamında güncel ABD öncü modellerinin yaklaşık dört ay gerisinde olduğunu belirtti. 17
Bu değerlendirme, Anthropic’in Mythos Preview ile yaptığı karşılaştırmayla doğrudan çelişmiyor. NIST daha geniş bir ölçüt grubuna baktı; Anthropic’in öne çıkan karşılaştırması ise belirli bir testte Mythos Preview’a karşı yapıldı. Testlerin ve karşılaştırma gruplarının farklı olması, birbirini dışlamayan sonuçlar doğurabilir. 12
17
Anthropic, basit yöntemlerin GLM-5.3’ün güvenlik önlemlerini simüle edilmiş testlerin %64 ila %100’ünde aşabildiğini bildirdi. Bu oranlar, denenen istem ve yöntemlerin sonuçlarını gösteriyor; gerçek dünyadaki bir saldırının başarı ihtimalini ölçmüyor. 12
Rapor, açık ağırlıklı modellerle ilgili ayrı bir noktaya da dikkat çekiyor: modelin ağırlıklarına erişebilen kullanıcılar, yalnızca istemlerle güvenlik önlemlerini aşmaya çalışmakla kalmayıp modelin ret davranışını da değiştirebilir. Deneyle ilgili ikincil bir haberde, bu önlemleri kaldırma çalışmasının deneyimli bir ekip için yaklaşık 1.200 dolara mal olabileceği tahmin edildi; aynı haberde çalışmanın hesaplama maliyeti yaklaşık 4.400 dolar olarak da aktarıldı. Bunlar farklı anlatımlara dayanan tahminler; sabit bir fiyat ya da gerçek saldırganların bunu ne sıklıkta yapabileceğinin ölçüsü değil. 12
25
Bildirilen bir deneyde araştırmacı, daha küçük GLM-5.3-Flash modelini kullanarak daha önce açıklanmış iki güvenlik açığını bir istismar zincirinde birleştirdi. Rapora göre çalışma yaklaşık 20 dakikalık insan gözetimi, modelin sekiz saatlik çalışması ve API ücretleri üzerinden 20,40 dolara mal oldu. Açıklardan biri Chrome’daki bir güvenlik açığıydı; araştırmacı bilinen açıklarla ilgili kamuya açık bilgileri modele sağladı. Bu, modelin açıklanmış güvenlik açıklarına karşı kontrollü bir testte zincir oluşturmaya yardımcı olabildiğini gösteriyor; gerçek bir kullanıcının cihazının ele geçirildiğini değil. 6
Bu ayrım önemli: Bir modelin test koşullarında istismar üretebilmesi olası kötüye kullanım konusunda uyarı niteliği taşıyabilir, ancak bu gerçek dünyada saldırı düzenlendiğiyle aynı şey değildir. Mevcut haber kaynakları GLM-5.3’ün gerçek bir hedefi ihlal etmek için kullanıldığını ortaya koymuyor. 5
6
Anthropic’in kaygısı, istismar geliştirme yeteneklerinin geniş ölçekte erişilebilir olmasının hem saldırganlara hem de savunma ekiplerine yarayabilmesi. Şirket, savunucuların açıkları bulup giderebilmesi için gelişmiş modellere erişmesi gerektiğini de savunuyor. 1
12
Açık ağırlıklar zor bir denge yaratıyor: Bağımsız araştırmacıların ve savunma ekiplerinin modelden yararlanmasını sağlayabilirken kullanıcıların modeli geliştiricisinin denetimi dışında çalıştırmasına veya değiştirmesine de olanak tanıyor. Testler ve güvenlik önlemlerine ilişkin bulgular bu tartışmaya veri sunuyor; ancak tek başlarına erişimi kısıtlamanın siber güvenliği genel olarak artıracağını kanıtlamıyor. 4
12
En sağlam sonuç daha sınırlı: Anthropic’in değerlendirmesinde GLM-5.3, bir istismar testinde Mythos Preview’a yaklaştı ve güvenlik önlemleri denenmiş aşma yöntemlerine karşı zayıf kaldı. NIST’in daha geniş değerlendirmesi modeli güncel ABD öncü modellerinin gerisinde konumlandırdı; bildirilen gösterimler ise gerçek dünyada yapılmış saldırılar değildi. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Anthropic’in kontrollü ExploitBench testinde GLM 5.3, 410 denemenin 50’sinde; Claude Mythos Preview ise 56’sında çalışan bir açık istismarı üretti.
Anthropic’in kontrollü ExploitBench testinde GLM 5.3, 410 denemenin 50’sinde; Claude Mythos Preview ise 56’sında çalışan bir açık istismarı üretti. Anthropic, basit yöntemlerin GLM 5.3’ün güvenlik önlemlerini simülasyonlarda testlerin %64 ila %100’ünde aşabildiğini bildirdi.
NIST’in daha geniş ölçütlere dayanan değerlendirmesi GLM 5.3’ü test ettiği en siber yetkin açık ağırlıklı model olarak niteledi; ancak modeli ABD’nin güncel öncü modellerinin yaklaşık dört ay gerisinde konumlandırdı.