TamperBench, test edilen 21 açık ağırlıklı modelin tamamının dokuz değişiklik tehdidinden en az birine karşı savunmasız olduğunu buldu; üstelik saldırılar çoğu zaman MMLU Pro akıl yürütme performansını %10’dan fazla d... Özellikle rekabetçi hedefler, arka kapı ve stil modülasyonu türlerini içeren örtülü jailbreak eğ...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench çalışmasının ana sonucu net: İncelenen 21 açık ağırlıklı büyük dil modelinin hiçbirinde güvenlik önlemleri, test edilen değişiklik saldırılarına karşı güvenilir biçimde dayanıklı değildi. Yaklaşık 600 milyon ila 8 milyar parametre arasında değişen modeller arasında standart sürümlerin yanı sıra ek savunmalarla güçlendirilmiş varyantlar da yer aldı. Her modelde en az bir saldırı, genel yeteneklerin önemli bir bölümü korunurken zararlı içerik üretme eğilimini artırabildi. 256
Bu bulgu, açık ağırlıklı modellerin yayımlandıktan sonra kopyalanabilmesi, yeniden eğitilebilmesi ve tekrar dağıtılabilmesi nedeniyle önem taşıyor. Geliştiricinin ilk değerlendirmeleri sırasında çalışan bir güvenlik katmanı, kullanıcıların model ağırlıklarını değiştirebildiği bir ortamda kalıcı bir kontrol anlamına gelmeyebilir.
TamperBench, sıradan komut tabanlı jailbreak saldırılarına karşı direnci değil, doğrudan değiştirilmeye karşı dayanıklılığı ölçmek üzere tasarlandı. Çerçeve; model ağırlıkları üzerinde gerçekleştirilen ince ayar saldırılarını, modelin gizli temsillerini manipüle eden yöntemlerle birleştiriyor. Ardından hem güvenlik davranışını hem de modelin koruduğu yetenekleri değerlendiriyor. Araştırmacılar, tek bir saldırı ayarına bağlı kalmak yerine her model-saldırı eşleşmesi için sistematik hiperparametre taramaları kullandı. 2
Çalışmada dokuz değişiklik rejimi incelendi. Bunlar arasında şunlar bulunuyordu:
Buradaki temel soru yalnızca bir modelin güvensiz hâle getirilip getirilemeyeceği değildi. Araştırmacılar, modelin zararlı yanıtlarını artırırken MMLU-Pro akıl yürütme doğruluğundaki düşüşü, saldırıya uğramamış modelin performansına kıyasla %10 veya daha az seviyede tutabilen saldırıları aradı. 2
En ağır sonuçlar genel olarak jailbreak eğitimi saldırılarında görüldü. Çalışmada raporlanan varyantlar arasında rekabetçi hedefler, arka kapı ve stil modülasyonu yaklaşımları yer aldı. Bu yöntemler, çoğunlukla zararsız eğitim verisi ve daha küçük bir zararlı veri bileşeni kullanabilmeleriyle dikkat çekti. Böylece modelin güvenlik davranışını, genel faydasını koruyarak hedefli biçimde değiştirmeye çalıştılar; amaç modeli baştan sona güvensiz davranışlar için yeniden eğitmek değildi. 26
Makalenin daha geniş sonucu şu: Güvenlik ve yetenek, model aleyhine olacak şekilde birbirinden ayrılabiliyor. Değişiklikler, modelin reddetme davranışını zayıflatırken akıl yürütme performansını aynı ölçüde yok etmeyebilir. Bu nedenle bir model, geleneksel kıyaslamalarda hâlâ yararlı görünürken dağıtıma alındığında belirgin biçimde daha riskli hâle gelebilir.
TamperBench, Llama, Qwen3 ve Mistral gibi model ailelerini de içeren, 0,6 milyar ila 8 milyar parametre aralığındaki 21 açık ağırlıklı modeli değerlendirdi. Çalışmadan elde edilen kanıtlar, test edilen her modelin en az bir saldırıya karşı savunmasız olduğu yönündeki genel sonucu destekliyor. 56
Bununla birlikte, mevcut kaynaklarda Llama-3-8B-Instruct veya Qwen3-8B-Instruct için MMLU-Pro performansındaki düşüşün %10 veya daha az olduğu koşulda zararlılık artışının model bazında kesin yüzdeleri verilmiyor. Bu nedenle söz konusu sayıları genel sonuçtan çıkarmak doğru olmaz.
Savunulabilir sonuç karşılaştırmalı ve niteliksel: Saldırılar, modellerin akıl yürütme yeteneklerinin önemli bölümünü korurken zararlı davranışları ciddi ölçüde artırabildi. Ancak mevcut kanıtlar, adı geçen iki model için kesin bir artış yüzdesi ortaya koymuyor.
Çalışma ayrıca temel modellerle sonradan eğitilmiş modellerin değişikliklere karşı direncinin tek bir ortak eğilim izlemediğini bildirdi. Llama 3 ve Qwen3 varyantlarında ters yönlü eğilimler raporlanırken, direnç model ailesine göre farklılaşabildi. 6
Hayır. ReFAT ve Circuit Breaking varyantları da dâhil olmak üzere test edilen beş savunma eklenmiş model, saldırı dizisine karşı tamamen dayanıklı değildi. Bu yöntemler bazı koşullarda direnci artırdı; ancak incelenen tüm tehditler karşısında güvenlik önlemlerinin kaldırılmasını güvenilir biçimde engelleyemedi. 25
Çalışmanın karşılaştırmalarında Triplet, daha dayanıklı ve yetenekleri daha iyi koruyan savunmalardan biri olarak öne çıktı. Bu, araştırma açısından umut verici bir sinyal olsa da garanti anlamına gelmiyor: Çalışmanın ana sonucu, test edilen hiçbir savunmanın tüm saldırı dizisi boyunca modelin değiştirilmeye karşı güvenlik sorununu ortadan kaldıramadığı yönünde. 6
Bu bulgu, açık ağırlıklı modellerin başlı başına değersiz olduğu anlamına gelmiyor. Modellerin açık biçimde yayımlanması araştırmayı, denetlenebilirliği ve hesap verebilirliği destekleyebilir. Daha dar ve önemli ders şu: Bir modelin piyasaya sürülmeden önceki hizalama veya güvenlik testlerini geçmesi, ağırlıkları serbestçe değiştirildikten sonra da güvenli kalacağının kanıtı olarak görülmemeli. 5
Kapalı ticari modeller veya API üzerinden sunulan hizmetler de ince ayar ve sonradan eğitim kaynaklı benzer sorularla karşılaşabilir. Ancak bu hizmetlerin sağlayıcıları eğitim hattı ve dağıtım ortamı üzerinde daha fazla denetime sahiptir. Bu denetim, özelleştirme sırasında ya da sonrasında güvenlik önlemleri uygulamayı mümkün kılabilir. Ağırlıklar kamuya açık biçimde dağıtıldıktan sonra aynı kontrolleri zorlamak çok daha güçtür. 25
TamperBench’in işaret ettiği risk, tek bir kişinin reddetme davranışını bozan bir komut bulmasıyla sınırlı değil. Değişiklikler, modelin yararlı yeteneklerini koruyabiliyorsa değiştirilmiş bir model; geniş ölçekli dezenformasyon, kimlik avı ve dolandırıcılık kampanyaları ya da tehlikeli teknik yardım gibi zararlı görevlerde tekrar tekrar kullanılabilir. Araştırmacılar bunları, yetenekler korunurken güvenlik önlemlerinin kaldırılmasının olası sonuçları olarak sunuyor; benchmarkın kendisi böyle bir kötüye kullanımı ölçmüş değil. 5
Model seçen kurumlar için pratik ders, iki farklı değerlendirme türünü birbirinden ayırmak:
Araştırmacılar daha güçlü değişikliğe dayanıklılık yöntemleri, model yayımlanmadan önce TamperBench gibi standartlaştırılmış karşıtlı değerlendirmeler ve kanıta dayalı yapay zekâ değerlendirme ve satın alma süreçleri çağrısı yapıyor. Özellikle sağlık hizmetleri, dolandırıcılık tespiti, eğitim ve kamu hizmetleri gibi yüksek etkili alanlarda bir modelin yayımlandıktan sonraki davranışı, ilk güvenlik kaydı kadar önemli olabilir. 25
TamperBench, her açık ağırlıklı modelin kötüye kullanılacağını göstermiyor. Gösterdiği şey şu: Test edilen 21 modelin tamamında, bir saldırgan model üzerinde değişiklik yapabildiğinde güvenlik önlemleri güvenilir bir garanti olmaktan çıktı. Örtülü jailbreak eğitimi genellikle en güçlü saldırı kategorisiydi; ek savunmalar bazı durumlarda yardımcı oldu ancak açığı kapatmadı. Ayrıca mevcut kanıtlar, Llama veya Qwen3 modelleri için kesin zararlılık artışı yüzdeleri vermeyi desteklemiyor.
Açık ağırlıklı modellerin güvenlik değerlendirmesi bu nedenle yalnızca modelin ilk yayımlandığında neler yapabildiğini değil, güvenlik davranışının değişikliklerden sonra ne kadarını koruduğunu da test etmeli.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench, test edilen 21 açık ağırlıklı modelin tamamının dokuz değişiklik tehdidinden en az birine karşı savunmasız olduğunu buldu; üstelik saldırılar çoğu zaman MMLU Pro akıl yürütme performansını %10’dan fazla d...
TamperBench, test edilen 21 açık ağırlıklı modelin tamamının dokuz değişiklik tehdidinden en az birine karşı savunmasız olduğunu buldu; üstelik saldırılar çoğu zaman MMLU Pro akıl yürütme performansını %10’dan fazla d... Özellikle rekabetçi hedefler, arka kapı ve stil modülasyonu türlerini içeren örtülü jailbreak eğitimi, genellikle en etkili saldırı kategorisi oldu.
ReFAT ve Circuit Breaking varyantları gibi savunma eklenmiş modeller bazı koşullarda daha dirençliydi; ancak hiçbiri güvenlik önlemlerinin kaldırılmasına karşı tüm saldırı dizisini kapsayan güvenilir bir garanti sunmadı.