TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu. Modeller, akıl yürütme performanslarının büyük bölümü korunurken zararlı çıktılar üretmeye belirgin biçimde daha yatkın hâle getirilebildi.
YayımlayanGörseller GPT Image 1.5 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
ACM KDD ’26’da sunulan TamperBench çalışması, açık ağırlıkları yayımlanan büyük dil modellerinin güvenlik önlemlerinin, model ağırlıkları üzerinde değişiklik yapıldığında ne kadar dayanıklı kaldığını inceledi. Araştırmacılar Llama, Qwen3 ve Mistral ailelerinden; 600 milyon ila 8 milyar parametre arasında değişen 21 açık ağırlıklı modeli dokuz farklı kurcalama tehdidine karşı değerlendirdi. 2
5
Sonuç netti: Test edilen modellerin hiçbirinde güvenlik korumaları, incelenen tehditlerin tamamına karşı yeterince sağlam değildi. Her model, en az bir yöntemle zararlı içerik üretmeye çok daha yatkın hâle getirilebildi. Üstelik bu değişiklikler, modelin akıl yürütme ve genel görevlerdeki yeteneklerinin önemli bölümünü koruyabildi. Araştırmacılar bu nedenle, değiştirilebilir ağırlıklarla yayımlanan bir modelin mevcut güvenlik önlemlerinin tek başına güvenilir bir güvence sayılamayacağı sonucuna vardı. 2
5
TamperBench’in dokuz yöntemi, ağırlık uzayında ince ayardan modelin gizli temsillerini hedefleyen saldırılara kadar uzanıyordu. İncelenen yaklaşım grupları arasında şunlar yer aldı: 2
Genellikle en ağır sonuçları, çoğunlukla masum verilerle eğitilip küçük bir zararlı bileşen kullanan örtülü jailbreak ince ayarı türleri verdi. Özellikle rekabet eden hedefler, arka kapı ve üslup değiştirme varyantları öne çıktı. 2
Araştırmacılar saldırı yapılandırmalarını, zararlı yanıt puanını mümkün olduğunca artırırken MMLU-Pro akıl yürütme doğruluğundaki düşüşü saldırı uygulanmamış modele kıyasla en fazla yüzde 10 ile sınırlayacak şekilde seçti. Bu ölçüt, güvenlik bariyerlerinin kaldırılmasının modelin temel kullanım değerini mutlaka ortadan kaldırmadığını gösteriyor. 2
Çalışmanın sağlanan bulguları, Llama-3-8B-Instruct veya Qwen3-8B-Instruct için zararlılık artışının tam model bazlı sayısal değerlerini içermiyor. Bu nedenle bu iki model için kesin bir artış oranı vermek mümkün değil.
Araştırmada ReFAT ve Circuit Breaking varyantları dâhil olmak üzere savunma mekanizmaları güçlendirilmiş beş model de test edildi. Bu yöntemler bazı koşullarda direnci artırsa da, dokuz saldırı türünün tamamı karşısında güvenlik önlemlerinin kaldırılmasını güvenilir biçimde engelleyemedi. 2
5
Bu bulgu, açık ağırlıklı modeller açısından özellikle önemli. Ağırlıklar yayımlandıktan sonra model kopyalanabilir, yeniden ince ayardan geçirilebilir ve geliştiricinin kontrolü dışında yeniden dağıtılabilir. Böylece ilk geliştiricinin, modelin sonraki kullanımında uygulanan güvenlik kontrollerini zorunlu kılması zorlaşır. 2
Araştırmacılar çalışmanın açık ağırlıklı modellerin değerini reddetmediğini vurguluyor. Açıklık; araştırma, denetlenebilirlik ve hesap verebilirlik açısından önemli faydalar sağlayabilir. Ancak bir modelin piyasaya sürülmeden önce standart hizalama testlerini geçmiş olması, ağırlıkları değiştirildikten sonra da güvenli kalacağını göstermiyor. 5
Araştırmacılara göre kapalı, API üzerinden sunulan ticari modeller de benzer kurcalama riskleriyle karşılaşabilir. Bununla birlikte bu modellerde sağlayıcı, ince ayar sürecini ve dağıtımı kontrol edebildiği için açık ağırlıklar serbestçe yayıldıktan sonra kullanılamayacak bazı ek savunmaları uygulayabilir. 2
5
Güvenlik önlemlerinin modelin yetenekleri büyük ölçüde korunarak kaldırılabilmesi, kötüye kullanımı tek bir kişinin manuel çabasıyla sınırlı olmaktan çıkarabilir. Araştırmacılar; ölçekli dezenformasyon, gelişmiş kimlik avı ve dolandırıcılık kampanyaları ya da zararlı teknik yönlendirmeler gibi risklere dikkat çekiyor. 5
Çalışmanın önerisi, modeller yayımlanmadan önce TamperBench benzeri standartlaştırılmış düşmanca değerlendirmelerin yapılması, kurcalamaya dayanıklılık araştırmalarının güçlendirilmesi ve yapay zekâ sistemlerinin satın alınması ya da kamu hizmetlerinde kullanılmasına ilişkin kararların daha fazla kanıta dayandırılması. Bu çağrı özellikle sağlık hizmetleri, dolandırıcılık tespiti ve eğitim gibi alanlarda önem taşıyor. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu.
TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu. Modeller, akıl yürütme performanslarının büyük bölümü korunurken zararlı çıktılar üretmeye belirgin biçimde daha yatkın hâle getirilebildi.
En ağır sonuçlar genellikle rekabet eden hedefler, arka kapı ve üslup değiştirme türündeki örtülü jailbreak ince ayar saldırılarında görüldü.
TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu. Modeller, akıl yürütme performanslarının büyük bölümü korunurken zararlı çıktılar üretmeye belirgin biçimde daha yatkın hâle getirilebildi.
YayımlayanGörseller GPT Image 1.5 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
ACM KDD ’26’da sunulan TamperBench çalışması, açık ağırlıkları yayımlanan büyük dil modellerinin güvenlik önlemlerinin, model ağırlıkları üzerinde değişiklik yapıldığında ne kadar dayanıklı kaldığını inceledi. Araştırmacılar Llama, Qwen3 ve Mistral ailelerinden; 600 milyon ila 8 milyar parametre arasında değişen 21 açık ağırlıklı modeli dokuz farklı kurcalama tehdidine karşı değerlendirdi. 2
5
Sonuç netti: Test edilen modellerin hiçbirinde güvenlik korumaları, incelenen tehditlerin tamamına karşı yeterince sağlam değildi. Her model, en az bir yöntemle zararlı içerik üretmeye çok daha yatkın hâle getirilebildi. Üstelik bu değişiklikler, modelin akıl yürütme ve genel görevlerdeki yeteneklerinin önemli bölümünü koruyabildi. Araştırmacılar bu nedenle, değiştirilebilir ağırlıklarla yayımlanan bir modelin mevcut güvenlik önlemlerinin tek başına güvenilir bir güvence sayılamayacağı sonucuna vardı. 2
5
TamperBench’in dokuz yöntemi, ağırlık uzayında ince ayardan modelin gizli temsillerini hedefleyen saldırılara kadar uzanıyordu. İncelenen yaklaşım grupları arasında şunlar yer aldı: 2
Genellikle en ağır sonuçları, çoğunlukla masum verilerle eğitilip küçük bir zararlı bileşen kullanan örtülü jailbreak ince ayarı türleri verdi. Özellikle rekabet eden hedefler, arka kapı ve üslup değiştirme varyantları öne çıktı. 2
Araştırmacılar saldırı yapılandırmalarını, zararlı yanıt puanını mümkün olduğunca artırırken MMLU-Pro akıl yürütme doğruluğundaki düşüşü saldırı uygulanmamış modele kıyasla en fazla yüzde 10 ile sınırlayacak şekilde seçti. Bu ölçüt, güvenlik bariyerlerinin kaldırılmasının modelin temel kullanım değerini mutlaka ortadan kaldırmadığını gösteriyor. 2
Çalışmanın sağlanan bulguları, Llama-3-8B-Instruct veya Qwen3-8B-Instruct için zararlılık artışının tam model bazlı sayısal değerlerini içermiyor. Bu nedenle bu iki model için kesin bir artış oranı vermek mümkün değil.
Araştırmada ReFAT ve Circuit Breaking varyantları dâhil olmak üzere savunma mekanizmaları güçlendirilmiş beş model de test edildi. Bu yöntemler bazı koşullarda direnci artırsa da, dokuz saldırı türünün tamamı karşısında güvenlik önlemlerinin kaldırılmasını güvenilir biçimde engelleyemedi. 2
5
Bu bulgu, açık ağırlıklı modeller açısından özellikle önemli. Ağırlıklar yayımlandıktan sonra model kopyalanabilir, yeniden ince ayardan geçirilebilir ve geliştiricinin kontrolü dışında yeniden dağıtılabilir. Böylece ilk geliştiricinin, modelin sonraki kullanımında uygulanan güvenlik kontrollerini zorunlu kılması zorlaşır. 2
Araştırmacılar çalışmanın açık ağırlıklı modellerin değerini reddetmediğini vurguluyor. Açıklık; araştırma, denetlenebilirlik ve hesap verebilirlik açısından önemli faydalar sağlayabilir. Ancak bir modelin piyasaya sürülmeden önce standart hizalama testlerini geçmiş olması, ağırlıkları değiştirildikten sonra da güvenli kalacağını göstermiyor. 5
Araştırmacılara göre kapalı, API üzerinden sunulan ticari modeller de benzer kurcalama riskleriyle karşılaşabilir. Bununla birlikte bu modellerde sağlayıcı, ince ayar sürecini ve dağıtımı kontrol edebildiği için açık ağırlıklar serbestçe yayıldıktan sonra kullanılamayacak bazı ek savunmaları uygulayabilir. 2
5
Güvenlik önlemlerinin modelin yetenekleri büyük ölçüde korunarak kaldırılabilmesi, kötüye kullanımı tek bir kişinin manuel çabasıyla sınırlı olmaktan çıkarabilir. Araştırmacılar; ölçekli dezenformasyon, gelişmiş kimlik avı ve dolandırıcılık kampanyaları ya da zararlı teknik yönlendirmeler gibi risklere dikkat çekiyor. 5
Çalışmanın önerisi, modeller yayımlanmadan önce TamperBench benzeri standartlaştırılmış düşmanca değerlendirmelerin yapılması, kurcalamaya dayanıklılık araştırmalarının güçlendirilmesi ve yapay zekâ sistemlerinin satın alınması ya da kamu hizmetlerinde kullanılmasına ilişkin kararların daha fazla kanıta dayandırılması. Bu çağrı özellikle sağlık hizmetleri, dolandırıcılık tespiti ve eğitim gibi alanlarda önem taşıyor. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu.
TamperBench, test edilen 21 açık ağırlıklı modelin hiçbirinde güvenlik önlemlerinin değerlendirilen kurcalama tehditlerine karşı yeterince dayanıklı olmadığını buldu. Modeller, akıl yürütme performanslarının büyük bölümü korunurken zararlı çıktılar üretmeye belirgin biçimde daha yatkın hâle getirilebildi.
En ağır sonuçlar genellikle rekabet eden hedefler, arka kapı ve üslup değiştirme türündeki örtülü jailbreak ince ayar saldırılarında görüldü.