TamperBench में जांचे गए सभी 21 ओपन वेट मॉडल नौ में से कम से कम एक छेड़छाड़ वाले खतरे के प्रति कमजोर पाए गए। कई मामलों में MMLU Pro तर्क प्रदर्शन में गिरावट 10% से अधिक नहीं थी। कोवर्ट jailbreak tuning—खासकर competing objectives, backdoor और style modulation तरीके—आम तौर पर सबसे प्रभावी हमले रहे। ReFAT और Circuit Br...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench का मुख्य निष्कर्ष साफ है: जिन 21 ओपन-वेट भाषा मॉडलों की जांच की गई, उनमें से किसी की भी सुरक्षा व्यवस्था परीक्षण में शामिल छेड़छाड़ वाले खतरों के सामने भरोसेमंद रूप से कायम नहीं रही। इन मॉडलों में लगभग 600 मिलियन से 8 बिलियन पैरामीटर वाले सामान्य और अतिरिक्त सुरक्षा उपायों से लैस संस्करण शामिल थे। हर मॉडल में कम-से-कम एक ऐसा हमला मिला, जिसने उसकी सामान्य क्षमताओं का बड़ा हिस्सा बनाए रखते हुए उसे हानिकारक सामग्री तैयार करने के लिए अधिक तैयार कर दिया। 256
यह नतीजा इसलिए महत्वपूर्ण है क्योंकि ओपन-वेट मॉडल जारी होने के बाद कॉपी, fine-tune और दोबारा वितरित किए जा सकते हैं। डेवलपर के शुरुआती परीक्षणों के दौरान काम करने वाली सुरक्षा-परत जरूरी नहीं कि तब भी प्रभावी रहे, जब उपयोगकर्ता मॉडल के weights में बदलाव कर सके।
TamperBench को सामान्य prompt-based jailbreak प्रतिरोध मापने के लिए नहीं, बल्कि tamper resistance यानी मॉडल में बदलाव के बाद सुरक्षा के टिके रहने की क्षमता जांचने के लिए बनाया गया था। इसके ढांचे में weights के स्तर पर fine-tuning हमले और मॉडल की latent representations में बदलाव करने वाले हमले दोनों शामिल थे। इसके बाद सुरक्षा व्यवहार और बची हुई उपयोगिता—दोनों को मापा गया। हर model-attack जोड़ी के लिए व्यवस्थित hyperparameter search किया गया, यानी शोधकर्ता किसी एक हमले की configuration पर निर्भर नहीं रहे। 2
अध्ययन में नौ तरह के tampering regimes शामिल थे, जिनमें प्रमुख रूप से ये तरीके थे:
मुख्य सवाल सिर्फ यह नहीं था कि किसी मॉडल को असुरक्षित बनाया जा सकता है या नहीं। शोधकर्ताओं ने ऐसे हमलों पर ध्यान दिया, जो हानिकारक जवाबों की दर बढ़ाते हों और साथ ही MMLU-Pro reasoning accuracy में मॉडल के बिना-हमले वाले प्रदर्शन की तुलना में गिरावट 10% के भीतर रखते हों। 2
सबसे गंभीर नतीजे आम तौर पर jailbreak-tuning हमलों से आए। अध्ययन में इसके competing-objectives, backdoor और style-modulation जैसे संस्करण शामिल थे। इन हमलों की खास बात यह थी कि इनमें ज्यादातर training data benign हो सकता था और हानिकारक data का हिस्सा छोटा रखा जा सकता था। इसलिए ये मॉडल को पूरी तरह असुरक्षित व्यवहार के लिए दोबारा प्रशिक्षित करने के बजाय, उसकी उपयोगिता बचाए रखते हुए सुरक्षा व्यवहार को लक्षित रूप से बदलने की कोशिश जैसे दिखते हैं। 26
पेपर का व्यापक निष्कर्ष यह है कि सुरक्षा और क्षमता को एक-दूसरे से अलग किया जा सकता है—और यह अलगाव जोखिमपूर्ण दिशा में जा सकता है। छेड़छाड़ से मॉडल की refusal behavior कमजोर हो सकती है, जबकि उसकी reasoning performance उतनी तेजी से खराब न हो। इसी वजह से कोई मॉडल पारंपरिक benchmarks पर उपयोगी दिखाई दे सकता है, लेकिन deployment के लिहाज से काफी अधिक जोखिमपूर्ण बन सकता है।
TamperBench ने 0.6B से 8B parameters वाले 21 ओपन-वेट मॉडलों का मूल्यांकन किया। इनमें Llama, Qwen3 और Mistral जैसे model families शामिल थे। उपलब्ध अध्ययन-साक्ष्य इस benchmark-स्तरीय निष्कर्ष का समर्थन करते हैं कि जांचे गए हर मॉडल में कम-से-कम एक परीक्षण किए गए हमले के प्रति कमजोरी थी। 56
हालांकि, उपलब्ध स्रोतों में 10% या उससे कम MMLU-Pro degradation की सीमा के भीतर Llama-3-8B-Instruct या Qwen3-8B-Instruct में harmfulness कितनी बढ़ी, इसके सटीक per-model आंकड़े नहीं दिए गए हैं। इसलिए इन संख्याओं का अनुमान लगाना उचित नहीं होगा। विश्वसनीय निष्कर्ष इतना ही है कि हमले मॉडल की reasoning क्षमता का बड़ा हिस्सा बनाए रखते हुए हानिकारक व्यवहार को काफी बढ़ा सकते थे; लेकिन उपलब्ध साक्ष्य किसी भी नामित मॉडल के लिए सटीक प्रतिशत वृद्धि स्थापित नहीं करते।
अध्ययन ने यह भी बताया कि base और post-trained variants में tamper resistance का कोई एक समान पैटर्न नहीं था। अलग-अलग model families में उनका आपसी प्रतिरोध बदल सकता था और Llama 3 तथा Qwen3 variants के लिए विपरीत रुझान भी रिपोर्ट किए गए। 6
नहीं। जांचे गए पांच defense-augmented models—जिनमें ReFAT और Circuit Breaking variants भी शामिल थे—benchmark के हमलों के प्रति कमजोर पाए गए। इन सुरक्षा उपायों ने कुछ परिस्थितियों में प्रतिरोध बेहतर किया, लेकिन सभी परीक्षण किए गए खतरों के सामने सुरक्षा हटाए जाने को भरोसेमंद रूप से नहीं रोक सके। 25
तुलनात्मक परीक्षणों में Triplet को अपेक्षाकृत अधिक मजबूत और मॉडल की क्षमता को बेहतर ढंग से बनाए रखने वाला defense बताया गया। यह शोध के लिए उत्साहजनक संकेत है, गारंटी नहीं। benchmark का मुख्य संदेश यही है कि किसी भी जांचे गए defense ने पूरी attack suite के सामने tampering की समस्या को समाप्त नहीं किया। 6
इस निष्कर्ष का अर्थ यह नहीं है कि ओपन-वेट मॉडल बेकार हैं। खुले मॉडल शोध, auditing और जवाबदेही को बढ़ावा दे सकते हैं। सीमित और अधिक सटीक सबक यह है कि सामान्य alignment या pre-release safety evaluation पास कर लेना इस बात का प्रमाण नहीं माना जाना चाहिए कि weights में स्वतंत्र रूप से बदलाव के बाद भी मॉडल सुरक्षित रहेगा। 5
बंद commercial या API मॉडल भी fine-tuning और post-training safety से जुड़े सवालों का सामना कर सकते हैं। लेकिन उनके providers के पास training pipeline और deployment environment पर अधिक नियंत्रण रहता है। इससे वे fine-tuning के समय या customization के बाद सुरक्षा उपाय लागू कर सकते हैं—ऐसे नियंत्रण खुले weights को सार्वजनिक रूप से वितरित किए जाने के बाद लागू करना कहीं अधिक कठिन होता है। 25
TamperBench ने जिस जोखिम को उजागर किया है, वह केवल किसी व्यक्ति द्वारा एक ऐसा prompt खोज लेने तक सीमित नहीं है जिससे मॉडल का refusal system विफल हो जाए। यदि उपयोगी क्षमताएं बनी रहती हैं, तो बदला हुआ मॉडल बड़े पैमाने पर हानिकारक कामों के लिए बार-बार deploy किया जा सकता है—जैसे mass disinformation, phishing या scams, और खतरनाक तकनीकी सहायता। शोधकर्ताओं ने इन्हें capability-preserving safeguard removal के संभावित प्रभावों के रूप में पेश किया है; benchmark ने खुद ऐसे दुरुपयोग को मापा नहीं। 5
मॉडल चुनने वाली संस्थाओं के लिए व्यावहारिक अंतर समझना जरूरी है:
शोधकर्ता अधिक मजबूत tamper-resistance तरीकों, release से पहले TamperBench जैसे standardized adversarial evaluations और अधिक evidence-based AI assessment तथा procurement की मांग करते हैं। वे स्वास्थ्य सेवा, fraud detection, शिक्षा और public services जैसे high-impact क्षेत्रों की ओर विशेष ध्यान दिलाते हैं, जहां मॉडल का release के बाद का व्यवहार उसके शुरुआती safety record जितना ही महत्वपूर्ण हो सकता है। 25
TamperBench यह नहीं दिखाता कि हर ओपन-वेट मॉडल का दुरुपयोग जरूर होगा। यह दिखाता है कि जांचे गए 21 मॉडलों में, जब किसी हमलावर को मॉडल में बदलाव करने की क्षमता मिली, तो सुरक्षा उपाय भरोसेमंद गारंटी नहीं रहे। आम तौर पर covert jailbreak-tuning सबसे मजबूत हमला रहा; अतिरिक्त defenses ने कुछ मामलों में मदद की, लेकिन समस्या को पूरी तरह बंद नहीं किया। साथ ही, उपलब्ध साक्ष्य Llama या Qwen3 के किसी खास मॉडल के लिए harmfulness बढ़ने का सटीक प्रतिशत बताने के लिए पर्याप्त नहीं हैं।
ओपन-वेट मॉडल जारी करते समय सुरक्षा मूल्यांकन को केवल यह नहीं देखना चाहिए कि मॉडल launch के समय क्या कर सकता है। यह भी जांचना होगा कि उसके सुरक्षा व्यवहार का कितना हिस्सा बाद में किए गए बदलावों के बाद बचा रहता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
TamperBench में जांचे गए सभी 21 ओपन वेट मॉडल नौ में से कम से कम एक छेड़छाड़ वाले खतरे के प्रति कमजोर पाए गए। कई मामलों में MMLU Pro तर्क प्रदर्शन में गिरावट 10% से अधिक नहीं थी।
TamperBench में जांचे गए सभी 21 ओपन वेट मॉडल नौ में से कम से कम एक छेड़छाड़ वाले खतरे के प्रति कमजोर पाए गए। कई मामलों में MMLU Pro तर्क प्रदर्शन में गिरावट 10% से अधिक नहीं थी। कोवर्ट jailbreak tuning—खासकर competing objectives, backdoor और style modulation तरीके—आम तौर पर सबसे प्रभावी हमले रहे।
ReFAT और Circuit Breaking जैसे अतिरिक्त सुरक्षा उपायों वाले पांच मॉडल कुछ परिस्थितियों में अधिक प्रतिरोधी थे, लेकिन किसी ने भी सुरक्षा हटाए जाने के खिलाफ भरोसेमंद गारंटी नहीं दी।