لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال. كانت هجمات الضبط الدقيق الخفية لكسر الحواجز، ولا سيما هجمات «الأهداف المتنافسة» و«الباب الخلفي» و«تعديل الأسلوب»، من بين الأشد تأثيراً.
نشر بواسطةتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
خلصت دراسة TamperBench، التي عُرضت في مؤتمر ACM KDD ’26، إلى أن حواجز الأمان في النماذج المفتوحة الأوزان لا توفر ضماناً متيناً بعد نشر الأوزان وإتاحة تعديلها. فقد اختبر الباحثون 21 نموذجاً من نماذج اللغة الكبيرة، بينها نماذج من عائلات Llama وQwen3 وMistral، بأحجام تراوحت بين 600 مليون و8 مليارات مُعامِل، ولم يصمد أي منها أمام جميع أساليب العبث التي قيّمها الاختبار. 2
5
أمكن تعديل كل نموذج بحيث يصبح أكثر استعداداً لإنتاج مخرجات ضارة، مع احتفاظه بقدر كبير من قدرته الأصلية على الاستدلال والمهام العامة. ولهذا يرى الباحثون أن اختبارات المواءمة التقليدية قبل الإطلاق لا تكفي وحدها للحكم على سلامة نموذج يمكن لأي طرف نسخ أوزانه وإعادة ضبطها وتوزيعها. 2
5
لم تكن النتيجة مجرد تعطيل كامل لقدرات النموذج؛ بل ركزت الدراسة على هجمات تضعف السلامة مع إبقاء المنفعة العملية مرتفعة. واختار الباحثون إعدادات الهجوم التي تزيد درجات الاستجابة الضارة، شرط ألا يتراجع أداء النموذج في معيار MMLU-Pro للاستدلال والفهم متعدد المهام بأكثر من 10% مقارنة بالنموذج غير المعبوث به. 2
غطى المعيار تسع طرق للعبث، شملت ضبطاً دقيقاً يبدو benign أو غير ضار ظاهرياً، وضبطاً مباشراً على أمثلة ضارة، وهجمات ضبط دقيق خفية شبيهة بالتسميم لكسر الحواجز، إضافة إلى الضبط متعدد اللغات وهجمات تستهدف التمثيلات الكامنة أو طبقة التضمين. 2
وكانت هجمات كسر الحواجز الخفية عموماً الأكثر شدة، خصوصاً:
وتعتمد هذه الأساليب غالباً على بيانات تبدو سليمة في معظمها، مع إدخال مكوّن ضار صغير، ما يجعل اكتشافها أكثر صعوبة من التدريب الضار الصريح. 2
ولا تتضمن الأدلة المتاحة أرقاماً دقيقة للزيادة في مستوى الضرر لكل نموذج على حدة، لذلك لا يمكن الجزم بقيمة عددية محددة لنموذجي Llama-3-8B-Instruct أو Qwen3-8B-Instruct.
لا بالكامل. فقد شملت الدراسة خمسة نماذج مزودة بدفاعات إضافية، بينها نسخ تستخدم ReFAT وCircuit Breaking. وحسّنت هذه الدفاعات المقاومة في بعض الحالات، لكنها لم تمنع بصورة موثوقة إزالة حواجز الأمان عبر مجموعة الهجمات الكاملة. 2
5
وتزداد أهمية هذه النتيجة لأن مطوّر النموذج يستطيع التحكم في الضبط والنشر عندما يقدم النموذج عبر واجهة برمجية مغلقة، لكنه يفقد هذا التحكم بدرجة كبيرة عندما تُنشر الأوزان علناً؛ إذ يمكن نسخها وتعديلها وإعادة توزيعها خارج نطاق آليات السلامة الأصلية. 2
لا تقول الدراسة إن النماذج مفتوحة الأوزان تفتقر إلى القيمة. فالانفتاح يمكن أن يدعم البحث العلمي وقابلية التدقيق والمساءلة. لكن الباحثين يحذرون من اعتبار النموذج آمناً لمجرد اجتيازه اختبارات المواءمة المعتادة قبل الإطلاق. 5
وقد يؤدي تعطيل الحواجز مع الحفاظ على القدرات إلى إساءة استخدام واسعة النطاق، مثل إنتاج حملات تضليل جماعية، أو تطوير رسائل تصيد واحتيال أكثر إقناعاً، أو تقديم إرشادات تقنية ضارة. 5
ويشير الباحثون أيضاً إلى أن النماذج التجارية المغلقة قد تواجه مخاطر عبث ذات صلة، لكن مزوديها يستطيعون فرض ضوابط أثناء الضبط الدقيق أو بعده، وهي ضوابط يصعب تطبيقها بعد توزيع الأوزان المفتوحة على نطاق واسع. 2
5
لذلك تدعو الدراسة إلى تطوير دفاعات أكثر مقاومة للعبث، واعتماد تقييمات خصمية معيارية مثل TamperBench قبل الإطلاق، وتحسين أساليب تقييم الذكاء الاصطناعي وشراء الأنظمة المعتمدة عليه، خصوصاً مع توسع استخدامه في الرعاية الصحية واكتشاف الاحتيال والتعليم والخدمات العامة. 2
5
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال.
لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال. كانت هجمات الضبط الدقيق الخفية لكسر الحواجز، ولا سيما هجمات «الأهداف المتنافسة» و«الباب الخلفي» و«تعديل الأسلوب»، من بين الأشد تأثيراً.
شملت الاختبارات تسع فئات من العبث بالأوزان والتمثيلات الكامنة، مع قياس الضرر على السلامة مقابل تراجع لا يتجاوز 10% في دقة الاستدلال على معيار MMLU Pro.
لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال. كانت هجمات الضبط الدقيق الخفية لكسر الحواجز، ولا سيما هجمات «الأهداف المتنافسة» و«الباب الخلفي» و«تعديل الأسلوب»، من بين الأشد تأثيراً.
نشر بواسطةتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
خلصت دراسة TamperBench، التي عُرضت في مؤتمر ACM KDD ’26، إلى أن حواجز الأمان في النماذج المفتوحة الأوزان لا توفر ضماناً متيناً بعد نشر الأوزان وإتاحة تعديلها. فقد اختبر الباحثون 21 نموذجاً من نماذج اللغة الكبيرة، بينها نماذج من عائلات Llama وQwen3 وMistral، بأحجام تراوحت بين 600 مليون و8 مليارات مُعامِل، ولم يصمد أي منها أمام جميع أساليب العبث التي قيّمها الاختبار. 2
5
أمكن تعديل كل نموذج بحيث يصبح أكثر استعداداً لإنتاج مخرجات ضارة، مع احتفاظه بقدر كبير من قدرته الأصلية على الاستدلال والمهام العامة. ولهذا يرى الباحثون أن اختبارات المواءمة التقليدية قبل الإطلاق لا تكفي وحدها للحكم على سلامة نموذج يمكن لأي طرف نسخ أوزانه وإعادة ضبطها وتوزيعها. 2
5
لم تكن النتيجة مجرد تعطيل كامل لقدرات النموذج؛ بل ركزت الدراسة على هجمات تضعف السلامة مع إبقاء المنفعة العملية مرتفعة. واختار الباحثون إعدادات الهجوم التي تزيد درجات الاستجابة الضارة، شرط ألا يتراجع أداء النموذج في معيار MMLU-Pro للاستدلال والفهم متعدد المهام بأكثر من 10% مقارنة بالنموذج غير المعبوث به. 2
غطى المعيار تسع طرق للعبث، شملت ضبطاً دقيقاً يبدو benign أو غير ضار ظاهرياً، وضبطاً مباشراً على أمثلة ضارة، وهجمات ضبط دقيق خفية شبيهة بالتسميم لكسر الحواجز، إضافة إلى الضبط متعدد اللغات وهجمات تستهدف التمثيلات الكامنة أو طبقة التضمين. 2
وكانت هجمات كسر الحواجز الخفية عموماً الأكثر شدة، خصوصاً:
وتعتمد هذه الأساليب غالباً على بيانات تبدو سليمة في معظمها، مع إدخال مكوّن ضار صغير، ما يجعل اكتشافها أكثر صعوبة من التدريب الضار الصريح. 2
ولا تتضمن الأدلة المتاحة أرقاماً دقيقة للزيادة في مستوى الضرر لكل نموذج على حدة، لذلك لا يمكن الجزم بقيمة عددية محددة لنموذجي Llama-3-8B-Instruct أو Qwen3-8B-Instruct.
لا بالكامل. فقد شملت الدراسة خمسة نماذج مزودة بدفاعات إضافية، بينها نسخ تستخدم ReFAT وCircuit Breaking. وحسّنت هذه الدفاعات المقاومة في بعض الحالات، لكنها لم تمنع بصورة موثوقة إزالة حواجز الأمان عبر مجموعة الهجمات الكاملة. 2
5
وتزداد أهمية هذه النتيجة لأن مطوّر النموذج يستطيع التحكم في الضبط والنشر عندما يقدم النموذج عبر واجهة برمجية مغلقة، لكنه يفقد هذا التحكم بدرجة كبيرة عندما تُنشر الأوزان علناً؛ إذ يمكن نسخها وتعديلها وإعادة توزيعها خارج نطاق آليات السلامة الأصلية. 2
لا تقول الدراسة إن النماذج مفتوحة الأوزان تفتقر إلى القيمة. فالانفتاح يمكن أن يدعم البحث العلمي وقابلية التدقيق والمساءلة. لكن الباحثين يحذرون من اعتبار النموذج آمناً لمجرد اجتيازه اختبارات المواءمة المعتادة قبل الإطلاق. 5
وقد يؤدي تعطيل الحواجز مع الحفاظ على القدرات إلى إساءة استخدام واسعة النطاق، مثل إنتاج حملات تضليل جماعية، أو تطوير رسائل تصيد واحتيال أكثر إقناعاً، أو تقديم إرشادات تقنية ضارة. 5
ويشير الباحثون أيضاً إلى أن النماذج التجارية المغلقة قد تواجه مخاطر عبث ذات صلة، لكن مزوديها يستطيعون فرض ضوابط أثناء الضبط الدقيق أو بعده، وهي ضوابط يصعب تطبيقها بعد توزيع الأوزان المفتوحة على نطاق واسع. 2
5
لذلك تدعو الدراسة إلى تطوير دفاعات أكثر مقاومة للعبث، واعتماد تقييمات خصمية معيارية مثل TamperBench قبل الإطلاق، وتحسين أساليب تقييم الذكاء الاصطناعي وشراء الأنظمة المعتمدة عليه، خصوصاً مع توسع استخدامه في الرعاية الصحية واكتشاف الاحتيال والتعليم والخدمات العامة. 2
5
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال.
لم ينجح أي من النماذج الـ21 المختبرة في مقاومة جميع تهديدات العبث؛ إذ أمكن جعل كل نموذج أكثر قابلية لإنتاج مخرجات ضارة مع الحفاظ على جزء كبير من قدرته على الاستدلال. كانت هجمات الضبط الدقيق الخفية لكسر الحواجز، ولا سيما هجمات «الأهداف المتنافسة» و«الباب الخلفي» و«تعديل الأسلوب»، من بين الأشد تأثيراً.
شملت الاختبارات تسع فئات من العبث بالأوزان والتمثيلات الكامنة، مع قياس الضرر على السلامة مقابل تراجع لا يتجاوز 10% في دقة الاستدلال على معيار MMLU Pro.