כל 21 המודלים שנבדקו, בטווח של 600 מיליון עד 8 מיליארד פרמטרים, היו חשופים לפחות לאחת מתשע שיטות תקיפה ושינוי. שיטות של כוונון פריצה מוסווה, ובהן מטרות מתחרות, דלתות אחוריות ומניפולציה של סגנון, היו בדרך כלל היעילות ביותר.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
הממצא המרכזי של TamperBench חד: אף אחד מ-21 מודלי השפה עם המשקלים הפתוחים שנבדקו לא הציג מנגנוני בטיחות ששרדו באופן אמין את כל האיומים שנבחנו. המודלים, שכללו גרסאות רגילות וגרסאות עם הגנות נוספות, נעו בין כ-600 מיליון ל-8 מיליארד פרמטרים. לפחות שיטת תקיפה אחת הצליחה בכל מודל להגדיל את הנכונות להפיק תוכן מזיק, תוך שמירה על חלק ניכר מהיכולות הכלליות שלו. 256
המשמעות חשובה במיוחד למודלים עם משקלים פתוחים: לאחר פרסומם אפשר להעתיק אותם, לבצע בהם כוונון-עדין ולהפיץ אותם מחדש. שכבת בטיחות שעובדת במהלך הבדיקה המקורית של המפתחים אינה בהכרח מנגנון עמיד לאחר שהמשקלים ניתנים לשינוי חופשי.
TamperBench נועד למדוד עמידות בפני שינוי זדוני — ולא רק עמידות לפרומפטים שמנסים לעקוף סירוב, המכונים לעיתים jailbreak. המסגרת משלבת התקפות כוונון במרחב המשקלים עם התקפות שמנצלות או משנות ייצוגים לטנטיים, ובוחנת במקביל את התנהגות הבטיחות ואת היכולות שנותרו למודל. החוקרים ביצעו חיפוש שיטתי של פרמטרי התקיפה עבור כל שילוב של מודל ושיטה, במקום להסתמך על תצורת תקיפה יחידה. 2
הבדיקה כללה תשעה סוגי שינוי, ובהם:
החוקרים לא הסתפקו בשאלה אם אפשר לגרום למודל להפוך לבלתי-בטוח. הם חיפשו התקפות שמגדילות את שיעור התגובות המזיקות, ובו בזמן שומרות על ירידה של עד 10% בדיוקת החשיבה במבחן MMLU-Pro, בהשוואה לביצועי המודל לפני השינוי. 2
התוצאות החמורות ביותר הגיעו בדרך כלל מהתקפות כוונון-פריצה. בין הגרסאות שנבדקו היו מטרות מתחרות, דלתות אחוריות ומניפולציה של סגנון. אחד המאפיינים הבולטים שלהן הוא שהן יכולות להסתמך בעיקר על נתוני אימון תמימים, בתוספת רכיב מזיק קטן יחסית. כך הן אינן נראות כמו ניסיון גס לאמן מחדש את המודל להתנהגות מסוכנת, אלא כמו ניסיון ממוקד לשנות את התנהגות הבטיחות שלו תוך שימור השימושיות. 26
המסקנה הרחבה יותר היא שאפשר להפריד בין בטיחות ליכולת באופן בעייתי: שינוי זדוני עשוי להחליש את נטיית המודל לסרב לבקשות מסוכנות, בלי להרוס באותה מידה את יכולת החשיבה שלו. לכן מודל שעוד נראה שימושי במבחני ביצועים רגילים עלול להפוך למסוכן יותר לפריסה.
TamperBench בדק 21 מודלים עם משקלים פתוחים בטווח של 0.6 עד 8 מיליארד פרמטרים, ממשפחות ובהן Llama, Qwen3 ו-Mistral. הראיות שסופקו תומכות בממצא הכללי שלפיו כל מודל שנבדק היה חשוף לפחות לאחת מהתקפות הבדיקה. 56
עם זאת, חומר המקור הזמין אינו מספק את העלייה המדויקת ברמת המזיקות עבור Llama-3-8B-Instruct או Qwen3-8B-Instruct, תחת התנאי של ירידה של עד 10% ב-MMLU-Pro. לכן אי אפשר להסיק מהתוצאה הכוללת אחוז מדויק עבור אחד מהמודלים האלה. המסקנה הזהירה היא איכותנית: ניתן להגדיל באופן ניכר את ההתנהגות המזיקה תוך שמירה על חלק גדול מיכולת החשיבה, אך הנתונים שסופקו אינם קובעים שיעור עלייה מספרי מדויק עבור Llama או Qwen3 מסוימים.
המחקר גם מצא שלא קיים דפוס אחיד של עמידות בין מודלי בסיס למודלים שעברו אימון נוסף. העמידות היחסית עשויה להשתנות בין משפחות מודלים, ובמחקר דווחו מגמות הפוכות בין גרסאות Llama 3 לגרסאות Qwen3. 6
לא. חמשת המודלים עם ההגנות הנוספות שנבדקו — ובהם גרסאות ReFAT ו-Circuit Breaking — היו גם הם חשופים למערך ההתקפות. ההגנות שיפרו את העמידות בחלק מהתרחישים, אך לא מנעו באופן עקבי את הסרת מנגנוני הבטיחות מול כל האיומים שנבדקו. 25
המחקר מציין את Triplet כאחת ההגנות העמידות יותר, תוך שימור יכולות טוב יחסית בהשוואות שבוצעו. זהו סימן מעודד למחקר, אך לא ערובה מעשית: הממצא המרכזי נותר שאף הגנה שנבדקה לא פתרה את בעיית השינוי הזדוני לאורך כל מערך הבדיקות. 6
המחקר אינו טוען שמודלים עם משקלים פתוחים חסרי ערך. פרסום פתוח יכול לתמוך במחקר, בביקורת חיצונית ובאחריותיות. הלקח המצומצם יותר הוא שמודל שעבר בהצלחה בדיקות יישור ובטיחות לפני ההשקה לא צריך להיחשב בטוח בהכרח לאחר שהמשקלים שלו שונו. 5
גם מודלים מסחריים המופעלים דרך API מתמודדים עם שאלות הקשורות לכוונון-עדין ולבטיחות לאחר התאמה אישית. עם זאת, ספקיהם שומרים בדרך כלל על שליטה רבה יותר בצינור האימון ובסביבת ההפעלה. שליטה כזו מאפשרת להפעיל הגנות בזמן הכוונון או לאחריו — אפשרויות שקשה הרבה יותר לאכוף לאחר שהמשקלים הופצו לציבור. 25
הסיכון שעליו מצביע TamperBench אינו מסתכם באדם שמוצא פרומפט יחיד שמצליח לעקוף סירוב. אם אפשר לשמר את היכולות השימושיות של המודל בעת החלשת ההגנות, מודל שעבר שינוי עשוי לשמש שוב ושוב למשימות מזיקות, כגון הפצת דיסאינפורמציה בהיקף גדול, פישינג והונאות, או מתן סיוע טכני מסוכן. החוקרים מציגים זאת כהשלכה אפשרית של הסרת הגנות תוך שימור יכולות — לא כמדידה של שימוש לרעה שבוצע במסגרת הבנצ'מרק עצמו. 5
עבור ארגונים שבוחרים מודל, חשוב להבחין בין שני סוגי בדיקות:
החוקרים קוראים לפיתוח שיטות חזקות יותר לעמידות בפני שינוי, לבדיקות עוינות תקניות כגון TamperBench לפני פרסום מודלים, ולהערכה ולרכש של מערכות AI על בסיס ראיות. הם מצביעים במיוחד על תחומים בעלי השפעה גבוהה, ובהם בריאות, איתור הונאות, חינוך ושירותים ציבוריים — מקומות שבהם ההתנהגות של מודל לאחר השקתו עשויה להיות חשובה לא פחות מהתיעוד הבטיחותי הראשוני שלו. 25
TamperBench אינו מראה שכל מודל עם משקלים פתוחים ינוצל לרעה. הוא מראה שבקרב 21 המודלים שנבדקו, מנגנוני הבטיחות לא היו ערובה אמינה לאחר שהמודל נחשף לשינוי זדוני. כוונון-פריצה מוסווה היה בדרך כלל קטגוריית ההתקפות החזקה ביותר; הגנות נוספות עזרו בחלק מהמקרים אך לא סגרו את הפער; והראיות שסופקו אינן מאפשרות לקבוע אחוזי עלייה מדויקים ברמת המזיקות עבור דגמי Llama או Qwen3 בודדים.
עבור מודלים עם משקלים פתוחים, בדיקת הבטיחות צריכה לבחון לא רק מה המודל מסוגל לעשות ברגע ההשקה, אלא גם כמה מההתנהגות הבטוחה שלו שורד לאחר שינוי.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
כל 21 המודלים שנבדקו, בטווח של 600 מיליון עד 8 מיליארד פרמטרים, היו חשופים לפחות לאחת מתשע שיטות תקיפה ושינוי.
כל 21 המודלים שנבדקו, בטווח של 600 מיליון עד 8 מיליארד פרמטרים, היו חשופים לפחות לאחת מתשע שיטות תקיפה ושינוי. שיטות של כוונון פריצה מוסווה, ובהן מטרות מתחרות, דלתות אחוריות ומניפולציה של סגנון, היו בדרך כלל היעילות ביותר.
גרסאות עם הגנות נוספות, ובהן ReFAT ו Circuit Breaking, שיפרו את העמידות בחלק מהמקרים אך לא סיפקו הגנה אמינה מפני הסרת מנגנוני הבטיחות.