כל 21 המודלים שנבדקו היו פגיעים לפחות לאחת מתשע שיטות החבלה שנבחנה במחקר. המודלים נעשו מוכנים יותר להפיק תוכן מזיק, תוך שמירה על חלק גדול מיכולות ההיגיון שלהם.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
מחקר TamperBench, שהוצג בכנס ACM KDD ’26, בחן 21 מודלי שפה גדולים בעלי משקולות פתוחות — כלומר, מודלים שאפשר להוריד, להעתיק ולכוונן מחדש — בהם משפחות Llama, Qwen3 ו-Mistral, בטווח של כ-600 מיליון עד 8 מיליארד פרמטרים. המסקנה הייתה חד-משמעית: אף אחד מהמודלים לא הציג מנגנוני בטיחות חזקים מספיק כדי לעמוד בכל איומי החבלה שנבדקו. 25
בכל אחד מהמודלים הצליחו החוקרים למצוא דרך להפוך אותו לנכונות גבוהה יותר להפיק תשובות מזיקות, ובמקביל לשמר חלק ניכר מיכולת ההיגיון שלו. לכן, לפי החוקרים, אמצעי ההגנה הקיימים אינם יכולים להיחשב ערובה לכך שמודל יישאר בטוח לאחר שהמשקולות שלו שוחררו וניתנות לשינוי. 25
הבדיקה שילבה תשע שיטות תקיפה במרחב המשקולות ובייצוגים הפנימיים של המודל. בין היתר נבחנו:
התקיפות הסמויות מסוג jailbreak-tuning היו בדרך כלל החמורות ביותר. במיוחד בלטו גרסאות שהתבססו על מטרות מתחרות, דלתות אחוריות ושינוי סגנון — שיטות שאומנו בעיקר על מידע תמים, אך כללו רכיב מזיק קטן שהספיק כדי לפגוע בהגנות. 2
כדי לבדוק אם מדובר בהסרת בטיחות אמיתית ולא בהרס של המודל, החוקרים חיפשו הגדרות תקיפה שהגדילו ככל האפשר את ציון התשובות המזיקות, תוך הגבלת הירידה בביצועי ההיגיון במבחן MMLU-Pro לעד 10% לעומת המודל המקורי. 2
המחקר כלל גם חמישה מודלים שקיבלו מנגנוני הגנה נוספים, בהם גרסאות המבוססות על ReFAT ועל Circuit Breaking. ההגנות אכן שיפרו את העמידות בחלק מהתרחישים, אך לא מנעו באופן עקבי את הסרת מגבלות הבטיחות לאורך כל מערך התקיפות. 25
החוקרים מציינים כי קיימים הבדלים בעמידות בין מודלים בסיסיים למודלים שעברו אימון-יישור, וכי הגנה מסוימת עשויה להיות יעילה יותר נגד סוג תקיפה אחד ופחות נגד אחר. באחד מסיכומי המחקר צוין כי Triplet הייתה לעיתים קרובות הגנה עמידה יחסית, תוך שמירה טובה על יכולות המודל — אך גם היא אינה הופכת מודל בעל משקולות פתוחות לחסין. 8
הראיות שסופקו אינן כוללות את העלייה המספרית המדויקת ברמת המזיקות עבור Llama-3-8B-Instruct או Qwen3-8B-Instruct. לכן אי אפשר לקבוע באופן מהימן נתונים נפרדים עבור שני המודלים האלה.
כאשר מודל מופעל דרך שירות סגור, הספק שולט בדרך כלל באימון-העדכון, בתשתית ההפעלה ובגישה אליו. לעומת זאת, לאחר שמשקולות של מודל פתוח מופצות לציבור, אפשר להעתיק אותן, לכוונן אותן ולהפיץ גרסאות חדשות — בלי שהמפתח המקורי יוכל לאכוף את מנגנוני הבטיחות שלו. 2
הסיכון אינו מוגבל לכך שמישהו יגרום למודל לענות על שאלה בעייתית אחת. אם אפשר להסיר את ההגנות בלי לפגוע קשות ביכולות, מודל כזה עלול לשמש בהיקף רחב יותר להפצת דיסאינפורמציה, להונאות ולפישינג מתוחכם או להפקת הנחיות טכניות מזיקות. 5
עם זאת, החוקרים אינם טוענים שלמודלים פתוחים אין ערך. פתיחות יכולה לתמוך במחקר, בביקורת חיצונית ובאחריותיות. הטענה היא שמודל לא צריך להיחשב בטוח רק משום שעבר בדיקות יישור מקובלות לפני השחרור. 5
המחקר קורא להשקעה גדולה יותר במחקר על עמידות בפני חבלה, לשימוש במבחנים אדוורסריים תקניים כמו TamperBench לפני פרסום מודלים, ולהערכה מבוססת-ראיות בעת בחירת מערכות AI ורכישתן. הדבר חשוב במיוחד כאשר ממשלות וגופים ציבוריים מטמיעים AI בתחומים כמו בריאות, איתור הונאות וחינוך. 25
החוקרים גם מזהירים כי מודלים מסחריים סגורים עשויים להתמודד עם סיכוני חבלה קשורים. עם זאת, לספקים שמחזיקים בשליטה על הכוונון וההפעלה יש אפשרות להוסיף הגנות בשלב האימון או לאחריו — אפשרות שנעלמת במידה רבה כאשר המשקולות מופצות ללא מגבלה. 25
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
כל 21 המודלים שנבדקו היו פגיעים לפחות לאחת מתשע שיטות החבלה שנבחנה במחקר.
כל 21 המודלים שנבדקו היו פגיעים לפחות לאחת מתשע שיטות החבלה שנבחנה במחקר. המודלים נעשו מוכנים יותר להפיק תוכן מזיק, תוך שמירה על חלק גדול מיכולות ההיגיון שלהם.
התקפות כוונון עוקף סמויות, ובהן דלתות אחוריות ומניפולציה של סגנון, היו בדרך כלל החמורות ביותר.