GRAM (Gradient Routed Auxiliary Modules) היא שיטת אימון מקדים ניסיונית מ Anthropic ו AE Studio המנתבת ידע דו שימושי – כמו וירולוגיה או אבטחת סייבר – למודולים ייעודיים בתוך מודל שפה גדול, כך שניתן להסירם או לנטרלם. במערך עם ארבע קטגוריות דו שימושיות, מודל יחיד שאומן ב GRAM יכול תיאורטית להיות מוגדר ל 16 פרופילי יכולו...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Anthropic and AE Studio's GRAM (Gradient-Routed Auxiliary Modules) technique for isolatin. Article summary: Here is a comprehensive, sourced breakdown of Anthropic and AE Studio's GRAM technique.. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Anthropic ו-AE Studio הציגו טכניקה ניסיונית בשם GRAM (Gradient-Routed Auxiliary Modules) שעשויה לתת למודלי בינה מלאכותית "מתג כיבוי" גרעיני לידע מסוכן. במקום לאמן מודלים נפרדים לכל תצורת בטיחות, GRAM שואפת לבנות מודל יחיד עם תאים ניתנים להסרה עבור יכולות דו-שימושיות כמו וירולוגיה, אבטחת סייבר ופיזיקה גרעינית R. המחקר ראשוני – Anthropic מציינת שהוא לא יושם באף מודל Claude יצרני R – אך הוא מייצג כיוון מבטיח להפוך את בטיחות הבינה המלאכותית לניתוחית יותר מארגז הכלים הקהה של ימינו.
GRAM היא שיטת אימון מקדים שנועדה לרכז ידע דו-שימושי – מידע שיכול לשמש הן למטרות מועילות והן למטרות מזיקות – לתוך מודולים עצביים ניתנים להסרה בתוך מודל שפה R. לאחר האימון, ניתן להפעיל או לנתק את המודולים הללו, מה שנותן למפעילים שליטה עדינה על אילו יכולות מסוכנות נשמרות במודל R. אותה גישה יכולה גם לאפשר פרופילי גישה שונים למשתמשים שונים: חוקרים עשויים להפעיל ידע וירולוגי בעוד שצ'אטבוט ציבורי שומר אותו מנוטרל R.
GRAM מוסיפה מודולי עזר קטנים לארכיטקטורת ה-Transformer הסטנדרטית – למעשה נוירונים ייעודיים בכל שכבה – שנועדו ללכוד יכולות דו-שימושיות ספציפיות במהלך האימון RR. מנגנון המפתח הוא ניתוב גרדיאנט (gradient routing): במהלך התפשטות לאחור, מסכות משוקללות שולטות אילו פרמטרים מתעדכנים עבור אילו נתונים OL.
לאחר השלמת האימון, ניתן להסיר או לנטרל מודולים בודדים כדי להפחית גישה ליכולת מסוימת, או להשאירם במקומם עבור פריסות המורשות להשתמש בידע זה R. מכיוון שכל קטגוריה דו-שימושית ממופה למודול משלה, מודל יחיד שאומן ב-GRAM עם ארבע קטגוריות יכול תיאורטית להיות מוגדר ל-2⁴ = 16 פרופילי יכולות נפרדים על ידי הפעלה או כיבוי של כל מודול באופן עצמאי R.
החוקרים בדקו את GRAM במספר הגדרות ובגדלי מודל R:
מחקר GRAM מגיע לצד דוגמה בעולם האמיתי בעלת חשיבות גבוהה לבעיה שהוא שואף לפתור. ביוני 2025, ממשל טראמפ הטיל מגבלות יצוא על מודלי Claude Fable 5 ו-Mythos 5 של Anthropic בעקבות חששות אבטחת סייבר, תוך חסימת גישה עבור כל אזרח זר – בתוך או מחוץ לארה"ב, כולל עובדי Anthropic שהם אזרחים זרים ACC. האיסור נמשך 18 ימים לפני שמשרד המסחר הסיר אותו לאחר בדיקת ביטחון לאומי FA.
פרק זה מדגים את המצב הנוכחי של בקרת גישה לבינה מלאכותית: מודל שלם – עם כל יכולותיו – מטופל כיחידה בלתי ניתנת לחלוקה. אם למודל יש יכולת מסוכנת, האפשרות היחידה כיום היא למנוע את המערכת כולה. GRAM מציעה אלטרנטיבה עדינה יותר: במקום לנעול מודל שלם, מערכת יכולה לאפשר או לנטרל קטגוריות ספציפיות של ידע בהתאם להקשר הפריסה R.
חוקרי Anthropic מזהים במפורש את GRAM כעבודה ראשונית ומדגישים מספר מגבלות R:
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GRAM (Gradient Routed Auxiliary Modules) היא שיטת אימון מקדים ניסיונית מ Anthropic ו AE Studio המנתבת ידע דו שימושי – כמו וירולוגיה או אבטחת סייבר – למודולים ייעודיים בתוך מודל שפה גדול, כך שניתן להסירם או לנטרלם.
GRAM (Gradient Routed Auxiliary Modules) היא שיטת אימון מקדים ניסיונית מ Anthropic ו AE Studio המנתבת ידע דו שימושי – כמו וירולוגיה או אבטחת סייבר – למודולים ייעודיים בתוך מודל שפה גדול, כך שניתן להסירם או לנטרלם. במערך עם ארבע קטגוריות דו שימושיות, מודל יחיד שאומן ב GRAM יכול תיאורטית להיות מוגדר ל 16 פרופילי יכולות שונים על ידי הפעלה או כיבוי של מודולים ספציפיים.
הטכניקה מגיעה על רקע ויכוחים מדיניים בעולם האמיתי: ביוני 2025, ממשל טראמפ הטיל – ואחר כך הסיר – מגבלות יצוא על מודלי Claude Fable 5 ו Mythos 5 של Anthropic בעקבות חששות אבטחת סייבר, מה שממחיש את הבעיה ש GRAM מבקשת לפתור.