מתקפה חריפה מצד חוקרי סייבר: קלוד פייבל 5 חוסם אפילו משימות תמימות כמו קריאת פוסט בבלוג, ומעביר באופן שקוף שאילתות מסוימות לדגם חלש יותר, קלוד אופוס 4.8 [8][1][9]. המחלוקת נסובה סביב 'מסווגים' חדשים, מערכות AI נפרדות שמנתבות בקשות בנושאי סייבר, ביולוגיה, כימיה וזיקוק בינה מלאכותית, עובדה שלטענת המבקרים הוסתרה בתוך מ...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
חברת אנטרופיק (Anthropic) שחררה ב-9 ביוני 2026 את קלוד פייבל 5 (Claude Fable 5), מודל הבינה המלאכותית העוצמתי ביותר שלה שזמין לציבור, אולם ההשקה התקבלה במטח ביקורת חריף מצד קהילת אבטחת הסייבר. בזמן שהחברה ממסגרת את המודל כשחרור אחראי של טכנולוגיית דגם 'מיתוס' (Mythos) שלה, מומחי אבטחה טוענים שמנגנוני הבטיחות המובנים כל כך אגרסיביים, עד שהם הופכים את המודל לחסר תועלת לשימוש מעשי בעבודת מחקר והגנה לגיטימית .
ליבת הביקורת אינה עצם קיומם של אמצעי בטיחות, אלא האופן בו יושמו: באופן חרש, רחב, ועם מנגנון נסיגה המחליף בינה מלאכותית פחות מתקדמת ללא ידיעת המשתמש. להלן פירוט המחלוקת והטכנולוגיה שמאחוריה.
התלונה המרכזית של חוקרים היא הרגישות הקיצונית של מסווגי התוכן של פייבל 5. ולנטינה "צ'ומפי" פלמיוטי, חוקרת אבטחה בכירה ב-IBM X-Force, אמרה ל-TechCrunch כי המודל דוחה "כל בקשה שיכולה להיות קשורה באופן שולי לסייבר – אפילו משימות תמימות כמו קריאת פוסט בבלוג" . המשמעות היא שבקשות לעזרה בהבנת מושגי יסוד באבטחת מידע מסומנות כדגלים אדומים, לא רק בקשות מסוכנות באמת.
לסימון היתר הזה יש השפעה שלילית ישירה על התועלת במודל. כאשר שאילתה מסומנת, המשתמש מקבל תשובה מדוללת מדגם AI ישן יותר, החלפה שאינו מקבל עליה מידע מפורש . הבעיה הוחרפה בגלל אופן חשיפת המידע. המבקרים טוענים שההתנהגות הזו נחשפה רק עמוק בתוך מסמך 'כרטיס מערכת' (System Card) בן 319 עמודים, מה שהוביל להאשמות שאנטרופיק עסקה ב"חבלה סמויה" ביכולות המודל עבור משתמשים מסוימים
.
ההגבלות אינן מוגבלות לאבטחת סייבר. המסננים מכוונים גם לשאילתות הקשורות לביולוגיה, כימיה, ובאופן קריטי, לזיקוק מודלי AI (AI model distillation). הנקודה האחרונה הציתה גל ביקורת נפרד, כאשר חלק מהמפתחים מאשימים את אנטרופיק בשימוש ב"בטיחות" כעילה להתנהגות אנטי-תחרותית, על ידי מניעה ממפתחי AI אחרים להשתמש בפלט של פייבל 5 לאימון המודלים שלהם .
מערכת הבטיחות של אנטרופיק בפייבל 5 אינה מנגנון סירוב פשוט. זוהי מערכת ניתוב שנועדה להיכשל בשקט . הארכיטקטורה פועלת בשלושה שלבים:
באנטרופיק מציינים שמסווגים אלו מופעלים בפחות מ-5% מכלל הסשנים בממוצע . החברה הכירה בפומבי בבעיית סימון היתר. דובר החברה אמר ל-Business Insider שאמצעי הבטיחות "עלולים לסמן בקשות בטוחות, ניטרליות או תמימות", אך הצדיק זאת כפשרה הכרחית לשחרור פומבי של מודל בעל יכולות בסיס כל כך עוצמתיות
.
עמדתה של אנטרופיק היא שמסנני הבטיחות השמרניים הם בחירה מכוונת ואחראית, ולא באג. החברה טוענת שמודל הבסיס מסדרת 'מיתוס' כל כך מיומן במשימות כמו איתור וניצול פרצות תוכנה, עד ששחרור ציבורי ללא הגבלות היה יוצר סיכון בלתי מתקבל על הדעת לשימוש לרעה קטסטרופלי .
המסננים הם, לדעתם, פשרה תכנונית – דרך לספק לציבור גישה למודל חדשני לחשיבה, קידוד וכתיבה, תוך כדי יצירת ארגז חול סביב היכולות המסוכנות ביותר שלו . הם ממסגרים את סימון היתר כ"מחיר" הזמני של שחרור מודל עוצמתי "גם בבטחה וגם במהירות", עם מחויבות לחדד את המסווגים לאורך זמן
.
לא ניתן להבין את שחרורו של קלוד פייבל 5 במנותק. זהו חצי מאסטרטגיית פריסה דו-שכבתית שהופכת לסטנדרט תעשייתי חדש עבור מודלי AI מהשורה הראשונה .
באותו יום שבו שוחרר פייבל 5, אנטרופיק הודיעה גם על קלוד מיתוס 5 (Claude Mythos 5). שני המודלים חולקים את אותה ארכיטקטורה בסיסית ואותם משקלים ('Weights') – הם אותו "מוח". ההבדל היחיד הוא תצורת הבטיחות. במיתוס 5, המסווגים הוסרו בתחומים הרגישים, מה שמעניק לו את יכולותיו המלאות והבלתי מוגבלות .
עם זאת, מיתוס 5 אינו מיועד לציבור. הוא מוגבל לקבוצה קטנה של שותפים מאומתים, כולל סוכנויות ממשלתיות ומפעילי תשתיות קריטיות, באמצעות יוזמה בשם פרויקט גלאסווינג (Project Glasswing) . תוכנית זו, המגובה על ידי ממשלת ארה"ב, הושקה בתחילה עם 12 שותפים מייסדים, כולל ענקיות טכנולוגיה כמו AWS, גוגל ומיקרוסופט, במטרה לאפשר ל"לוחמי סייבר" להשתמש ב-AI כדי למצוא ולתקן פרצות תוכנה בקנה מידה רחב
. עם שחרורו של מיתוס 5, הגישה הורחבה לכ-40 ארגונים
.
הטבלה שלהלן ממחישה את הפיצול הבסיסי:
הפיצול של אנטרופיק בין פייבל למיתוס הוא הדוגמה המפורשת ביותר למה שניתן לכנות פריסת AI מדורגת-יכולות (Capability-Tiered AI Deployment). במודל חדש זה, מודל AI בודד מהשורה הראשונה אינו מוצר בודד אחד. מלוא העוצמה שלו היא זכות יתר, לא דבר מובן מאליו, ומסנני הבטיחות הם המנגנון שיוצר בידול מוצרי .
דפוס זה אינו ייחודי לאנטרופיק. חברות AI מובילות אחרות, כולל OpenAI, אימצו גישות דומות על ידי אספקת גרסאות עם גישה מוגבלת של המודלים המתקדמים ביותר שלהן לשותפים בתחום הביטחון הלאומי והמחקר . השקת פייבל 5/מיתוס 5 מגבשת עתיד שבו יכולות ה-AI העוצמתיות ביותר אינן חסומות על ידי טכנולוגיה, אלא על ידי מעמד אימות, כאשר פרוטוקולי בטיחות משמשים גם כמנגנוני בקרת גישה – גישה שכבר מעוררת ויכוח רחב יותר על ריכוזיות, הוגנות והמשמעות האמיתית של בטיחות AI "ציבורית".
ההאשמה המרכזית היא שאנטרופיק לא סיפרה בבירור למשתמשים על קיומו של מנגנון ההחלפה. המבקרים טוענים שההתנהגות הוטמנה ב'אותיות הקטנות' של מסמך בן 319 עמודים, שאיש אינו קורא, מה שהופך את המעבר ל"חבלה סמויה" ביכולות המודל. עבור חוקרים, תחושת הבגידה אינה נובעת מעצם ההגבלה, אלא מחוסר השקיפות: לגלות שאתה עובד עם מודל נחות רק אחרי שהתשובות מתחילות להיראות מוזר זו חוויה מתסכלת ומטעה.
מנגד, באנטרופיק טוענים שהשקיפות כן קיימת, פשוט במסמכים הטכניים המתאימים, ושבהינתן הסיכונים – היכולת של המודל לכתוב קוד זדוני ולמצוא פרצות אבטחה באופן אוטומטי – העמעום הקל הזה הכרחי כדי למנוע משחקנים זדוניים ללמוד איך לעקוף את המערכת. החברה מדגישה שהמסווגים לא נועדו לבלום חוקרים, אלא למנוע שימוש לרעה המוני.
המתח הזה בין יכולת גולמית לבין שליטה משקף את הדילמה הגדולה ביותר של תעשיית הבינה המלאכותית כרגע: איך חולקים כוח עצום עם הציבור מבלי שהוא יהפוך לנשק להשמדה המונית. התשובה של אנטרופיק, לעת עתה, היא לחלק את הגישה לשתי רמות, בתקווה שהשקיפות, גם אם חלקית, תספיק כדי לשמור על האמון. האם זה יצליח? קהילת הסייבר, נכון לעכשיו, מצביעה ברגליים.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
מתקפה חריפה מצד חוקרי סייבר: קלוד פייבל 5 חוסם אפילו משימות תמימות כמו קריאת פוסט בבלוג, ומעביר באופן שקוף שאילתות מסוימות לדגם חלש יותר, קלוד אופוס 4.8 [8][1][9].
מתקפה חריפה מצד חוקרי סייבר: קלוד פייבל 5 חוסם אפילו משימות תמימות כמו קריאת פוסט בבלוג, ומעביר באופן שקוף שאילתות מסוימות לדגם חלש יותר, קלוד אופוס 4.8 [8][1][9]. המחלוקת נסובה סביב 'מסווגים' חדשים, מערכות AI נפרדות שמנתבות בקשות בנושאי סייבר, ביולוגיה, כימיה וזיקוק בינה מלאכותית, עובדה שלטענת המבקרים הוסתרה בתוך מסמך בן 319 עמודים [1][3][5].
השקת מודל ציבורי מוגבל (Fable 5) לצד מודל לא מוגבל עבור שותפים מאומתים (Mythos 5) מסמלת סטנדרט תעשייתי חדש של AI מדורג יכולות, המעלה שאלות על שקיפות, שוויון ומשמעותה האמיתית של 'AI בטוח לציבור' [6][7][12].