לפי OpenAI, GPT‑6 Astra מפיק פחות טעויות עובדתיות ועמיד משמעותית יותר מ‑GPT‑5.6 Sol בפני jailbreaks והזרקות פרומפט, גם לאורך מסלולי תקיפה ארוכים. בזירת IPI של Gray Swan לא נמצא מודל חסין להזרקות פרומפט נסתרות: נבחנו 13 מודלי חזית, 41 תרחישי סוכנים ויותר מ‑272,000 ניסיונות תקיפה.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI מציגה את GPT‑6 Astra כשדרוג בטיחותי משמעותי לעומת GPT‑5.6 Sol: לפי הערכות החברה, Astra מפיק פחות טעויות עובדתיות, עמיד יותר להזרקות פרומפט, וחזק משמעותית מול jailbreaks — גם כאשר ההתקפה מתפתחת לאורך רצף ארוך של צעדים ושיחות. 25
30
אבל השיפור ברמת המודל אינו הופך סוכן AI לחסין מפני הוראות עוינות שמסתתרות בדפי אינטרנט, מסמכים, הודעות דוא״ל, מאגרי קוד או פלטי כלים שהוא קורא. בבדיקות הזרקת פרומפט עקיפה (IPI) של Gray Swan, אף אחד מהמודלים שנבדקו לא נמצא חסין. 4
לפי OpenAI, Astra עמיד משמעותית יותר ל-jailbreaks בהשוואה ל‑GPT‑5.6 Sol, כולל מול תקיפות לאורך מסלולים ארוכים. המשמעות היא שתוקף מתוחכם אינו חייב להסתמך על בקשה בודדת ובולטת: הוא יכול לשנות טקטיקה לאורך דיאלוג רב-שלבי ולנסות לנצל את ההקשר שהצטבר. 25
החברה מדווחת גם על עמידות משופרת להזרקות פרומפט בתרחישי גלישה וסביבות עבודה, וכן על פחות טעויות עובדתיות בהשוואה ל‑Sol. עם זאת, חשוב לפרש בזהירות את נתוני הדיוק: מבחני שחזור הטעויות התבססו על שיחות ChatGPT שמשתמשים כבר סימנו כשגויות, ולכן אינם אומדים את שיעור ההזיות בשימוש יומיומי רגיל. 25
30
אלה שיפורים חשובים במיוחד לסוכנים שמבצעים מחקר, כותבים קוד, גולשים ברשת ומטפלים בעבודה רב-שלבית. בהערות ההשקה OpenAI מתארת את Astra כמודל שמסוגל להתמודד עם משימות מורכבות מרובות שלבים ולהפיק מסמכים, גיליונות אלקטרוניים ומצגות. 19
הראיות הזמינות אינן מאפשרות לקבוע ש‑Astra בטוח יותר מ‑Claude Opus 5 של Anthropic בכל הקשור לדיוק עובדתי, jailbreaks ישירים או הזרקות פרומפט עקיפות.
דירוג בטיחות בין מודלים מחייב מערך בדיקות משותף, כלי סוכן זהים, אותן הוראות מערכת, הגדרה אחידה להצלחת תקיפה, ותוקפים שיכולים להסתגל באופן דומה. הערכות של ספקים ואתגרי red teaming פומביים עשויים להיות שונים בכל אחד מהמשתנים הללו. החומרים של Gray Swan מציינים את Claude Opus 5 בין המודלים הזמינים בזירה שלה, אך התוצאות שסופקו אינן כוללות כרטיס ניקוד מקביל וישיר של Astra מול Opus 5. 1
4
המסקנה המבוססת יותר צרה: הראיות החזקות ביותר של OpenAI הן לשיפור של Astra ביחס לקודמו, GPT‑5.6 Sol.
ב-jailbreak ישיר, התוקף מפנה למודל בקשה גלויה — למשל ניסיון לעקוף את כללי המודל או לגרום לו לבצע פעולה אסורה. השיפור המדווח של Astra מול מסלולי תקיפה ארוכים רלוונטי במיוחד ליריב מתמיד שמסתגל לאורך שיחה. 25
הזרקת פרומפט עקיפה מגיעה דרך תוכן שהסוכן צורך. הוראה עוינת עשויה להיות מוטמעת בדף אינטרנט, מייל, מסמך, תוצאת חיפוש, עקבת עבודה של סוכן קוד או פלט של כלי; מטרתה היא להסיט את הסוכן מן היעד שהגדיר המשתמש. אתגר ה‑IPI של Gray Swan התמקד בהוראות נסתרות בסביבות מציאותיות, ובהן תוכן ווב, פלטי כלים ועקבות של סוכני קוד. 5
זו נקודה מהותית: ייתכן שהאדם שמפעיל את הסוכן כלל לא יראה את ההוראה הזדונית.
Gray Swan דיווחה כי זירת ה‑IPI כללה 13 מודלי חזית, 464 בודקי אבטחה, 41 תרחישים ויותר מ‑272,000 ניסיונות תקיפה. מסקנתה המוצהרת הייתה שאף מודל שנבדק לא היה חסין להזרקת פרומפט עקיפה. 4
זוהי ראיה משמעותית לכך שהזרקות עקיפות עדיין אינן בעיה פתורה בפריסות של סוכני AI. עם זאת, אין מדובר בטבלת דירוג מלאה ונייטרלית בין ספקים לכל ממדי הבטיחות. אין להסיק מכך שכל המודלים נכשלים באותו שיעור, או שהמבחן מחליף הערכות ייעודיות של דיוק עובדתי ועמידות בפני jailbreak ישיר.
בעוזר שיחה עצמאי, הזרקה מוצלחת עלולה להוביל לתשובה מטעה. בסוכן ארגוני שמחובר למערכות עסקיות, הנזק הפוטנציאלי עשוי להיות גדול בהרבה.
OpenAI מסווגת את Astra כמי שעומד בסף יכולת סייבר Critical במסגרת Preparedness Framework שלה. לפי החברה, כאשר עומדים לרשותו הכלים והגישה המתאימים, Astra יכול למצוא חולשות אבטחה לא מוכרות ולפתח דרכים לנצל אותן במערכות רבות ומוגנות היטב, ללא הנחיה אנושית צעד אחר צעד. 27
יכולת כזו עשויה להיות בעלת ערך רב בהגנה מורשית. אך היא גם מגדילה את ההשלכות של זרימת עבודה סוכנית שנפגעה: תוקף שמצליח להסיט סוכן באמצעות תוכן לא מהימן עשוי לנסות להשפיע על החיפושים שהוא מבצע, על הכלים שהוא מפעיל או על הפעולות שהוא מציע. הסיכון גדל כאשר לסוכן יש גישה למידע רגיש, למאגרי קוד, לסביבות ענן, לדפדפנים או ליישומים עסקיים.
יש להתייחס לעמידות בפני הזרקת פרומפט כשכבת הגנה אחת, ולא כאל גבול האבטחה עצמו. עבור תהליכי סוכנים בעלי השפעה גבוהה, ארגונים צריכים:
OpenAI תיארה בידוד מחמיר יותר, הגבלת גישה לרשת ולכלים, ניטור והרצה בארגז חול כאמצעי הגנה למערכות בעלות יכולות מתקדמות יותר. 34
הירידה המדווחת בטעויות עובדתיות והעמידות המשופרת מול jailbreaks ישירים הופכות את Astra ליורש חזק יותר של GPT‑5.6 Sol. 25
30 אולם אין בחומרים שסופקו בסיס להכרזה שהוא בטוח באופן קטגורי יותר מ‑Claude Opus 5 בכל תרחיש, והזרקת פרומפט עקיפה נותרת חולשה מהותית באקוסיסטם הסוכני.
4
עבור ארגונים, הלקח המעשי פשוט: יש לבחור במודל החזק ביותר הזמין, אך לתכנן את המערכת שסביבו כך שמסמך או דף אינטרנט זדוני לא יוכלו להפוך את יכולות המודל והכלים המחוברים אליו לערוץ בשליטת תוקף.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
לפי OpenAI, GPT‑6 Astra מפיק פחות טעויות עובדתיות ועמיד משמעותית יותר מ‑GPT‑5.6 Sol בפני jailbreaks והזרקות פרומפט, גם לאורך מסלולי תקיפה ארוכים.
לפי OpenAI, GPT‑6 Astra מפיק פחות טעויות עובדתיות ועמיד משמעותית יותר מ‑GPT‑5.6 Sol בפני jailbreaks והזרקות פרומפט, גם לאורך מסלולי תקיפה ארוכים. בזירת IPI של Gray Swan לא נמצא מודל חסין להזרקות פרומפט נסתרות: נבחנו 13 מודלי חזית, 41 תרחישי סוכנים ויותר מ‑272,000 ניסיונות תקיפה.
בחומרים שסופקו אין השוואה פומבית אחידה שמאפשרת לקבוע דירוג חד משמעי בין Astra ל‑Claude Opus 5 בעמידות ל jailbreaks, בהזרקות עקיפות או בדיוק עובדתי.