הגישה של OpenAI ל-Red Teaming אוטומטי מתועדת במאמר "Diverse and Effective Red Teaming with Auto-generated Rewards" (14 ביולי 2026) . המערכת מפרקת את בעיית ה-Red Teaming לשני שלבים:
שיטה זו משתמשת במשחק עצמי, שבו תוקף אוטומטי מבוסס LLM בודק את מודל המטרה לאיתור חולשות כמו הזרקות פקודות ופריצות אבטחה . OpenAI הצהירה שגישה זו מבוססת RL עוזרת לגלות ולתקן ניצולים באופן יזום לפני שהם מנוצלים בשטח . החברה תיארה הזרקות פקודה כ"אתגר אבטחתי גבולי" ומשתמשת באופן פעיל ב-Red Teaming אוטומטי כדי לפתח התקפות הזרקת פקודה חדשות .
לפני ש-GPT-5.6 הגיע לזמינות כללית, OpenAI הכפיפה את המודל לתקופת ההערכה המקיפה ביותר שלה עד כה . כרטיס המערכת GPT-5.6 Preview System Card קובע: "הקדשנו גם למעלה מ-700,000 שעות GPU A100e למציאת אוטומטית של פריצות אוניברסליות ופגיעויות אחרות" . בדיקות אוטומטיות אלה השלימו שבועות של Red Teaming אנושי והערכות מומחים חיצוניים .
החברה פרסה תקציב מחשוב עצום זה כדי לחפש פריצות מערכתיות כלליות, ולא רק כשלים בודדים צרים . ה-Red Teaming האוטומטי תוכנן לרוץ ברציפות גם לאחר הפריסה, עם יישום תיקונים ובדיקה חוזרת בכל פעם שמדווחים על פריצות חדשות .
תחת מסגרת המוכנות (Preparedness Framework) של OpenAI, כל שלושת גרסאות GPT-5.6 - Sol (הדגל), Terra (עלות נמוכה יותר) ו-Luna (המהירה ביותר) - מסווגות כ'גבוהות' ביכולת הן בסיכוני סייבר והן בסיכונים ביולוגיים/כימיים . זו הפעם הראשונה שאפילו הדגמים הקטנים והזולים יותר חצו את סף ה'גבוה' עבור קטגוריות אלה .
עם זאת, אף אחד מהמודלים לא הגיע לסף ה'קריטי'. בדיקות אבטחת סייבר פנימיות מצאו ש-GPT-5.6 Sol ו-Terra יכולים לזהות נקודות תורפה וחלקי ניצול, אך אינם מסוגלים לבצע באופן אוטונומי התקפות שלמות מקצה לקצה . אף אחד מהמודלים לא הגיע לסף ה'גבוה' לשיפור עצמי של AI .
GPT-5.6 מגיע עם מה ש-OpenAI מתארת כ'אמצעי ההגנה החזקים ביותר שלה עד כה' . ארכיטקטורת הבטיחות כוללת:
גישה שכבתית זו משקפת את המסקנה של OpenAI שאף אמצעי הגנה בודד אינו מספיק .
OpenAI בונה באופן פעיל את היכולת הפנימית שלה ל-Red Teaming אוטומטי. החברה מגייסת חוקר, Automated Red Teaming (שכר בסיס 295,000$ - 445,000$) שתפקידו "להוביל את מאמץ ה-Automated Red Teaming, תוך התמקדות בבניית מערכות ניתנות להרחבה לחשיפת מצבי כשל במודלים של AI ואמצעי הגנה" . החברה גם מגייסת מומחה ל-Red Teaming ביולוגי (158,000$ - 320,000$) כדי להוביל מאמצי Red Teaming לבטיחות ביולוגית ו-CBRN .
OpenAI אירחה אתגר Red-Teaming ב-Kaggle עם פרסים בסך 500,000$, שהתמקד במודלים בקוד פתוח שלה gpt-oss-120b ו-gpt-oss-20b . התחרות תמרצה משתתפים לגלות נקודות תורפה חדשות שלא זוהו בעבר . בעוד שלא ניתן היה לאמת באופן עצמאי את הנתון הספציפי של 500,000$ ממקורות רשמיים של OpenAI בניתוח זה, דיווחים של צד שלישי מ-TechPolicy.Press מאשרים את קיומה של התחרות . כרטיס המערכת של GPT-5.6 מזכיר את 'MLE-Bench Revised', המעריך מודלים בתחרויות Kaggle, אך אינו מתייחס ישירות לפרס של 500,000$.
הראיות הזמינות מאשרות ש-GPT-5.6 מגיע עם ערימת בטיחות רב-שכבתית ושמסגרת המוכנות של OpenAI סיווגה את המודלים שלה . סיקור מצד שלישי מציין מעורבות של ממשלת ארה"ב בהקשר של 'שומר סף', שבו הממשלה עשויה להשפיע על הגישה למודלים המסוגלים ביותר . עם זאת, אזכור ישיר של המכון לבטיחות AI של בריטניה (UK AI Safety Institute) או פעולות רגולטוריות ספציפיות של ארה"ב לא היה קיים במקורות העיקריים שנסרקו. התיעוד הרשמי של OpenAI מתייחס לסיווגי בטיחות אך אינו מפרט פיקוח רגולטורי חיצוני מעבר למסגרת המוכנות שלה .