DeepSeek V4 Pro 0813 זיהה 28 מתוך 32 חולשות בשלוש הרצות מצטברות, בעלות של כ 295 דולר — תוצאת ה recall הגבוהה ביותר במבחן, אך לא הבטחה להרצה יחידה. המסקנה המרכזית אינה שיש מודל מנצח אחד: מערכת יעילה משלבת סוכנים זולים לגילוי רחב, מודלים מדויקים לאימות ולמיון, מעקב אחר חקירות ובקרה אנושית.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
מבחן שערכה Aikido באוגוסט 2026 בדק 10 מודלי AI מול 32 חולשות אבטחה שנחשפו לאחרונה, כאשר כל מודל הורץ שלוש פעמים. DeepSeek V4 Pro 0813 הוביל ב-recall המצטבר, עם 28 מתוך 32 ממצאים ובעלות של כ-295 דולר. אבל התובנה החשובה יותר אינה איזה מודל זכה, אלא כיצד מתכננים מערכת שמחברת חקירה חוזרת, אימות והתמחות בין מודלים. 3
כאשר איחדו את תוצאות שלוש ההרצות, DeepSeek V4 Pro 0813 הגיע ל-28 מתוך 32 חולשות, כלומר 87.5% recall מצטבר. זהו הישג שמציב אותו במקום הראשון בשלב הגילוי, אך חשוב להבין מה המספר הזה אומר: מדובר בתוצאת pass@3, ולא בכך שהמודל מוצא 28 חולשות בכל הפעלה יחידה.
כל הרצה עשויה לבדוק קבצים, מסלולים והשערות שונות לגבי דרך הניצול. איחוד ההרצות מגדיל את הכיסוי משום שהמערכת נהנית ממגוון מסלולי חיפוש. במילים פשוטות, התוצאה מעודדת להפעיל כמה חקירות עצמאיות — ולא להתייחס לתשובה הראשונה של המודל כבדיקת אבטחה מלאה. 3
שלוש הרצות של DeepSeek Pro מצאו יחד 28 מתוך 32 חולשות, בעלות של כ-295 דולר. היתרון המרכזי שלו היה רוחב: כאשר שילבו את החקירות, הוא חשף יותר חולשות מכל מודל אחר במבחן.
לכן הוא מתאים במיוחד לשלב הראשון בתהליך אבטחה. עם זאת, הממצאים שלו עדיין דורשים אימות המבוסס על ראיות, איחוד כפילויות ובחינת חומרה לפני שהם הופכים להתראות בסביבת ייצור.
שלוש הרצות של גרסת Flash מצאו 24 מתוך 32 חולשות, בעלות כוללת של כ-108 דולר. זהו יחס כיסוי-לעלות אטרקטיבי, שהופך את המודל למועמד טוב לסריקות מקביליות זולות או להרצות חוזרות במסגרת תקציב מוגבל.
Flash אינו בהכרח הבודק הסופי הטוב ביותר. הערך שלו טמון בהגדלת מספר ניסיונות החקירה, ולאחר מכן העברת הממצאים המשולבים לשלב אימות בררני ומדויק יותר. 3
Grok 4.6 בלט ביכולת החזרה על התוצאות: 21 חולשות הופיעו בכל שלוש ההרצות שלו. עקביות כזו חשובה לצוותים שזקוקים להתנהגות צפויה, לדוחות יציבים ולפחות הפתעות בין סריקה לסריקה.
החוזקה שלו שונה מזו של DeepSeek Pro. מודל עקבי במיוחד עשוי להתאים יותר לניטור תקופתי או לתהליכים סטנדרטיים, גם אם מודל חוקר יותר משיג recall מצטבר גבוה יותר.
Claude Opus 5 הגיע ל-26 מתוך 32 ב-recall המצטבר, ואילו GPT-5.6 Sol הגיע ל-25 מתוך 32. שניהם נותרו אפשרויות חזקות, אך התוצאות מערערות את ההנחה שהמודל הסגור והיקר ביותר חייב לספק את כיסוי החולשות הטוב ביותר.
לכן, הסיבה לבחור באחד מהם אינה צריכה להיות רק המותג או המוניטין שלו במבחנים כלליים. צוותים צריכים לבדוק אם יכולות ההיגיון, הדיווח או הבדיקה של המודל מוסיפות ערך לצד שאר רכיבי המערכת. 3
התוצאה הבולטת של Kimi K3 הייתה 92.3% precision מצטבר. Precision מודד איזה חלק מהממצאים שדווחו התקבלו כממצאים תקפים — לא כמה חולשות התגלו בסך הכול.
ההבדל הזה מציב את Kimi בתפקיד שונה מזה של מודל חיפוש רחב. סוכן בעל recall גבוה יכול לחפש באופן נרחב ולהשלים עם יותר רעש; מודל בעל precision גבוה יכול לסייע באימות ממצאים, בהכנת דוחות ובהפחתת מספר ההתראות שמגיעות למהנדסים.
Aikido הבחינה ש-Qwen3.8-Max חזר לעיתים לאותו CVE או לאותו מסלול חשיבה. חזרה כזו אינה יעילה כאשר היא צורכת תורות חקירה בלי להרחיב את הכיסוי, אך היא עשויה לעזור אם בדיקה שנייה חושפת תנאי שהוחמץ, מסלול ביצוע נוסף או פרט שחסר באימות.
הפתרון המעשי נמצא ברמת ה-harness — שכבת התזמור שמנהלת את עבודת הסוכן. על הסוכן לדעת מה כבר נבדק, להגביל ענפים שחוזרים על עצמם ולהעביר מקרים לא פתורים לחקירה חדשה במקום להפעיל אוטומטית את אותו מסלול.
GLM-5.3 השתפר מ-24 מתוך 32 ל-25 מתוך 32 בהשוואה המעודכנת, תוך שמירה על פרופיל עלות נמוך יותר מזה של חלופות סגורות בחזית השוק שנדונו במבחן.
הדבר מציב אותו כמועמד סביר לעבודה בהיקף גדול או כרכיב ב-ensemble — מערכת שמפעילה כמה מודלים ומשלבת את התוצאות. היתרון שלו גדל כאשר הארגון משתמש בעלות הנמוכה ובגמישות הפריסה כדי להריץ יותר חקירות, במקום להסתמך על ניסיון יחיד. 3
מערכת לגילוי חולשות אינה צריכה לצמצם את כל הביצועים למספר אחד בטבלת דירוג:
המדדים האלה מייצגים צרכים תפעוליים שונים. שלב הגילוי זקוק ל-recall גבוה ולהתנהגות חקירתית מגוונת. התראות בסביבת ייצור דורשות precision גבוה, ראיות שניתן לשחזר, איחוד כפילויות ודירוג סיכונים שימושי.
לכן, מודל שמצטיין באיתור אפשרויות רבות עשוי להיות בחירה גרועה לשליחת התראות לא בדוקות ישירות למפתחים. לעומתו, מודל שמפיק פחות ממצאים אך מדויקים יותר עשוי להתאים דווקא לשלב המיון והאימות.
השיעור המערכתי החשוב ביותר מהמבחן הוא שביצועי המודלים היו אקראיים במידה ניכרת. הרצה יחידה בוחנת מסלול חקירה אחד בלבד; כמה הרצות עצמאיות מגדילות את הסיכוי שהמערכת תבדוק השערות שונות.
זו הסיבה לכך ששלוש הרצות זולות יחסית של DeepSeek הצליחו להתחרות בכיסוי המצטבר של הרצה יחידה ממודלים יקרים יותר — ואף לעבור אותו. יחידת המדידה הרלוונטית אינה רק הקריאה ל-API. זוהי החקירה המלאה: המודל, הכלים, ההנחיה, מספר התורות, הזיכרון, ההרצות החוזרות ותהליך האימות. 3
מערכת המבוססת על תוצאות כאלה צריכה להפריד בין גילוי לבין שיפוט:
גישה כזו — ניתוב משימות בין מודלים — יציבה יותר מהתייחסות למודלים פתוחים או סגורים כאל תחליפים זהים שאפשר להחליף ביניהם בלחיצת כפתור.
התוצאות של Aikido מעניינות ושימושיות, אך הן אינן דירוג אוניברסלי של מודלי אבטחת AI. המבחן כלל 32 חולשות שנחשפו לאחרונה, שלוש попытות לכל מודל ו-harness מסוים. הביצועים עשויים להשתנות בהתאם לשפת התכנות, למבנה המאגר, לגישה לכלים, למודל האיום, לתקציב החקירה ולסובלנות הארגון להתראות שווא. 3
המסקנה הזהירה והשימושית יותר היא שבסביבה שנבדקה, מודלים בעלי משקלים פתוחים — במיוחד DeepSeek V4 Pro — יכולים להשתוות למודלים סגורים בחזית השוק ואף לעבור אותם כאשר משלבים הרצות חוזרות ותזמור נכון.
מוצר האבטחה המנצח אינו בהכרח המודל שמציג את המספר המרשים ביותר בכותרת. זהו המערכת שמחברת גילוי רחב, אימות אמין וראיות שהמהנדסים יכולים לפעול לפיהן.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 זיהה 28 מתוך 32 חולשות בשלוש הרצות מצטברות, בעלות של כ 295 דולר — תוצאת ה recall הגבוהה ביותר במבחן, אך לא הבטחה להרצה יחידה.
DeepSeek V4 Pro 0813 זיהה 28 מתוך 32 חולשות בשלוש הרצות מצטברות, בעלות של כ 295 דולר — תוצאת ה recall הגבוהה ביותר במבחן, אך לא הבטחה להרצה יחידה. המסקנה המרכזית אינה שיש מודל מנצח אחד: מערכת יעילה משלבת סוכנים זולים לגילוי רחב, מודלים מדויקים לאימות ולמיון, מעקב אחר חקירות ובקרה אנושית.