ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) היא מסגרת קוד פתוח הממירה חוקי התנהגות באנגלית פשוטה לחבילות בדיקה אוטומטיות ומנוקדות, התופסות הפרות מדיניות וכשלי בטיחות. המערכת מייצרת תרחישים עוינים, מתעדת כל קריאת כלי, ומספקת דיאגנוזה מפורטת של עבר/נכשל, בעבודה עם LangChain, CrewAI, Aut...

Create a landscape editorial hero image for this Studio Global article: What is Microsoft's ASSERT framework, announced at Build 2026, and how does it convert natural-language AI behavior policies into structured. Article summary: Here is a concise answer based on the official Microsoft sources and trusted reporting.. Topic tags: general, general web. Reference image context from search candidates: Reference image 1: visual subject "# Build agents you can trust across any framework with open evals and a control standard. The gap is concrete: written policies do not translate into working runtime controls, eval" source context "Build agents you can trust across any framework with open evals ..." Reference image 2: visual subject "# Microsoft is making AI behavior testing easier for developers. Microsoft has released ASSERT, an open-source framework that turns plain-language AI behavior re
מיקרוסופט הכריזה על ASSERT (ראשי תיבות של Adaptive Spec-driven Scoring for Evaluation and Regression Testing) בכנס המפתחים Build 2026 ב-2 ביוני, ושחררה אותו כפרויקט קוד פתוח תחת מעטה ה-Responsible AI ב-GitHub . המסגרת החדשה נותנת מענה לכאב ראש הולך וגובר בפיתוח בינה מלאכותית אוטונומית (Agentic AI): איך אפשר לוודא שסוכן חכם יכבד את החוקים המסחריים ומגבלות הבטיחות הספציפיות למוצר שלכם, לפני שהוא פוגש משתמשים אמיתיים? בעוד שמדדי AI מסורתיים מודדים מועילות, רעילות או דיוק כללי, הם מחמיצים לעתים קרובות כשלים קריטיים בהתנהגות הספציפית לאפליקציה, כמו סוכן שמאשר החזרים כספיים ללא אישור, או משתף מידע חסוי עם גורם הלא נכון
. ASSERT סוגרת את הפער הזה על ידי הפיכת מפרטי התנהגות בשפה טבעית לקלט ראשון במעלה בתהליך ההערכה, ולא רק להקשר כללי.
ASSERT פועל בצינור עיבוד בן חמישה שלבים, שהופך כוונה כתובה של מפתח להערכה ניתנת לניקוד ולאבחון:
מה שמבדיל את ASSERT מכלי הערכה גנריים הוא ההתמקדות בגבולות התנהגותיים ייחודיים לאפליקציה. סוכן עשוי לקבל ציון מושלם במדדי מועילות ואמיתות, ועדיין להפר חוק מוצר כמו "לעולם אל תשתף כתובות אימייל של לקוחות עם שירותים חיצוניים". ASSERT נבנה בדיוק כדי לתפוס את הקטגוריה הזו של כשלים . מיקרוסופט מציבה את המסגרת כממוקדת בטיחות, ומציינת ששיטת ההערכה שלה עברה ולידציה ספציפית להערכת בטיחות, לא רק למדדי איכות
.
ASSERT מושק לצד Agent Control Specification (ACS), פרויקט קוד פתוח נוסף של מיקרוסופט המאפשר לצוותים להגדיר קבצי מדיניות ניידים (Portable Policy Files). קבצים אלה מפרטים מה סוכן רשאי ומה אסור לו לעשות, מתי נדרש אישור אנושי, ואילו ראיות יש לתעד . זרימת העבודה המשולבת המיועדת היא: מפתחים מריצים תחילה את ASSERT כדי לגלות פגמים, מיישמים בקרות זמן-אמת באמצעות ACS, ואז מריצים מחדש את ASSERT כדי למדוד את השיפור עם מדדי "לפני ואחרי"
. לולאה זו – הגדר, הערך, בקר, הערך מחדש – מעניקה לצוותי ההנדסה תהליך ניתן לחזרה להקשחת מערכות אוטונומיות לפני פריסה.
בפועל, מפתח יכול להגדיר חוק כמו: "סוכן מחקר המסמכים הזה לא ישלח אימיילים לאנשים מחוץ לחברה, יגביל מידע חסוי לבכירי הנהלה (C-level) בלבד, ויספק סיכומים תמציתיים עם הקשר קודם." ASSERT ייצר את מקרי הבדיקה העוינים המתאימים באופן אוטומטי, יריץ אותם, ויתריע על כל הפרת מדיניות עם דוח מנוקד ותיעוד מלא .
ASSERT הוא קוד פתוח ומתארח בכתובת github.com/responsibleai/ASSERT. בעת ההשקה, הוא זכה לתמיכת הקהילה מצד CrewAI, Arize AI, LiteLLM, Pipecat ו-Pydantic .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) היא מסגרת קוד פתוח הממירה חוקי התנהגות באנגלית פשוטה לחבילות בדיקה אוטומטיות ומנוקדות, התופסות הפרות מדיניות וכשלי בטיחות.
ASSERT (Adaptive Spec driven Scoring for Evaluation and Regression Testing) היא מסגרת קוד פתוח הממירה חוקי התנהגות באנגלית פשוטה לחבילות בדיקה אוטומטיות ומנוקדות, התופסות הפרות מדיניות וכשלי בטיחות. המערכת מייצרת תרחישים עוינים, מתעדת כל קריאת כלי, ומספקת דיאגנוזה מפורטת של עבר/נכשל, בעבודה עם LangChain, CrewAI, AutoGen, OpenAI ומסגרות מובילות אחרות.
בניגוד למדדים גנריים למידת מועילות או רעילות, ASSERT מכוון לגבולות התנהגותיים ספציפיים לאפליקציה – ובודק האם סוכן עומד בכללים המדויקים והמגבלות שהמפתחים הגדירו.