MentalHealthBench בוחן תגובות AI ל־1,215 שיחות מדומות על בריאות הנפש, על בסיס קריטריונים שפותחו בעזרת יותר מ־80 אנשי מקצוע מורשים. המבחן כולל קשיים יומיומיים לצד מצבי חירום, ובודק התאמה להקשר — לא רק הימנעות מתשובה מזיקה.
פורסם על ידינערך באמצעות GPT-6 Solהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
כשאדם פונה ל־AI בנושא בריאות הנפש, לא תמיד מספיקה תשובה שנשמעת אמפתית. לעיתים צריך לברר פרטים נוספים, להציע צעד מעשי או לזהות שהמצב מחייב מענה דחוף. MentalHealthBench, מבחן פתוח שפרסמה OpenAI, נועד לבדוק אם תגובת המודל מועילה ובטוחה בהקשר של השיחה המסוימת — ולא רק אם היא עומדת בכלל בטיחות כללי. OpenAI פיתחה אותו משום שמבחנים קודמים התמקדו בעיקר במצבי חירום, והותירו פחות מקום לבחינת מגוון השיחות שבהן אנשים מבקשים תמיכה. 1
3
המבחן כולל 1,215 שיחות מדומות על בריאות הנפש. חלקן מציגות גם הודעות קודמות, כך שאפשר לבדוק אם המודל מתחשב במידע רלוונטי לפני שהוא עונה להודעה האחרונה. אלה מקרי בדיקה, לא נתון על שכיחות המצבים האלה ב־ChatGPT. 1
יותר מ־80 אנשי מקצוע מורשים בבריאות הנפש, מ־22 מדינות, השתתפו בפיתוח המבחן. מומחים קראו כל שיחה וניסחו קריטריונים לתגובה להודעה האחרונה בה. בכל שיחה השתתפו לפחות שלושה מומחים בבדיקה; לדברי OpenAI, קריטריון נכלל בגרסה הסופית רק אם כל הבודקים הסכימו עליו. 1
4
בסך הכול פורסמו 5,262 קריטריונים שנכתבו בידי המומחים. כל אחד מהם מתייחס להתנהגות מסוימת בתשובה: פעולות מועילות מזכות בניקוד חיובי, ופעולות מזיקות בניקוד שלילי. לאחר מכן מערכת בדיקה אוטומטית מעריכה את תגובת המודל מול הקריטריונים, אחד־אחד. לכן הציון מלמד על התאמה לאמות המידה של המבחן — לא על התוצאה הטיפולית של אדם. 1
4
השיחות נעות מדאגות יומיומיות שאינן מצב חירום, דרך מצוקה קשה ועד למצבי חירום דחופים. הן כוללות תרחישים הנוגעים למבוגרים, לבני נוער, למטפלים בבני משפחה ולאנשי מקצוע, וכן שפות ואזורים שונים. הקריטריונים יכולים לבחון אם התגובה מבקשת הקשר חסר, מכבדת את יכולתו של האדם לקבל החלטות, מציעה הנחיות מעשיות מתאימות ומגיבה לרמת הסיכון במידה הנכונה. 1
4
OpenAI מדווחת על שיפור במערכות ה־AI שבדקה, אך גם על קשיים מתמשכים בבקשת מידע רלוונטי ובהערכת מידת הדחיפות. התוצאות שסופקו אינן מבססות כאן דירוג מהימן של מודל מול מודל; גם ביצועים טובים במבחן אינם ערובה לתגובה בטוחה בכל שיחה. 1
OpenAI בחנה גם משוב ממשתמשי ChatGPT אמיתיים. נקודת המבט שלהם יכולה להשלים את שיקול הדעת של אנשי המקצוע, אך אינה מחליפה קריטריונים קליניים וקריטריוני בטיחות. החומר הזמין אינו מבהיר אילו סדרי עדיפויות מסוימים דורגו אחרת בידי המשתמשים והמומחים, ולכן אין בסיס להציג פער נקודתי ביניהם. 1
MentalHealthBench מודד תשובות; הוא אינו כלי סיוע בזמן משבר. בנפרד ממנו, OpenAI אומרת שהרחיבה את הגישה לקווי סיוע במשבר, העבירה חלק מהשיחות הרגישות למודלים בטוחים יותר והוסיפה תזכורות להפסקה בשיחות ממושכות. הצעדים האלה מספקים הקשר לעבודת הבטיחות של החברה, אך אינם הופכים את ChatGPT לתחליף לטיפול, לעזרה מקצועית או לסיוע מאנשים ושירותים בעולם האמיתי בשעת חירום. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench בוחן תגובות AI ל־1,215 שיחות מדומות על בריאות הנפש, על בסיס קריטריונים שפותחו בעזרת יותר מ־80 אנשי מקצוע מורשים.
MentalHealthBench בוחן תגובות AI ל־1,215 שיחות מדומות על בריאות הנפש, על בסיס קריטריונים שפותחו בעזרת יותר מ־80 אנשי מקצוע מורשים. המבחן כולל קשיים יומיומיים לצד מצבי חירום, ובודק התאמה להקשר — לא רק הימנעות מתשובה מזיקה.
ציון גבוה מעיד על התאמה לקריטריונים של המבחן; הוא אינו מבטיח תוצאה בטוחה בכל שיחה אמיתית.