يقيّم MentalHealthBench ردود الذكاء الاصطناعي على ١٬٢١٥ محادثة اصطناعية في الصحة النفسية، وفق معايير شارك في إعدادها أكثر من ٨٠ مختصًا مرخّصًا. يشمل الاختبار مواقف يومية وأزمات طارئة، لكنه يقيس مدى توافق الردود مع معايير التقييم، لا أثرها السريري الفعلي على الأشخاص.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
قد يكون الرد مناسبًا في محادثة عن ضغوط الحياة اليومية، وغير مناسب في محادثة تشير إلى خطر عاجل. من هذه الفكرة ينطلق MentalHealthBench، وهو اختبار مفتوح أطلقته OpenAI لتقييم ما إذا كان رد الذكاء الاصطناعي مفيدًا وآمنًا بحسب سياق المحادثة نفسها. ويعالج فجوة في اختبارات سابقة ركّزت على الطوارئ وقواعد السلامة العامة أكثر من تركيزها على تنوّع المواقف التي يطلب فيها الناس دعمًا نفسيًا. 1
3
يضم الاختبار ١٬٢١٥ محادثة اصطناعية تمثّل مواقف متنوعة. وتحتوي بعض المحادثات على رسائل سابقة، حتى يُختبر ما إذا كان النموذج يراعي المعلومات المهمة فيها عند الرد على رسالة المستخدم الأخيرة. وهذه الحالات أُعدّت للاختبار؛ ولا تعكس نسبة تكرار كل موقف بين محادثات مستخدمي ChatGPT. 1
شارك في تطوير الاختبار أكثر من ٨٠ مختصًا مرخّصًا في الصحة النفسية من ٢٢ بلدًا. وراجع ثلاثة مختصين على الأقل كل محادثة، ووضعوا معايير لتقييم الرد على رسالتها الأخيرة. وتقول OpenAI إن المعيار لا يدخل النسخة النهائية إلا بموافقة جميع المراجعين المعنيين. 1
4
تضم النسخة المنشورة ٥٬٢٦٢ معيارًا كتبها المختصون. يركّز كل معيار على سلوك محدد في الرد: تُمنح أوزان إيجابية لما يُعد مفيدًا، وأوزان سلبية لما يُعد ضارًا. ثم يفحص مُقيِّم آلي رد النموذج في ضوء كل معيار على حدة. لذلك فالنتيجة تبيّن مدى توافق الرد مع معايير المختصين، ولا تقيس مباشرةً ما حدث لصحة شخص تلقّى دعمًا نفسيًا. 1
4
تمتد الحالات من مشكلات يومية غير طارئة إلى ضيق نفسي شديد وحالات تستدعي استجابة عاجلة. وتشمل بالغين ومراهقين ومقدّمي رعاية ومختصين سريريين، مع تنوّع في اللغات والمناطق. وقد تبحث المعايير، بحسب الحالة، ما إذا كان الرد يستوضح معلومات ضرورية، ويحترم قدرة الشخص على اتخاذ قراره، ويقدّم خطوات عملية مناسبة، ويتعامل مع درجة الخطر بما يتناسب معها. 1
4
تفيد OpenAI بأن أداء الأنظمة التي اختبرتها تحسّن، لكنها تشير أيضًا إلى صعوبات مستمرة في طلب السياق المناسب وتقدير مدى إلحاح الموقف. ولا تكفي النتائج المعروضة هنا لترتيب النماذج ترتيبًا موثوقًا واحدًا تلو الآخر؛ كما أن تحسّن النتيجة في الاختبار ليس ضمانًا لسلامة كل رد في الاستخدام الفعلي. 1
ونظرت OpenAI كذلك في آراء مستخدمين فعليين لـChatGPT. ويمكن لهذه الآراء أن تُكمل أحكام المختصين، لكنها لا تحل محل المعايير السريرية ومعايير السلامة. ولا تحدد المصادر المتاحة هنا الأولويات بعينها التي اختلف بشأنها المستخدمون والمختصون، لذا لا يصح افتراض وجود خلاف محدد بين الطرفين. 1
لا؛ MentalHealthBench أداة لتقييم الردود، وليس خدمة للتدخل في الأزمات. وبصورة منفصلة، تقول OpenAI إنها وسّعت إتاحة خطوط المساعدة وقت الأزمات، ووجّهت بعض المحادثات الحساسة إلى نماذج أكثر أمانًا، وأضافت تذكيرات بأخذ استراحة خلال الجلسات الطويلة. وهذه الإجراءات لا تجعل ChatGPT بديلًا عن العلاج أو الرعاية المتخصصة أو طلب المساعدة من أشخاص وجهات مختصة في حالات الطوارئ. 11
15
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يقيّم MentalHealthBench ردود الذكاء الاصطناعي على ١٬٢١٥ محادثة اصطناعية في الصحة النفسية، وفق معايير شارك في إعدادها أكثر من ٨٠ مختصًا مرخّصًا.
يقيّم MentalHealthBench ردود الذكاء الاصطناعي على ١٬٢١٥ محادثة اصطناعية في الصحة النفسية، وفق معايير شارك في إعدادها أكثر من ٨٠ مختصًا مرخّصًا. يشمل الاختبار مواقف يومية وأزمات طارئة، لكنه يقيس مدى توافق الردود مع معايير التقييم، لا أثرها السريري الفعلي على الأشخاص.