इस खुले बेंचमार्क में 1,215 काल्पनिक बातचीत हैं, जिनके लिए 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों ने मूल्यांकन मानदंड बनाए। जाँच रोज़मर्रा की चिंताओं से लेकर आपात स्थितियों तक फैली है; बेंचमार्क में अच्छा स्कोर हर वास्तविक बातचीत में सुरक्षित जवाब की गारंटी नहीं है।
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
मानसिक स्वास्थ्य पर AI का जवाब केवल इस आधार पर नहीं परखा जा सकता कि उसने कोई ख़तरनाक बात कहने से परहेज़ किया या नहीं। सवाल यह भी है कि क्या उसने उस व्यक्ति की स्थिति समझी और उसके मुताबिक मददगार जवाब दिया? OpenAI का खुला बेंचमार्क MentalHealthBench इसी बात को जाँचने के लिए बनाया गया है। इसमें 1,215 काल्पनिक बातचीत हैं, और हर बातचीत के लिए विशेषज्ञों ने अलग मूल्यांकन मानदंड लिखे हैं। OpenAI के अनुसार, पहले के कई परीक्षण आपात स्थितियों और व्यापक सुरक्षा नियमों पर केंद्रित थे; यह बेंचमार्क मानसिक स्वास्थ्य से जुड़ी बातचीत की अधिक व्यापक श्रेणी को परखने की कोशिश करता है। 1
3
बातचीत काल्पनिक हैं, लेकिन उन्हें अलग-अलग मानसिक स्वास्थ्य स्थितियों को सामने रखने के लिए तैयार किया गया है। कुछ में पहले के संदेश भी शामिल हैं, ताकि यह जाँचा जा सके कि मॉडल आख़िरी संदेश का जवाब देते समय प्रासंगिक संदर्भ ध्यान में रखता है या नहीं। इन परीक्षण स्थितियों का अनुपात यह नहीं बताता कि ChatGPT पर वे स्थितियाँ वास्तव में कितनी बार आती हैं। 1
22 देशों के 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों ने बेंचमार्क बनाने में योगदान दिया। उन्होंने बातचीत पढ़कर उसके अंतिम संदेश के जवाब को परखने के मानदंड लिखे। हर बातचीत की समीक्षा कम-से-कम तीन विशेषज्ञों ने की; OpenAI के मुताबिक, अंतिम बेंचमार्क में कोई मानदंड तभी शामिल हुआ जब सभी समीक्षक उससे सहमत थे। 1
4
जारी किए गए सेट में विशेषज्ञों के लिखे 5,262 मानदंड हैं। हर मानदंड जवाब के किसी ख़ास पहलू को परखता है: मददगार व्यवहार के लिए सकारात्मक अंक और नुकसानदेह व्यवहार के लिए नकारात्मक अंक रखे गए हैं। फिर एक स्वचालित मूल्यांकन प्रणाली मॉडल के जवाब को इन मानदंडों पर जाँचती है। इसलिए स्कोर बताता है कि जवाब तय मानदंडों पर कितना खरा उतरा—यह किसी व्यक्ति के उपचार या स्वास्थ्य पर पड़े असर का सीधा माप नहीं है। 1
4
परीक्षण में रोज़मर्रा की चिंताओं से लेकर गंभीर परेशानी और तत्काल मदद की ज़रूरत वाली स्थितियाँ शामिल हैं। बातचीत में वयस्क, किशोर, देखभाल करने वाले और चिकित्सक आते हैं; भाषाओं और क्षेत्रों में भी विविधता रखी गई है। मानदंड यह देख सकते हैं कि मॉडल ज़रूरी जानकारी पूछता है या नहीं, व्यक्ति के अपने फैसले लेने के अधिकार का सम्मान करता है या नहीं, व्यावहारिक सुझाव देता है या नहीं और जोखिम के अनुरूप गंभीरता से जवाब देता है या नहीं। 1
4
OpenAI ने जाँचे गए AI सिस्टमों के प्रदर्शन में सुधार की जानकारी दी है। साथ ही, उचित संदर्भ पूछना और स्थिति की गंभीरता के हिसाब से जवाब देना अब भी चुनौती बताया है। उपलब्ध नतीजों के आधार पर यहाँ मॉडलों की भरोसेमंद क्रमवार रैंकिंग देना उचित नहीं होगा। बेंचमार्क में बेहतर प्रदर्शन का मतलब भी यह नहीं कि हर वास्तविक बातचीत में जवाब सुरक्षित होगा। 1
OpenAI ने वास्तविक ChatGPT उपयोगकर्ताओं की प्रतिक्रिया पर भी विचार किया। उनका नज़रिया विशेषज्ञों के आकलन का पूरक हो सकता है, लेकिन चिकित्सकीय और सुरक्षा मानदंडों की जगह नहीं लेता। उपलब्ध सामग्री यह स्पष्ट नहीं करती कि उपयोगकर्ताओं और विशेषज्ञों ने किन विशिष्ट बातों को अलग-अलग प्राथमिकता दी। 1
MentalHealthBench जवाबों को परखने का साधन है, संकट के समय सहायता देने वाली सुविधा नहीं। अलग से, OpenAI का कहना है कि उसने संकट सहायता हेल्पलाइन तक पहुँच बढ़ाई है, कुछ संवेदनशील बातचीत को अधिक सुरक्षित मॉडलों की ओर मोड़ा है और लंबी बातचीत के दौरान विराम लेने के संकेत जोड़े हैं। ये कदम सुरक्षा कार्य का हिस्सा हैं, लेकिन ChatGPT को थेरेपी, पेशेवर देखभाल या आपात स्थिति में वास्तविक दुनिया की मदद का विकल्प नहीं बनाते। 11
15
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
इस खुले बेंचमार्क में 1,215 काल्पनिक बातचीत हैं, जिनके लिए 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों ने मूल्यांकन मानदंड बनाए।
इस खुले बेंचमार्क में 1,215 काल्पनिक बातचीत हैं, जिनके लिए 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों ने मूल्यांकन मानदंड बनाए। जाँच रोज़मर्रा की चिंताओं से लेकर आपात स्थितियों तक फैली है; बेंचमार्क में अच्छा स्कोर हर वास्तविक बातचीत में सुरक्षित जवाब की गारंटी नहीं है।