MentalHealthBench ใช้บทสนทนาสุขภาพจิตจำลอง 1,215 กรณี และเกณฑ์ที่พัฒนาโดยผู้เชี่ยวชาญด้านสุขภาพจิตที่มีใบอนุญาตมากกว่า 80 คน [1][3] การประเมินครอบคลุมทั้งเรื่องทั่วไปและเหตุฉุกเฉิน โดยดูว่าคำตอบคำนึงถึงบริบท เคารพการตัดสินใจของผู้ใช้ และรับมือกับความเสี่ยงได้เหมาะสมหรือไม่ [1][4] คะแนนบอกความสอดคล้องกับเกณฑ์ทดสอบ ไม...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
เวลามีคนเล่าเรื่องสุขภาพจิตให้ AI ฟัง คำตอบที่ดีไม่ได้มีสูตรเดียว บางครั้งควรถามข้อมูลเพิ่ม บางครั้งควรเสนอแนวทางที่ทำได้ และเมื่อมีความเสี่ยงสูงก็ต้องตอบให้เหมาะกับความเร่งด่วน MentalHealthBench เป็นเกณฑ์ทดสอบแบบเปิดที่ OpenAI สร้างขึ้นเพื่อประเมินว่า AI ตอบได้เป็นประโยชน์และปลอดภัย สำหรับสถานการณ์ในบทสนทนานั้น หรือไม่ แทนการดูเพียงว่าระบบหลีกเลี่ยงคำตอบต้องห้ามได้หรือเปล่า 1
3
ชุดทดสอบมีบทสนทนาจำลอง 1,215 กรณี ซึ่งออกแบบให้ครอบคลุมสถานการณ์ที่หลากหลาย บางกรณีมีข้อความก่อนหน้าให้ AI ต้องพิจารณาประกอบก่อนตอบข้อความสุดท้ายของผู้ใช้ อย่างไรก็ตาม สัดส่วนกรณีในชุดทดสอบ ไม่ได้บอกว่าแต่ละสถานการณ์เกิดขึ้นบ่อยแค่ไหนใน ChatGPT 1
ผู้เชี่ยวชาญด้านสุขภาพจิตที่มีใบอนุญาตมากกว่า 80 คนจาก 22 ประเทศร่วมพัฒนาเกณฑ์ประเมิน โดยอ่านบทสนทนาแล้วระบุว่าคำตอบต่อข้อความสุดท้ายควรทำหรือหลีกเลี่ยงอะไร แต่ละบทสนทนามีผู้เชี่ยวชาญตรวจทานอย่างน้อย 3 คน และ OpenAI ระบุว่าจะนำเกณฑ์ข้อหนึ่งเข้าชุดทดสอบก็ต่อเมื่อผู้ตรวจทานทุกคนเห็นพ้องกัน 1
4
ชุดที่เผยแพร่มีเกณฑ์ที่ผู้เชี่ยวชาญเขียน 5,262 ข้อ แต่ละข้อเจาะจงพฤติกรรมของคำตอบ โดยให้น้ำหนักบวกกับสิ่งที่เป็นประโยชน์และน้ำหนักลบกับสิ่งที่เป็นอันตราย จากนั้นระบบให้คะแนนอัตโนมัติจะตรวจคำตอบของ AI เทียบกับเกณฑ์ทีละข้อ คะแนนจึงสะท้อนความสอดคล้องกับเกณฑ์ ไม่ใช่ผลลัพธ์ทางคลินิกของผู้ที่มาขอความช่วยเหลือจริง 1
4
สถานการณ์มีตั้งแต่ความกังวลในชีวิตประจำวัน ภาวะทุกข์ใจรุนแรง ไปจนถึงเหตุฉุกเฉินด้านสุขภาพจิต และครอบคลุมบทสนทนาที่เกี่ยวข้องกับผู้ใหญ่ วัยรุ่น ผู้ดูแล และบุคลากรทางคลินิก ตลอดจนภาษาและภูมิภาคที่แตกต่างกัน เกณฑ์อาจพิจารณาว่า AI ถามหาบริบทที่จำเป็นหรือไม่ เคารพสิทธิในการตัดสินใจของผู้ใช้หรือไม่ ให้คำแนะนำที่นำไปใช้ได้เหมาะสมเพียงใด และตอบสนองต่อความเสี่ยงได้พอดีกับสถานการณ์หรือเปล่า 1
4
OpenAI รายงานว่าระบบ AI ที่นำมาทดสอบมีพัฒนาการดีขึ้น แต่ยังมีจุดที่ทำได้ยาก โดยเฉพาะการถามข้อมูลประกอบที่เหมาะสมและการประเมินว่าควรตอบอย่างเร่งด่วนเพียงใด ข้อมูลผลทดสอบที่ให้มาไม่เพียงพอจะจัดอันดับโมเดลแต่ละตัวอย่างน่าเชื่อถือ และคะแนนที่ดีขึ้นก็ไม่ใช่หลักประกันว่าทุกบทสนทนาจะปลอดภัย 1
OpenAI ยังพิจารณาความเห็นจากผู้ใช้ ChatGPT จริง ซึ่งเป็นอีกมุมมองหนึ่งที่ช่วยเสริมการประเมินของผู้เชี่ยวชาญ แต่ใช้แทนเกณฑ์ด้านคลินิกและความปลอดภัยไม่ได้ ข้อมูลที่มีไม่ได้ระบุชัดว่าผู้ใช้กับผู้เชี่ยวชาญให้ความสำคัญต่างกันในประเด็นใดโดยเฉพาะ จึงไม่ควรสรุปว่าทั้งสองฝ่ายเห็นต่างกันเรื่องใดเรื่องหนึ่ง 1
MentalHealthBench มีหน้าที่วัดคุณภาพคำตอบ ไม่ได้เป็นฟีเจอร์ช่วยเหลือผู้ใช้โดยตรง แยกจากงานประเมินนี้ OpenAI ระบุว่าได้ขยายการเข้าถึงสายด่วนช่วยเหลือในภาวะวิกฤต ส่งต่อบทสนทนาที่ละเอียดอ่อนบางส่วนไปยังโมเดลที่ปลอดภัยกว่า และเพิ่มข้อความเตือนให้พักเมื่อใช้งานต่อเนื่องนาน มาตรการเหล่านี้ไม่ได้ทำให้ ChatGPT ใช้แทนการบำบัด การดูแลจากผู้เชี่ยวชาญ หรือความช่วยเหลือจากคนและบริการในโลกจริงเมื่อเกิดเหตุฉุกเฉินได้ 11
15
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
MentalHealthBench ใช้บทสนทนาสุขภาพจิตจำลอง 1,215 กรณี และเกณฑ์ที่พัฒนาโดยผู้เชี่ยวชาญด้านสุขภาพจิตที่มีใบอนุญาตมากกว่า 80 คน [1][3]
MentalHealthBench ใช้บทสนทนาสุขภาพจิตจำลอง 1,215 กรณี และเกณฑ์ที่พัฒนาโดยผู้เชี่ยวชาญด้านสุขภาพจิตที่มีใบอนุญาตมากกว่า 80 คน [1][3] การประเมินครอบคลุมทั้งเรื่องทั่วไปและเหตุฉุกเฉิน โดยดูว่าคำตอบคำนึงถึงบริบท เคารพการตัดสินใจของผู้ใช้ และรับมือกับความเสี่ยงได้เหมาะสมหรือไม่ [1][4]
คะแนนบอกความสอดคล้องกับเกณฑ์ทดสอบ ไม่ได้ยืนยันผลการดูแลรักษาจริงหรือรับประกันว่า AI จะตอบได้ปลอดภัยทุกครั้ง [1][4]