MentalHealthBench đánh giá phản hồi của AI trong 1.215 cuộc trò chuyện giả lập, dựa trên tiêu chí do hơn 80 chuyên gia sức khỏe tâm thần có giấy phép hành nghề xây dựng. Bộ tình huống trải từ lo lắng thường ngày đến khủng hoảng khẩn cấp; điểm số cho biết mức độ đáp ứng tiêu chí, không chứng minh người dùng sẽ có kết...
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Một câu trả lời về sức khỏe tâm thần không chỉ cần tránh nội dung nguy hiểm. Nó còn phải phù hợp với người đang hỏi và tình huống họ đang gặp. Đó là điều OpenAI muốn kiểm tra bằng MentalHealthBench, một bộ đánh giá công khai gồm 1.215 cuộc trò chuyện giả lập. OpenAI cho biết bộ đánh giá này nhằm bổ sung cho những phép thử trước đây vốn tập trung nhiều vào tình huống khẩn cấp và các quy tắc an toàn chung. 1
3
Một số tình huống có cả những tin nhắn trước đó, để kiểm tra liệu AI có xét đến thông tin liên quan khi trả lời tin nhắn cuối cùng hay không. Các cuộc trò chuyện này là tình huống dùng để kiểm tra, không phải thống kê về tần suất chúng xuất hiện trên ChatGPT. 1
Hơn 80 chuyên gia sức khỏe tâm thần có giấy phép hành nghề từ 22 quốc gia đã tham gia xây dựng bộ đánh giá. Họ đọc từng cuộc trò chuyện và viết tiêu chí cho câu trả lời đối với tin nhắn cuối. Mỗi cuộc trò chuyện được ít nhất ba chuyên gia xem xét; theo OpenAI, một tiêu chí chỉ được đưa vào bộ đánh giá cuối cùng khi tất cả người đánh giá đều đồng ý. 1
4
Bộ dữ liệu được công bố có 5.262 tiêu chí. Mỗi tiêu chí nhắm đến một hành vi cụ thể trong câu trả lời: hành vi hữu ích được cộng điểm, hành vi có hại bị trừ điểm. Sau đó, một hệ thống chấm điểm tự động xét phản hồi của AI theo từng tiêu chí. Vì vậy, điểm số phản ánh mức độ đáp ứng các tiêu chí chuyên gia đặt ra, chứ không trực tiếp đo lường kết quả điều trị của một người. 1
4
MentalHealthBench bao quát từ những băn khoăn không cấp tính trong đời sống hằng ngày đến tình trạng đau khổ nghiêm trọng và trường hợp khẩn cấp. Các tình huống liên quan đến người lớn, thanh thiếu niên, người chăm sóc và nhân viên lâm sàng, đồng thời có sự đa dạng về ngôn ngữ và khu vực. Tiêu chí chấm có thể xem AI có hỏi thêm thông tin cần thiết, tôn trọng quyền tự quyết của người dùng, đưa ra gợi ý thiết thực phù hợp và phản ứng tương xứng với mức độ rủi ro hay không. 1
4
OpenAI ghi nhận sự cải thiện ở các hệ thống AI được thử nghiệm, nhưng cũng nêu những khó khăn còn tồn tại: hỏi thêm thông tin cho đúng lúc và đánh giá mức độ khẩn cấp cho phù hợp. Tài liệu được cung cấp không đủ để lập một bảng xếp hạng đáng tin cậy cho từng mô hình. Điểm cao hơn cũng không bảo đảm AI sẽ an toàn trong mọi cuộc trò chuyện. 1
OpenAI còn xem xét ý kiến của người dùng ChatGPT thực tế. Góc nhìn này có thể bổ sung cho đánh giá của chuyên gia, nhưng không thay thế các tiêu chí về lâm sàng và an toàn. Tài liệu hiện có không xác định rõ người dùng và chuyên gia khác nhau ở những ưu tiên cụ thể nào. 1
MentalHealthBench là công cụ đánh giá câu trả lời, không phải tính năng hỗ trợ khi khủng hoảng. Riêng với ChatGPT, OpenAI cho biết họ đã mở rộng khả năng tiếp cận đường dây hỗ trợ khủng hoảng, chuyển hướng một số cuộc trò chuyện nhạy cảm sang mô hình an toàn hơn và thêm lời nhắc nghỉ ngơi khi trò chuyện kéo dài. Những biện pháp đó không khiến ChatGPT trở thành giải pháp thay thế trị liệu, chăm sóc chuyên môn hoặc sự trợ giúp ngoài đời thực trong trường hợp khẩn cấp. 11
15
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
MentalHealthBench đánh giá phản hồi của AI trong 1.215 cuộc trò chuyện giả lập, dựa trên tiêu chí do hơn 80 chuyên gia sức khỏe tâm thần có giấy phép hành nghề xây dựng.
MentalHealthBench đánh giá phản hồi của AI trong 1.215 cuộc trò chuyện giả lập, dựa trên tiêu chí do hơn 80 chuyên gia sức khỏe tâm thần có giấy phép hành nghề xây dựng. Bộ tình huống trải từ lo lắng thường ngày đến khủng hoảng khẩn cấp; điểm số cho biết mức độ đáp ứng tiêu chí, không chứng minh người dùng sẽ có kết quả điều trị tốt.