MentalHealthBench는 가상의 정신건강 대화 1,215건에 대한 AI 답변을 면허를 갖춘 전문가 80여 명이 마련한 기준으로 평가한다. 일상적인 고민부터 긴급 상황까지 다루지만, 높은 점수가 모든 실제 대화에서의 안전이나 치료 효과를 보장하지는 않는다.
게시자GPT-6 Sol로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
정신건강에 관한 질문에 AI가 답할 때는 해로운 말을 피하는 것만으로 충분하지 않다. 앞선 대화의 맥락을 살피고, 필요한 질문을 던지며, 위험 수준에 맞게 대응해야 한다. OpenAI가 공개한 MentalHealthBench는 바로 이런 상황별 판단을 평가하기 위한 기준이다. 기존 평가가 긴급 상황과 포괄적인 안전 규칙에 주로 집중해 온 공백을 메우려는 취지다. 1
3
평가에는 가상의 정신건강 대화 1,215건이 쓰인다. 일부 대화에는 이전 발언이 포함돼 있어, 모델이 마지막 메시지에 답할 때 관련 맥락을 반영하는지도 살필 수 있다. 이 대화들은 평가용 사례이지, 각 상황이 실제 ChatGPT에서 얼마나 자주 발생하는지를 보여주는 통계는 아니다. 1
22개국의 면허를 갖춘 정신건강 전문가 80여 명이 기준 개발에 참여했다. 전문가들은 각 대화를 읽고 마지막 사용자 메시지에 대한 답변을 평가할 기준을 작성했다. 대화마다 최소 3명이 검토했으며, OpenAI에 따르면 검토자 전원이 동의한 기준만 최종 평가에 포함됐다. 1
4
공개된 평가에는 전문가가 작성한 기준 5,262개가 담겼다. 각 기준은 답변의 특정 행동을 살핀다. 도움이 되는 행동에는 양의 가중치를, 해로운 행동에는 음의 가중치를 부여하고, 자동 채점기가 모델의 답변을 기준별로 평가한다. 따라서 점수는 전문가가 정한 기준에 답변이 얼마나 부합하는지를 나타낼 뿐, 이용자의 실제 치료 결과를 직접 측정하지는 않는다. 1
4
평가 사례는 일상적인 고민부터 심각한 고통과 긴급 상황까지 폭넓게 다룬다. 성인과 청소년뿐 아니라 돌봄 제공자와 임상 전문가가 등장하는 상황도 있으며, 언어와 지역에도 변화를 줬다. 평가 기준은 AI가 필요한 맥락을 묻는지, 당사자의 자율성을 존중하는지, 적절한 실질적 안내를 제공하는지, 위험에 비례해 대응하는지 등을 살핀다. 1
4
OpenAI는 시험한 AI 시스템들이 개선됐다고 보고하면서도, 적절한 맥락을 묻고 긴급도를 판단하는 일에는 여전히 어려움이 있다고 밝혔다. 제공된 결과만으로 모델별 확실한 순위를 매길 수는 없으며, 평가 점수가 높다고 모든 실제 대화에서 안전하다고 보장할 수도 없다. 1
OpenAI는 실제 ChatGPT 이용자의 의견도 고려했다. 이용자 관점은 임상 전문가의 판단을 보완할 수 있지만 임상·안전 기준을 대신하지는 않는다. 제공된 자료만으로는 이용자와 전문가가 구체적으로 어떤 우선순위를 달리했는지 확인할 수 없다. 1
MentalHealthBench는 답변을 평가하는 도구이지, 위기 상황에서 직접 도움을 제공하는 기능은 아니다. OpenAI는 별도로 위기 상담전화에 대한 접근을 확대하고, 일부 민감한 대화를 더 안전한 모델로 전환하며, 긴 대화 중에는 휴식을 권하는 알림을 추가했다고 설명했다. 이런 조치가 있더라도 ChatGPT는 치료나 전문적인 돌봄을 대신할 수 없으며, 긴급 상황에서 필요한 현실의 도움을 대체하지도 못한다. 11
15
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
MentalHealthBench는 가상의 정신건강 대화 1,215건에 대한 AI 답변을 면허를 갖춘 전문가 80여 명이 마련한 기준으로 평가한다.
MentalHealthBench는 가상의 정신건강 대화 1,215건에 대한 AI 답변을 면허를 갖춘 전문가 80여 명이 마련한 기준으로 평가한다. 일상적인 고민부터 긴급 상황까지 다루지만, 높은 점수가 모든 실제 대화에서의 안전이나 치료 효과를 보장하지는 않는다. [1]