MentalHealthBench оценивает ответы ИИ на 1215 синтетических диалогов по критериям, разработанным при участии более 80 специалистов в области психического здоровья. Тест охватывает и повседневные трудности, и экстренные ситуации, но высокий балл не гарантирует безопасного ответа в каждом реальном разговоре.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
В разговоре о психическом здоровье недостаточно просто не сказать ничего опасного. Иногда важно уточнить обстоятельства, иногда — предложить посильный следующий шаг, а при признаках серьёзного риска — отреагировать без промедления. MentalHealthBench — открытый тестовый набор OpenAI, созданный для оценки того, насколько ответ ИИ полезен и безопасен в конкретной ситуации. Компания объясняет его появление тем, что прежние проверки чаще сосредоточивались на кризисах и общих правилах безопасности, оставляя менее изученными другие виды поддержки. 1
3
В набор входят 1215 синтетических диалогов. Часть из них содержит предысторию: так можно проверить, учитывает ли модель сказанное ранее, когда отвечает на последнее сообщение пользователя. Это тестовые ситуации, а не статистика того, как часто подобные разговоры происходят в ChatGPT. 1
В разработке участвовали более 80 специалистов в области психического здоровья с профессиональной лицензией из 22 стран. Они изучали диалоги и составляли критерии оценки ответа на последнее сообщение. Каждый диалог проверяли не менее трёх специалистов; по словам OpenAI, критерий включали в итоговый набор, только если с ним соглашались все проверявшие. 1
4
Всего опубликовано 5262 критериев. Каждый относится к отдельному свойству ответа: за полезное действие предусмотрен положительный вес, за вредное — отрицательный. Затем автоматическая система проверяет ответ модели по каждому критерию. Полученный балл показывает, насколько ответ соответствует экспертным требованиям, а не то, помог ли он человеку в реальной жизни. 1
4
Диалоги охватывают повседневные трудности, серьёзный психологический дистресс и неотложные ситуации. Среди участников сценариев — взрослые, подростки, люди, заботящиеся о других, и специалисты; представлены разные языки и регионы. Критерии могут оценивать, запросила ли модель недостающие сведения, уважает ли самостоятельность собеседника, предлагает ли уместные практические шаги и соразмерна ли её реакция риску. 1
4
OpenAI сообщает об улучшении результатов у проверенных систем, но отмечает сохраняющиеся трудности: моделям не всегда удаётся вовремя запросить важный контекст и верно оценить срочность ситуации. Приведённые данные не дают оснований составить здесь надёжный рейтинг отдельных моделей. Даже хороший результат на тесте не означает, что каждый ответ в реальном разговоре будет безопасным. 1
Компания также учитывала отзывы реальных пользователей ChatGPT. Их взгляд дополняет оценку специалистов, но не заменяет клинические критерии и требования безопасности. Доступные материалы не позволяют достоверно назвать конкретные вопросы, по которым приоритеты пользователей и специалистов разошлись. 1
MentalHealthBench оценивает ответы, а не оказывает помощь во время кризиса. Отдельно OpenAI сообщает, что расширила доступ к кризисным линиям помощи, стала перенаправлять некоторые деликатные разговоры к моделям с более надёжными защитными механизмами и добавила напоминания о перерывах при долгом общении. Эти меры не делают ChatGPT заменой психотерапии, профессиональной помощи или обращения за помощью к людям и службам в экстренной ситуации. 11
15
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
MentalHealthBench оценивает ответы ИИ на 1215 синтетических диалогов по критериям, разработанным при участии более 80 специалистов в области психического здоровья.
MentalHealthBench оценивает ответы ИИ на 1215 синтетических диалогов по критериям, разработанным при участии более 80 специалистов в области психического здоровья. Тест охватывает и повседневные трудности, и экстренные ситуации, но высокий балл не гарантирует безопасного ответа в каждом реальном разговоре.