MentalHealthBench оцінює відповіді ШІ на 1 215 синтетичних діалогів за критеріями, розробленими понад 80 фахівцями з психічного здоров’я. Тест охоплює і повсякденні труднощі, і кризові ситуації; його оцінка не показує, яким буде результат для конкретної людини.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Коли людина пише ШІ про тривогу чи інші переживання, самої лише відсутності небезпечної поради замало. Відповідь має враховувати контекст, не перебільшувати й не применшувати ризик та залишати людині простір для власних рішень. MentalHealthBench — відкритий тестовий набір OpenAI, створений для перевірки саме такої доречності відповідей. Раніше оцінювання в цій сфері переважно зосереджувалося на надзвичайних ситуаціях і загальних правилах безпеки, тож ширший спектр розмов залишався менш дослідженим. 1
3
Набір містить 1 215 синтетичних діалогів про психічне здоров’я. Деякі з них включають попередні повідомлення: так можна перевірити, чи модель враховує важливі подробиці, відповідаючи на останнє звернення. Це набір тестових ситуацій, а не статистика того, як часто вони трапляються в ChatGPT. 1
Над розробкою працювали понад 80 ліцензованих фахівців із психічного здоров’я з 22 країн. Вони читали діалоги й формулювали критерії для відповіді на останнє повідомлення. Кожен діалог переглядали щонайменше троє експертів; за даними OpenAI, критерій потрапляв до фінального набору лише за згоди всіх рецензентів. 1
4
Загалом набір містить 5 262 критерії. Кожен описує окрему бажану або небажану рису відповіді: корисні дії отримують додатну вагу, шкідливі — від’ємну. Автоматизована система перевіряє відповідь моделі за кожним критерієм окремо. Отже, підсумковий бал показує відповідність експертним критеріям, а не те, чи покращився стан людини. 1
4
Сценарії простягаються від повсякденних переживань до тяжкого дистресу й невідкладних станів. Серед учасників діалогів — дорослі, підлітки, люди, які доглядають за іншими, та клінічні фахівці; представлені різні мови й регіони. Критерії можуть перевіряти, чи модель уточнює потрібний контекст, поважає самостійність людини, пропонує доречні практичні кроки та реагує відповідно до рівня ризику. 1
4
OpenAI повідомляє про покращення серед протестованих систем. Водночас моделям і далі буває складно поставити потрібні уточнювальні запитання та правильно визначити терміновість ситуації. Наведені дані не дають підстав складати тут надійний рейтинг окремих моделей; високий бал також не гарантує безпечної відповіді в кожній реальній розмові. 1
Компанія враховувала й відгуки реальних користувачів ChatGPT. Їхній погляд доповнює оцінки фахівців, але не замінює клінічні критерії та вимоги безпеки. Надані джерела не встановлюють, у яких саме пріоритетах думки користувачів і фахівців розійшлися. 1
MentalHealthBench оцінює відповіді, а не надає допомогу під час кризи. Окремо OpenAI повідомляла, що розширила доступ до кризових ліній підтримки, почала спрямовувати частину чутливих розмов до безпечніших моделей і додала нагадування про перерви під час тривалих сеансів. Ці заходи не роблять ChatGPT заміною психотерапії, професійної допомоги чи звернення по допомогу в реальному світі за невідкладної ситуації. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench оцінює відповіді ШІ на 1 215 синтетичних діалогів за критеріями, розробленими понад 80 фахівцями з психічного здоров’я.
MentalHealthBench оцінює відповіді ШІ на 1 215 синтетичних діалогів за критеріями, розробленими понад 80 фахівцями з психічного здоров’я. Тест охоплює і повсякденні труднощі, і кризові ситуації; його оцінка не показує, яким буде результат для конкретної людини.