MentalHealthBench obejmuje 1215 syntetycznych rozmów i 5262 kryteria oceny opracowane przez specjalistów zdrowia psychicznego. Test sprawdza reakcje AI zarówno na codzienne trudności, jak i sytuacje kryzysowe; nie mierzy skutków rozmowy dla rzeczywistej osoby.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Gdy ktoś pisze do AI o swoim samopoczuciu, samo unikanie niebezpiecznych porad może nie wystarczyć. Znaczenie ma też to, czy odpowiedź uwzględnia wcześniejszy kontekst, zadaje potrzebne pytania i adekwatnie reaguje na ryzyko. To właśnie próbuje oceniać MentalHealthBench — publicznie udostępniony test opracowany przez OpenAI. Powstał, ponieważ wcześniejsze oceny skupiały się głównie na nagłych kryzysach i ogólnych zasadach bezpieczeństwa, a słabiej sprawdzały szerszy zakres rozmów o zdrowiu psychicznym. 1
3
Zestaw zawiera 1215 syntetycznych rozmów. Część z nich obejmuje wcześniejsze wypowiedzi, dzięki czemu można sprawdzić, czy model bierze je pod uwagę, odpowiadając na ostatnią wiadomość. Są to przypadki testowe, a nie dane pokazujące, jak często poszczególne sytuacje występują w ChatGPT. 1
Nad kryteriami pracowało ponad 80 licencjonowanych specjalistów zdrowia psychicznego z 22 krajów. Każdą rozmowę oceniały co najmniej trzy osoby; według OpenAI do końcowego zestawu trafiały tylko kryteria zaakceptowane przez wszystkich recenzentów danej rozmowy. Łącznie powstały 5262 kryteria dotyczące konkretnych cech odpowiedzi. Działania pomocne otrzymują dodatnią wagę, a szkodliwe — ujemną. Następnie automatyczny system ocenia odpowiedź modelu osobno według każdego kryterium. 1
4
Scenariusze obejmują codzienne, mniej pilne trudności, poważny kryzys oraz sytuacje wymagające pilnej reakcji. Pojawiają się w nich dorośli, nastolatki, opiekunowie i osoby pracujące klinicznie, a rozmowy różnią się językiem i kontekstem regionalnym. Kryteria mogą dotyczyć m.in. dopytania o istotne okoliczności, poszanowania samodzielności rozmówcy, praktycznej pomocy i dostosowania reakcji do poziomu zagrożenia. 1
4
OpenAI informuje o poprawie wśród testowanych systemów, ale wskazuje też utrzymujące się trudności: modele nie zawsze pytają o potrzebny kontekst i nie zawsze właściwie oceniają pilność sytuacji. Dostępne tu wyniki nie uzasadniają wiarygodnego rankingu poszczególnych modeli. Lepszy wynik oznacza większą zgodność z kryteriami testu — nie gwarantuje bezpiecznej odpowiedzi w każdej rozmowie ani nie mierzy efektów klinicznych u użytkownika. 1
OpenAI uwzględniło również opinie rzeczywistych użytkowników ChatGPT. Mogą one uzupełniać ocenę specjalistów, ale nie zastępują kryteriów klinicznych i bezpieczeństwa. Dostępny materiał nie pozwala wskazać konkretnych kwestii, które obie grupy uznały za różnie ważne. 1
MentalHealthBench jest narzędziem oceny, nie formą pomocy kryzysowej. Osobno OpenAI opisuje ułatwianie dostępu do telefonów wsparcia kryzysowego, kierowanie części wrażliwych rozmów do bezpieczniejszych modeli oraz przypomnienia o przerwie podczas długich sesji. Nie zmienia to podstawowego ograniczenia: rozmowa z ChatGPT nie zastępuje terapii, profesjonalnej opieki ani pomocy w świecie rzeczywistym w nagłej sytuacji. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench obejmuje 1215 syntetycznych rozmów i 5262 kryteria oceny opracowane przez specjalistów zdrowia psychicznego.
MentalHealthBench obejmuje 1215 syntetycznych rozmów i 5262 kryteria oceny opracowane przez specjalistów zdrowia psychicznego. Test sprawdza reakcje AI zarówno na codzienne trudności, jak i sytuacje kryzysowe; nie mierzy skutków rozmowy dla rzeczywistej osoby.