MentalHealthBench vurderer KI svar i 1 215 konstruerte samtaler om psykisk helse, med kriterier utviklet av over 80 autoriserte fagpersoner. Testen dekker både hverdagslige bekymringer og akutte situasjoner.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Et svar om psykisk helse kan være velment uten å treffe behovet til personen som spør. MentalHealthBench tester derfor om et KI-svar er nyttig og trygt i akkurat den samtalen det gjelder. OpenAI har publisert testen åpent for å fylle et hull i tidligere evalueringer, som i stor grad har lagt vekt på kriser og generelle sikkerhetsregler. 1
3
Testen består av 1 215 konstruerte samtaler. Noen inneholder tidligere meldinger, slik at det også kan vurderes om KI-modellen tar relevant bakgrunn med i svaret på den siste meldingen. Samtalene er testtilfeller – de sier ikke hvor ofte ulike situasjoner oppstår i ChatGPT. 1
Over 80 autoriserte fagpersoner innen psykisk helse fra 22 land bidro til å utvikle testen. Minst tre eksperter gjennomgikk hver samtale og utformet kriterier for hva et svar burde gjøre eller unngå. Ifølge OpenAI ble et kriterium bare tatt med dersom alle som vurderte samtalen, var enige om det. 1
4
Den publiserte testen inneholder 5 262 ekspertformulerte kriterier. Nyttige handlinger gir positive poeng, mens skadelige handlinger gir trekk. En automatisk vurdering sjekker deretter modellens svar mot kriteriene enkeltvis. Resultatet viser dermed hvor godt svaret samsvarer med ekspertenes kriterier – ikke hvordan det faktisk går med en person som søker hjelp. 1
4
Samtalene spenner fra vanlige bekymringer til alvorlig belastning og akutte kriser. De omfatter blant annet voksne, ungdom, omsorgspersoner og behandlere, med variasjon i språk og region. Vurderingen kan gjelde om modellen ber om nødvendig bakgrunnsinformasjon, respekterer personens selvbestemmelse, gir passende praktiske råd og tilpasser alvoret i svaret til risikoen. 1
4
OpenAI melder om forbedring blant systemene som er testet, men peker fortsatt på vansker med å innhente relevant kontekst og vurdere hvor raskt det haster å få hjelp. Materialet gir ikke grunnlag for en pålitelig rangering av enkeltmodeller her. Bedre testresultater betyr heller ikke at hvert svar i en virkelig samtale vil være trygt. 1
OpenAI har også sett på tilbakemeldinger fra ChatGPT-brukere. De kan utfylle fagfolkenes vurderinger, men kan ikke erstatte kliniske og sikkerhetsfaglige kriterier. Kildematerialet viser ikke hvilke konkrete prioriteringer brukere og fagpersoner eventuelt vurderte ulikt. 1
MentalHealthBench måler svar; den er ikke i seg selv en funksjon for krisehjelp. OpenAI sier at selskapet separat har gjort krisetelefoner lettere tilgjengelige, sendt enkelte sensitive samtaler videre til tryggere modeller og lagt inn påminnelser om pauser i lange økter. Slike tiltak endrer ikke hovedbegrensningen: ChatGPT er ingen erstatning for terapi, helsehjelp eller hjelp fra mennesker ved en akutt krise. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench vurderer KI svar i 1 215 konstruerte samtaler om psykisk helse, med kriterier utviklet av over 80 autoriserte fagpersoner.
MentalHealthBench vurderer KI svar i 1 215 konstruerte samtaler om psykisk helse, med kriterier utviklet av over 80 autoriserte fagpersoner. Testen dekker både hverdagslige bekymringer og akutte situasjoner. En god poengsum er ikke en garanti for trygge svar i virkelige samtaler.