MentalHealthBench vurderer AI svar på 1.215 syntetiske samtaler ud fra kriterier udviklet med mere end 80 fagfolk med licens inden for mental sundhed. Testen spænder fra hverdagens bekymringer til akutte kriser.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Et svar om psykisk trivsel kan være høfligt og stadig ramme ved siden af. Det afgørende er, om det passer til den konkrete situation: Skal AI’en spørge ind, foreslå et praktisk næste skridt eller reagere på tegn på akut fare? Det er den type vurdering, OpenAI vil undersøge med den åbent tilgængelige test MentalHealthBench. Tidligere evalueringer har ifølge virksomheden især fokuseret på kriser og brede sikkerhedsregler, ikke på hele spændet af samtaler om mental sundhed. 1
3
Testen består af 1.215 syntetiske – altså konstruerede – samtaler. Nogle indeholder tidligere beskeder, så man kan undersøge, om modellen bruger relevant kontekst, når den svarer på brugerens sidste besked. Samtalerne er testeksempler, ikke en opgørelse over, hvor ofte de enkelte situationer opstår i ChatGPT. 1
Mere end 80 fagfolk med licens inden for mental sundhed fra 22 lande bidrog til udviklingen. De gennemgik samtalerne og formulerede kriterier for, hvad et svar på den sidste besked bør gøre eller undgå. Mindst tre eksperter gennemgik hver samtale, og ifølge OpenAI kom et kriterium kun med i den endelige test, hvis alle gennemgåerne var enige om det. 1
4
Det offentliggjorte materiale rummer 5.262 ekspertskrevne kriterier. Nyttige handlinger kan give positive point, mens skadelige handlinger kan trække ned. En automatisk bedømmer vurderer derefter modellens svar op imod kriterierne enkeltvis. Scoren viser dermed, hvor godt svaret matcher eksperternes vurderingskriterier – ikke om et menneske får det bedre. 1
4
Samtalerne går fra almindelige, ikke-akutte bekymringer til alvorlig mistrivsel og akutte kriser. De omfatter blandt andre voksne, teenagere, omsorgspersoner og behandlere samt variation på tværs af sprog og regioner. Kriterierne kan handle om at spørge efter nødvendig baggrund, respektere personens selvbestemmelse, give brugbare råd og afstemme svarets alvor med risikoen. 1
4
OpenAI melder om forbedringer blandt de testede AI-systemer, men peger fortsat på vanskeligheder med at indhente relevant kontekst og vurdere, hvor hurtigt der bør handles. De foreliggende resultater giver ikke grundlag for en sikker rangliste over modellerne her. En højere testscore garanterer heller ikke et sikkert svar i enhver virkelig samtale. 1
OpenAI har også inddraget tilbagemeldinger fra faktiske ChatGPT-brugere. Deres perspektiv kan supplere behandlernes vurderinger, men kan ikke erstatte kliniske og sikkerhedsmæssige kriterier. Det tilgængelige kildemateriale viser ikke, hvilke konkrete prioriteringer brugere og behandlere eventuelt vurderede forskelligt. 1
MentalHealthBench måler svar; testen hjælper ikke i sig selv nogen gennem en krise. OpenAI oplyser særskilt, at virksomheden har udvidet adgangen til krisetelefoner, ledt visse følsomme samtaler videre til mere sikre modeller og indført påmindelser om pauser i lange samtaler. Det er sikkerhedstiltag omkring ChatGPT – ikke en grund til at betragte tjenesten som en erstatning for terapi, professionel behandling eller hjælp fra mennesker ved en akut krise. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench vurderer AI svar på 1.215 syntetiske samtaler ud fra kriterier udviklet med mere end 80 fagfolk med licens inden for mental sundhed.
MentalHealthBench vurderer AI svar på 1.215 syntetiske samtaler ud fra kriterier udviklet med mere end 80 fagfolk med licens inden for mental sundhed. Testen spænder fra hverdagens bekymringer til akutte kriser. En god score er ikke en garanti for, at AI altid svarer sikkert.