MentalHealthBench gebruikt 1.215 gesimuleerde gesprekken en beoordelingscriteria van meer dan 80 bevoegde deskundigen op het gebied van mentale gezondheid. De test bestrijkt alledaagse zorgen én noodsituaties.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Een veilig antwoord is niet automatisch een goed antwoord. Bij een gesprek over mentale gezondheid kan het bijvoorbeeld uitmaken of een AI-systeem eerst om verduidelijking vraagt, bruikbaar advies geeft of de ernst van de situatie goed inschat. MentalHealthBench is OpenAI’s openbare test om zulke reacties per gesprek te beoordelen. OpenAI ontwikkelde de test omdat bestaande evaluaties vooral waren gericht op noodsituaties en algemene veiligheidsregels. 1
3
De test bevat 1.215 gesimuleerde gesprekken over mentale gezondheid. Sommige bevatten eerdere berichten, zodat kan worden beoordeeld of een model relevante context meeneemt in zijn antwoord op het laatste bericht. De verzameling is geen afspiegeling van hoe vaak deze situaties in ChatGPT voorkomen. 1
Meer dan 80 bevoegde deskundigen op het gebied van mentale gezondheid uit 22 landen hielpen de test ontwikkelen. Zij stelden voor elk gesprek criteria op waaraan een antwoord op het laatste bericht moet worden getoetst. Elk gesprek werd door minstens drie deskundigen beoordeeld; volgens OpenAI kwam een criterium alleen in de definitieve test terecht als alle beoordelaars ermee instemden. 1
4
De gepubliceerde test telt 5.262 criteria. Elk criterium gaat over een specifiek onderdeel van het antwoord: positief gewogen criteria belonen behulpzaam gedrag, negatief gewogen criteria bestraffen schadelijk gedrag. Een automatische beoordelaar toetst de antwoorden van AI-modellen criterium voor criterium. De score laat dus zien hoe goed een antwoord aansluit op deze beoordelingscriteria, niet of een persoon er in de praktijk beter van wordt. 1
4
De gesprekken lopen uiteen van alledaagse zorgen zonder acute dreiging tot ernstige ontregeling en noodsituaties. Ze betreffen onder meer volwassenen, tieners, mantelzorgers en zorgverleners, in verschillende talen en regio’s. De criteria kunnen toetsen of een antwoord de juiste context opvraagt, iemands eigen keuzes respecteert, passende praktische hulp biedt en in verhouding staat tot het risico. 1
4
OpenAI meldt verbeteringen bij de geteste AI-systemen, maar ziet ook blijvende problemen: modellen vragen niet altijd naar de benodigde context en schatten de urgentie niet altijd goed in. De beschikbare resultaten geven geen basis voor een betrouwbare ranglijst van afzonderlijke modellen. Een betere testscore is bovendien geen garantie voor veilig gedrag in ieder echt gesprek. 1
OpenAI bekeek ook feedback van echte ChatGPT-gebruikers. Die kan een aanvulling zijn op het oordeel van deskundigen, maar vervangt geen klinische of veiligheidscriteria. Uit het beschikbare bronmateriaal blijkt niet op welke specifieke punten de prioriteiten van gebruikers en deskundigen verschilden. 1
MentalHealthBench is een meetinstrument, geen hulpfunctie voor mensen in crisis. Los van de test zegt OpenAI de toegang tot crisishulplijnen te hebben uitgebreid, sommige gevoelige gesprekken naar veiligere modellen door te sturen en bij lange chats pauzeherinneringen te tonen. Dat maakt ChatGPT niet tot een vervanging voor therapie, professionele zorg of hulp van mensen in een noodsituatie. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench gebruikt 1.215 gesimuleerde gesprekken en beoordelingscriteria van meer dan 80 bevoegde deskundigen op het gebied van mentale gezondheid.
MentalHealthBench gebruikt 1.215 gesimuleerde gesprekken en beoordelingscriteria van meer dan 80 bevoegde deskundigen op het gebied van mentale gezondheid. De test bestrijkt alledaagse zorgen én noodsituaties. Een hogere score betekent niet dat een AI systeem in elk echt gesprek veilig reageert.