MentalHealthBench innehåller 1 215 fiktiva samtal som bedöms med kriterier framtagna av fler än 80 legitimerade experter inom psykisk hälsa. Testet omfattar allt från vardagliga bekymmer till akuta kriser, men ett högt resultat är ingen garanti för att ett AI svar är säkert i verkligheten.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Ett svar om psykisk hälsa kan låta omtänksamt men ändå missa något avgörande: att ställa en följdfråga, ta hänsyn till tidigare uppgifter eller anpassa råden efter hur brådskande situationen är. Det är sådana skillnader OpenAI vill fånga med MentalHealthBench, ett öppet test med 1 215 fiktiva samtal och bedömningskriterier för varje enskild situation. Tidigare utvärderingar har enligt OpenAI främst fokuserat på kriser och övergripande säkerhetsregler. 1
3
Vissa testsamtal innehåller tidigare meddelanden, så att det går att pröva om modellen använder relevant sammanhang när den svarar på användarens sista meddelande. Samtalen är testfall – inte statistik över hur vanliga olika situationer är i ChatGPT. 1
Fler än 80 legitimerade experter inom psykisk hälsa från 22 länder deltog i arbetet. Minst tre experter granskade varje samtal och formulerade kriterier för svaret. Enligt OpenAI togs ett kriterium med i den slutliga versionen bara om alla granskarna var överens. 1
4
Totalt innehåller testet 5 262 expertskrivna kriterier. Positiva vikter belönar hjälpsamma inslag i svaret, medan negativa vikter ger avdrag för skadliga inslag. Därefter bedömer en automatiserad granskare modellens svar mot kriterierna var för sig. Poängen visar alltså hur väl svaret följer bedömningskriterierna – inte vilken effekt svaret skulle få för en persons hälsa. 1
4
Testfallen sträcker sig från vardagliga frågor om mående till svår psykisk påfrestning och akuta nödsituationer. De omfattar bland annat vuxna, tonåringar, anhöriga och vårdpersonal samt variation mellan språk och regioner. Kriterierna kan pröva om modellen söker nödvändigt sammanhang, respekterar personens självbestämmande, ger användbara råd och anpassar svaret efter risknivån. 1
4
OpenAI rapporterar förbättringar hos de AI-system som testats, men också kvarstående svårigheter med att ställa rätt följdfrågor och bedöma hur brådskande ett läge är. Underlaget här ger inte stöd för någon tillförlitlig rangordning modell för modell. Ett bättre testresultat är heller ingen garanti för ett säkert svar i varje verkligt samtal. 1
OpenAI har även tagit hänsyn till återkoppling från personer som använder ChatGPT. Deras perspektiv kan komplettera experternas bedömningar, men ersätter inte kliniska kriterier eller säkerhetskriterier. Det tillgängliga underlaget visar inte vilka specifika prioriteringar användare och experter eventuellt bedömde olika. 1
MentalHealthBench mäter hur modeller svarar; det är inte i sig en funktion som ger stöd vid en kris. Separat uppger OpenAI att företaget har gjort krisstödslinjer mer tillgängliga, styrt vissa känsliga samtal till säkrare modeller och lagt till påminnelser om pauser vid långa sessioner. Sådana åtgärder ändrar inte den grundläggande begränsningen: ChatGPT ersätter inte terapi, professionell vård eller hjälp från människor och verksamheter utanför tjänsten i en nödsituation. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench innehåller 1 215 fiktiva samtal som bedöms med kriterier framtagna av fler än 80 legitimerade experter inom psykisk hälsa.
MentalHealthBench innehåller 1 215 fiktiva samtal som bedöms med kriterier framtagna av fler än 80 legitimerade experter inom psykisk hälsa. Testet omfattar allt från vardagliga bekymmer till akuta kriser, men ett högt resultat är ingen garanti för att ett AI svar är säkert i verkligheten.