MentalHealthBench valuta le risposte dell’AI a 1.215 conversazioni simulate sulla salute mentale con criteri elaborati da oltre 80 professionisti abilitati. Il test copre dalle difficoltà quotidiane alle emergenze: un buon punteggio non garantisce che ogni risposta sia sicura né misura gli esiti clinici.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Una risposta sulla salute mentale non è utile solo perché evita un consiglio pericoloso: deve anche tenere conto di ciò che la persona ha raccontato e della gravità della situazione. È questo che OpenAI cerca di valutare con MentalHealthBench, un benchmark pubblico composto da 1.215 conversazioni simulate, ciascuna associata a criteri specifici elaborati da esperti. Il progetto nasce per ampliare valutazioni finora concentrate soprattutto sulle emergenze e su regole generali di sicurezza. 1
3
Le conversazioni sono sintetiche, ma costruite per rappresentare situazioni diverse. Alcune includono messaggi precedenti: il modello deve quindi rispondere all’ultimo messaggio tenendo conto, quando serve, di quanto emerso prima. I 1.215 casi sono una raccolta di prove, non una stima della frequenza con cui quelle situazioni si presentano su ChatGPT. 1
Alla costruzione del benchmark hanno contribuito oltre 80 professionisti abilitati nell’ambito della salute mentale, provenienti da 22 Paesi. Per ogni conversazione, gli esperti hanno definito i criteri con cui giudicare la risposta finale. Ciascun caso è stato esaminato da almeno tre esperti e, secondo OpenAI, un criterio è stato incluso solo con l’accordo di tutti i revisori. 1
4
Il set pubblicato contiene 5.262 criteri. Ognuno riguarda un comportamento preciso: i pesi positivi premiano le risposte utili, quelli negativi penalizzano quelle dannose. Un valutatore automatico verifica poi la risposta del modello rispetto ai singoli criteri. Il punteggio indica quindi quanto la risposta rispetta quelle regole di valutazione; non misura direttamente l’effetto clinico su una persona. 1
4
Gli scenari vanno dalle difficoltà quotidiane senza carattere di urgenza a condizioni di forte disagio e alle emergenze. Comprendono adulti, adolescenti, persone che prestano assistenza e professionisti sanitari, con variazioni di lingua e area geografica. I criteri possono valutare, per esempio, se il modello chiede informazioni necessarie, rispetta l’autonomia della persona, propone indicazioni pratiche appropriate e calibra la risposta in base al rischio. 1
4
OpenAI segnala miglioramenti tra i sistemi esaminati, ma anche difficoltà persistenti nel chiedere il giusto contesto e nel valutare il livello di urgenza. I risultati forniti non permettono di stabilire qui una classifica affidabile modello per modello. Né un punteggio migliore garantisce risposte sicure in ogni conversazione. 1
OpenAI ha considerato anche i riscontri di utenti reali di ChatGPT. Il loro punto di vista può integrare quello dei professionisti, ma non sostituisce i criteri clinici e di sicurezza. Le fonti disponibili non consentono di dire quali precise priorità utenti ed esperti abbiano valutato diversamente. 1
MentalHealthBench è uno strumento di valutazione, non un servizio di assistenza nelle crisi. Separatamente, OpenAI afferma di aver ampliato l’accesso alle linee di aiuto in caso di crisi, indirizzato alcune conversazioni sensibili verso modelli ritenuti più sicuri e aggiunto promemoria per fare una pausa durante le sessioni lunghe. Sono misure distinte dal benchmark: ChatGPT non sostituisce un percorso terapeutico, l’assistenza di un professionista o l’aiuto immediato nel mondo reale in caso di emergenza. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench valuta le risposte dell’AI a 1.215 conversazioni simulate sulla salute mentale con criteri elaborati da oltre 80 professionisti abilitati.
MentalHealthBench valuta le risposte dell’AI a 1.215 conversazioni simulate sulla salute mentale con criteri elaborati da oltre 80 professionisti abilitati. Il test copre dalle difficoltà quotidiane alle emergenze: un buon punteggio non garantisce che ogni risposta sia sicura né misura gli esiti clinici.