MentalHealthBench évalue les réponses de l’IA à 1 215 conversations fictives à l’aide de critères élaborés par plus de 80 professionnels qualifiés en santé mentale. Le test couvre aussi bien les préoccupations courantes que les urgences.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Une réponse peut éviter un conseil dangereux tout en passant à côté de ce dont une personne a besoin. MentalHealthBench cherche à examiner cette nuance : OpenAI a publié ce test ouvert pour évaluer si une IA répond de façon utile et sûre dans le contexte précis d’une conversation sur la santé mentale. L’objectif est de compléter des évaluations jusque-là davantage centrées sur les situations de crise et les règles générales de sécurité. 1
3
Le jeu de test réunit 1 215 conversations fictives. Certaines comprennent des échanges antérieurs, afin de vérifier si le modèle tient compte d’informations pertinentes lorsqu’il répond au dernier message. Ces scénarios servent à éprouver ses réponses : leur répartition ne dit pas à quelle fréquence ces situations surviennent dans ChatGPT. 1
Plus de 80 professionnels qualifiés en santé mentale, issus de 22 pays, ont participé à l’élaboration du test. Pour chaque conversation, des spécialistes ont défini les critères permettant d’évaluer la réponse au dernier message. Au moins trois ont examiné chaque conversation et, selon OpenAI, seuls les critères approuvés par tous les relecteurs ont été retenus. 1
4
La version publiée comporte 5 262 critères. Chacun vise un comportement précis : une pondération positive récompense une action utile, une pondération négative pénalise une action nuisible. Un système de notation automatisé vérifie ensuite la réponse du modèle critère par critère. Le score indique donc dans quelle mesure la réponse satisfait ces critères, et non si elle améliore effectivement l’état de santé d’une personne. 1
4
Les conversations vont des préoccupations du quotidien aux détresses graves et aux urgences. Elles mettent en scène des adultes, des adolescents, des proches aidants et des professionnels de santé, dans différentes langues et régions. Selon le cas, les critères vérifient notamment si l’IA demande les précisions nécessaires, respecte l’autonomie de la personne, propose des pistes concrètes adaptées et réagit à la mesure du risque. 1
4
OpenAI fait état de progrès parmi les systèmes testés, mais relève des difficultés persistantes : savoir demander les bonnes précisions et ajuster le degré d’urgence de la réponse. Les résultats fournis ici ne permettent pas d’établir un classement fiable des modèles. Un meilleur score ne garantit pas non plus une réponse sûre dans toutes les conversations. 1
OpenAI a également pris en compte les retours de personnes utilisant ChatGPT. Leur point de vue peut compléter celui des cliniciens, sans remplacer les critères cliniques et de sécurité. Les éléments disponibles ne permettent toutefois pas d’affirmer sur quelles priorités précises les deux groupes divergeaient. 1
MentalHealthBench évalue des réponses : il ne constitue pas, à lui seul, une fonction d’assistance. Séparément, OpenAI indique avoir élargi l’accès aux lignes d’aide en situation de crise, réorienté certaines conversations sensibles vers des modèles jugés plus sûrs et ajouté des invitations à faire une pause pendant les longues sessions. Ces mesures ne font pas de ChatGPT un substitut à une thérapie, à des soins professionnels ou à une aide humaine en situation d’urgence. 11
15
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
MentalHealthBench évalue les réponses de l’IA à 1 215 conversations fictives à l’aide de critères élaborés par plus de 80 professionnels qualifiés en santé mentale.
MentalHealthBench évalue les réponses de l’IA à 1 215 conversations fictives à l’aide de critères élaborés par plus de 80 professionnels qualifiés en santé mentale. Le test couvre aussi bien les préoccupations courantes que les urgences. Il mesure la conformité à des critères d’évaluation, pas l’effet réel d’une réponse sur la santé d’une personne.