MentalHealthBench evalúa respuestas a 1.215 conversaciones simuladas mediante criterios elaborados con más de 80 profesionales acreditados de salud mental. Abarca desde inquietudes cotidianas hasta emergencias y valora si la respuesta se ajusta a la situación, no solo si evita contenido peligroso.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Una respuesta sobre salud mental puede evitar consejos peligrosos y, aun así, quedarse corta: quizá no pide información importante o trata una situación urgente como si no lo fuera. MentalHealthBench es la prueba abierta con la que OpenAI busca evaluar ese juicio caso por caso, más allá de las emergencias y las reglas generales de seguridad en las que se habían concentrado muchas evaluaciones anteriores. 1
3
El conjunto reúne 1.215 conversaciones sintéticas sobre salud mental. Algunas incluyen mensajes previos para comprobar si el modelo tiene en cuenta el contexto al responder al último mensaje. Son casos de prueba: su distribución no indica con qué frecuencia aparecen esas situaciones en ChatGPT. 1
En su elaboración participaron más de 80 profesionales acreditados de salud mental de 22 países. Al menos tres especialistas revisaron cada conversación y redactaron criterios para valorar la respuesta final; según OpenAI, un criterio solo pasó al conjunto definitivo si todos los revisores estuvieron de acuerdo. 1
4
El resultado son 5.262 criterios redactados por especialistas. Cada uno evalúa una conducta concreta: los criterios con peso positivo premian acciones útiles y los de peso negativo penalizan respuestas perjudiciales. Después, un evaluador automatizado comprueba la respuesta del modelo frente a cada criterio. La puntuación refleja, por tanto, su ajuste a esas pautas, no el efecto clínico en una persona. 1
4
Los casos van desde preocupaciones cotidianas sin riesgo inmediato hasta malestar grave y emergencias. Incluyen a personas adultas y adolescentes, así como a cuidadores y profesionales sanitarios, con variaciones de idioma y región. Los criterios examinan, entre otras cosas, si la IA pide el contexto necesario, respeta la autonomía de la persona, ofrece orientación práctica adecuada y responde de forma proporcionada al riesgo. 1
4
OpenAI informa de mejoras entre los sistemas que probó, pero también de dificultades persistentes para pedir información pertinente y calibrar la urgencia. Los resultados disponibles no permiten establecer aquí una clasificación fiable modelo por modelo; tampoco garantizan que una mejor puntuación se traduzca en una respuesta segura en cualquier conversación. 1
OpenAI consideró además opiniones de usuarios reales de ChatGPT. Esa perspectiva puede complementar la de los profesionales, pero no sustituye los criterios clínicos y de seguridad. Las fuentes disponibles no permiten precisar qué prioridades concretas valoraron de forma distinta unos y otros. 1
MentalHealthBench mide respuestas; no ofrece ayuda directa durante una crisis. Por separado, OpenAI afirma que ha ampliado el acceso a líneas de ayuda, redirigido algunas conversaciones delicadas a modelos más seguros y añadido recordatorios para hacer pausas en sesiones largas. Ninguna de esas medidas convierte a ChatGPT en un sustituto de la terapia, la atención profesional o la ayuda presencial ante una emergencia. 11
15
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
MentalHealthBench evalúa respuestas a 1.215 conversaciones simuladas mediante criterios elaborados con más de 80 profesionales acreditados de salud mental.
MentalHealthBench evalúa respuestas a 1.215 conversaciones simuladas mediante criterios elaborados con más de 80 profesionales acreditados de salud mental. Abarca desde inquietudes cotidianas hasta emergencias y valora si la respuesta se ajusta a la situación, no solo si evita contenido peligroso.
Sus puntuaciones miden el cumplimiento de criterios expertos; no demuestran resultados clínicos ni garantizan la seguridad de cada conversación.