O MentalHealthBench avalia respostas a 1.215 conversas simuladas com critérios elaborados por mais de 80 profissionais habilitados em saúde mental. Os casos vão de preocupações cotidianas a emergências, mas a pontuação não mede resultados clínicos nem garante segurança em todas as situações.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Uma resposta sobre saúde mental não é boa apenas porque evita dizer algo perigoso. Ela também precisa levar em conta o que a pessoa contou, qual é o risco naquele momento e que tipo de ajuda faz sentido oferecer. É isso que a OpenAI procura avaliar com o MentalHealthBench, um conjunto aberto de testes criado para ir além das avaliações concentradas em emergências e regras gerais de segurança. 1
3
O MentalHealthBench reúne 1.215 conversas sintéticas, ou seja, simuladas para representar diferentes situações de apoio em saúde mental. Algumas trazem mensagens anteriores, permitindo verificar se a IA considera informações relevantes antes de responder à última mensagem. A distribuição dos casos serve ao teste: ela não indica com que frequência cada situação aparece no ChatGPT. 1
Mais de 80 profissionais habilitados em saúde mental, de 22 países, participaram da elaboração dos critérios de avaliação. Pelo menos três especialistas revisaram cada conversa, e, segundo a OpenAI, um critério só entrou na versão final quando todos os revisores concordaram com ele. 1
4
O conjunto publicado contém 5.262 critérios escritos por especialistas. Cada um examina um aspecto específico da resposta: pesos positivos favorecem condutas úteis, enquanto pesos negativos penalizam condutas prejudiciais. Depois, um avaliador automatizado verifica a resposta da IA critério por critério. A nota, portanto, mostra o quanto a resposta se ajusta a essas regras de avaliação — não se uma pessoa teve melhora clínica. 1
4
Os casos vão de preocupações cotidianas, sem crise imediata, a sofrimento intenso e emergências. Incluem conversas envolvendo adultos, adolescentes, cuidadores e profissionais de saúde, com variações de idioma e região. Conforme a situação, os critérios podem avaliar se a IA busca informações necessárias, respeita a autonomia da pessoa, oferece orientações práticas adequadas e reage de maneira proporcional ao risco. 1
4
A OpenAI relata melhora entre os sistemas de IA que testou, mas aponta dificuldades persistentes para pedir o contexto apropriado e ajustar o grau de urgência da resposta. Os resultados disponíveis não sustentam, aqui, uma classificação confiável modelo por modelo. E um desempenho melhor no teste não é garantia de segurança em toda conversa real. 1
A empresa também considerou a opinião de usuários reais do ChatGPT. Essa perspectiva pode complementar a avaliação dos profissionais, mas não substitui critérios clínicos e de segurança. O material disponível não permite afirmar quais prioridades específicas usuários e especialistas avaliaram de forma diferente. 1
O MentalHealthBench mede respostas; não é, por si só, um recurso de ajuda em crises. Separadamente, a OpenAI afirma ter ampliado o acesso a linhas de apoio, encaminhado algumas conversas sensíveis para modelos considerados mais seguros e incluído lembretes para fazer pausas em sessões longas. Essas medidas não transformam o ChatGPT em substituto de terapia, atendimento profissional ou ajuda presencial em uma emergência. 11
15
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O MentalHealthBench avalia respostas a 1.215 conversas simuladas com critérios elaborados por mais de 80 profissionais habilitados em saúde mental.
O MentalHealthBench avalia respostas a 1.215 conversas simuladas com critérios elaborados por mais de 80 profissionais habilitados em saúde mental. Os casos vão de preocupações cotidianas a emergências, mas a pontuação não mede resultados clínicos nem garante segurança em todas as situações.