MentalHealthBench bewertet KI Antworten auf 1.215 simulierte Gespräche anhand von 5.262 Kriterien, die Fachleute für psychische Gesundheit verfasst haben. Der Test reicht von Alltagsbelastungen bis zu akuten Krisen.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Eine Antwort kann freundlich klingen und trotzdem am Anliegen vorbeigehen. Genau hier setzt OpenAIs öffentlich zugänglicher Benchmark MentalHealthBench an: Er prüft, ob eine KI auf ein konkretes Gespräch über psychische Gesundheit hilfreich und sicher reagiert. Dafür nutzt er 1.215 simulierte Gespräche mit jeweils passenden Bewertungskriterien. OpenAI will damit eine Lücke schließen: Bisherige Tests konzentrierten sich häufig auf Krisenfälle und allgemeine Sicherheitsregeln, weniger auf die Bandbreite möglicher Unterstützung im Alltag. 1
3
Die Gespräche sind synthetisch, also eigens für den Test erstellt. Manche enthalten einen längeren Verlauf. Dadurch lässt sich prüfen, ob ein Modell wichtige frühere Angaben berücksichtigt, wenn es auf die letzte Nachricht antwortet. Die Auswahl ist eine Sammlung von Testfällen – keine Aussage darüber, wie häufig diese Situationen bei ChatGPT vorkommen. 1
Mehr als 80 zugelassene Fachleute für psychische Gesundheit aus 22 Ländern waren an der Entwicklung beteiligt. Sie prüften die Gespräche und formulierten Kriterien für die Antwort auf die jeweils letzte Nachricht. Jedes Gespräch wurde von mindestens drei Fachleuten begutachtet; laut OpenAI gelangte ein Kriterium nur dann in den fertigen Benchmark, wenn alle Prüfenden ihm zustimmten. 1
4
Insgesamt enthält der veröffentlichte Test 5.262 solcher Kriterien. Sie beschreiben einzelne Verhaltensweisen einer Antwort: Hilfreiche Schritte werden positiv, schädliche negativ gewichtet. Ein automatisiertes Bewertungssystem prüft anschließend die Modellantwort Kriterium für Kriterium. Das Ergebnis zeigt somit, wie gut eine Antwort zu den fachlich formulierten Maßstäben passt – nicht, ob es einer betroffenen Person dadurch tatsächlich besser geht. 1
4
Die Szenarien reichen von alltäglichen, nicht akuten Belastungen über schwere psychische Krisen bis zu dringenden Notfällen. Sie betreffen unter anderem Erwachsene, Jugendliche, Angehörige und Behandelnde und variieren nach Sprache und Region. Bewertet werden kann etwa, ob eine Antwort nötige Rückfragen stellt, die Selbstbestimmung der Person wahrt, angemessene praktische Hinweise gibt und die Dringlichkeit richtig einordnet. 1
4
OpenAI berichtet von Verbesserungen bei den getesteten KI-Systemen. Schwierigkeiten bestehen demnach weiterhin darin, passenden Kontext zu erfragen und die Dringlichkeit einer Situation richtig einzuschätzen. Die vorliegenden Angaben erlauben für diesen Artikel keine belastbare Rangliste einzelner Modelle. Auch ein besseres Testergebnis garantiert keine sichere Antwort in jedem realen Gespräch. 1
OpenAI bezog außerdem Rückmeldungen von Menschen ein, die ChatGPT tatsächlich nutzen. Diese Perspektive kann die Einschätzung von Fachleuten ergänzen, ersetzt aber keine klinischen und sicherheitsbezogenen Kriterien. Welche konkreten Prioritäten Nutzende und Fachleute unterschiedlich setzten, geht aus dem vorliegenden Material nicht hervor. 1
MentalHealthBench ist ein Messinstrument, keine Krisenhilfe in ChatGPT. Unabhängig davon gibt OpenAI an, den Zugang zu Krisenhotlines erweitert, manche sensiblen Gespräche an sicherere Modelle weitergeleitet und bei langen Unterhaltungen Pausenerinnerungen eingeführt zu haben. Diese Maßnahmen sind Teil der Sicherheitsarbeit, machen ChatGPT aber nicht zum Ersatz für Therapie, professionelle Versorgung oder Hilfe durch Menschen vor Ort in einem Notfall. 11
15
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
MentalHealthBench bewertet KI Antworten auf 1.215 simulierte Gespräche anhand von 5.262 Kriterien, die Fachleute für psychische Gesundheit verfasst haben.
MentalHealthBench bewertet KI Antworten auf 1.215 simulierte Gespräche anhand von 5.262 Kriterien, die Fachleute für psychische Gesundheit verfasst haben. Der Test reicht von Alltagsbelastungen bis zu akuten Krisen. Ein gutes Ergebnis ist jedoch kein Nachweis dafür, dass eine KI in jedem echten Gespräch sicher hilft.