MentalHealthBench obsahuje 1 215 syntetických rozhovorů; odpovědi AI posuzuje podle kritérií vytvořených více než 80 odborníky na duševní zdraví. Test zahrnuje běžné obtíže i krizové situace.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Když se člověk svěří AI s psychickými obtížemi, nestačí zkontrolovat, zda odpověď neobsahuje něco výslovně nebezpečného. Záleží také na tom, jestli model správně pochopí situaci, doptá se tam, kde chybí důležité informace, a zvolí přiměřenou reakci. Právě to má zkoumat MentalHealthBench, veřejně zpřístupněný testovací soubor od OpenAI. Vznikl jako doplněk dosavadních hodnocení, která se soustředila hlavně na krizové případy a obecná bezpečnostní pravidla. 1
3
MentalHealthBench obsahuje 1 215 syntetických rozhovorů o duševním zdraví. Některé zachycují i předchozí část konverzace, takže lze ověřit, zda model při odpovědi na poslední zprávu bere v úvahu podstatné souvislosti. Jde o sadu testovacích situací, nikoli o údaj, jak často se jednotlivé problémy objevují v ChatGPT. 1
Na tvorbě se podílelo více než 80 odborníků s příslušnou profesní licencí z 22 zemí. Každý rozhovor posoudili nejméně tři odborníci a stanovili kritéria pro hodnocení odpovědi na jeho závěrečnou zprávu. Podle OpenAI se kritérium dostalo do výsledné sady jen tehdy, když s ním souhlasili všichni posuzovatelé daného rozhovoru. 1
4
Zveřejněná sada má 5 262 odborně sepsaných kritérií. Každé sleduje určitý aspekt odpovědi: kladná váha oceňuje žádoucí postup, záporná postihuje škodlivý. Automatický hodnoticí systém pak odpověď modelu posuzuje vůči jednotlivým kritériím. Výsledné skóre tedy ukazuje, nakolik odpověď odpovídá těmto pravidlům; neměří přímo, zda se konkrétnímu člověku zlepšil zdravotní stav. 1
4
Scénáře sahají od běžných potíží bez akutního ohrožení přes vážnou psychickou tíseň až po naléhavé krizové situace. Vystupují v nich dospělí, dospívající, pečující osoby i zdravotničtí odborníci; rozhovory se liší také jazykem a regionem. Kritéria mohou sledovat například to, zda si model vyžádá potřebné souvislosti, respektuje rozhodování člověka, nabídne vhodné praktické kroky a nepodcení ani nepřecení míru rizika. 1
4
OpenAI u testovaných systémů uvádí zlepšení. Přetrvávají však obtíže s vhodným doptáváním na kontext a s odhadem naléhavosti situace. Podklady k tomuto článku neumožňují sestavit spolehlivé pořadí jednotlivých modelů. Ani lepší výsledek v testu není příslibem bezpečné odpovědi v každé skutečné konverzaci. 1
OpenAI při práci zohlednila také zpětnou vazbu skutečných uživatelů ChatGPT. Jejich pohled může odborné hodnocení doplnit, nemůže však nahradit klinická a bezpečnostní kritéria. Dostupné podklady neukazují dostatečně konkrétně, v čem se priority uživatelů a odborníků lišily. 1
MentalHealthBench je způsob hodnocení odpovědí, nikoli nástroj krizové pomoci. OpenAI odděleně popisuje další opatření v ChatGPT: širší zpřístupnění krizových linek, přesměrování některých citlivých rozhovorů na bezpečnější modely a připomínky k přestávce při dlouhém používání. Ani tato opatření nedělají z ChatGPT náhradu psychoterapie, odborné péče nebo pomoci v naléhavé situaci. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench obsahuje 1 215 syntetických rozhovorů; odpovědi AI posuzuje podle kritérií vytvořených více než 80 odborníky na duševní zdraví.
MentalHealthBench obsahuje 1 215 syntetických rozhovorů; odpovědi AI posuzuje podle kritérií vytvořených více než 80 odborníky na duševní zdraví. Test zahrnuje běžné obtíže i krizové situace. Vyšší skóre ale není zárukou bezpečné odpovědi v každém skutečném rozhovoru.