MentalHealthBench menguji respons AI terhadap 1,215 perbualan rekaan menggunakan kriteria yang dibangunkan bersama lebih 80 pakar kesihatan mental berlesen. Ujiannya merangkumi kebimbangan harian hingga kecemasan, tetapi skor yang lebih baik tidak menjamin respons selamat dalam setiap perbualan.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Apabila seseorang berbual dengan AI tentang kesihatan mental, jawapan yang baik tidak semestinya sama untuk setiap keadaan. Ada kalanya AI perlu bertanya dahulu untuk memahami situasi; ada kalanya ia perlu memberi panduan praktikal atau mengenali tanda risiko yang mendesak. MentalHealthBench ialah penanda aras terbuka OpenAI untuk menguji sama ada respons AI membantu dan selamat dalam konteks perbualan tertentu. OpenAI membangunkannya kerana banyak penilaian terdahulu tertumpu pada kecemasan dan peraturan keselamatan umum, sedangkan orang ramai juga mendapatkan sokongan bagi pelbagai kebimbangan lain. 1
3
Penanda aras ini mengandungi 1,215 perbualan sintetik, iaitu perbualan yang direka untuk tujuan ujian, bukan transkrip pengguna sebenar. Sesetengahnya mempunyai mesej terdahulu supaya penilaian boleh melihat sama ada model mengambil kira konteks sebelum menjawab mesej terakhir. Campuran senario itu bukan ukuran kekerapan setiap situasi berlaku dalam ChatGPT. 1
Lebih 80 pakar kesihatan mental berlesen dari 22 negara terlibat dalam pembangunannya. Mereka meneliti perbualan dan menulis kriteria khusus untuk menilai jawapan kepada mesej terakhir. Setiap perbualan disemak oleh sekurang-kurangnya tiga pakar; menurut OpenAI, sesuatu kriteria hanya dimasukkan jika semua penyemak bersetuju. 1
4
Set yang diterbitkan mengandungi 5,262 kriteria tulisan pakar. Setiap kriteria menyasar tingkah laku tertentu: pemberat positif memberi ganjaran kepada respons yang membantu, manakala pemberat negatif mengenakan penalti terhadap respons yang memudaratkan. Sistem pemarkahan automatik kemudian menilai jawapan model terhadap setiap kriteria. Maka, skor menunjukkan sejauh mana jawapan menepati kriteria ujian—bukan sama ada keadaan kesihatan seseorang benar-benar bertambah baik. 1
4
Senarionya merangkumi kebimbangan harian yang tidak mendesak, tekanan yang serius dan kecemasan. Perbualan turut melibatkan orang dewasa, remaja, penjaga dan ahli klinikal, dengan kepelbagaian bahasa serta wilayah. Antara perkara yang boleh dinilai ialah sama ada AI mendapatkan konteks yang diperlukan, menghormati hak seseorang membuat keputusan sendiri, memberi panduan yang sesuai dan bertindak setimpal dengan tahap risiko. 1
4
OpenAI melaporkan peningkatan dalam kalangan sistem AI yang diuji, tetapi menyatakan bahawa meminta konteks yang sesuai dan menentukan tahap kesegeraan respons masih mencabar. Maklumat hasil yang dibekalkan tidak memadai untuk membuat susunan kedudukan model demi model yang boleh dipercayai. Prestasi yang lebih baik dalam ujian juga bukan jaminan bahawa setiap respons dalam perbualan sebenar akan selamat. 1
OpenAI turut mempertimbangkan maklum balas pengguna sebenar ChatGPT. Pandangan pengguna boleh melengkapi pertimbangan ahli klinikal, tetapi tidak menggantikan kriteria klinikal dan keselamatan. Bahan sumber yang tersedia tidak menunjukkan dengan jelas keutamaan khusus yang dinilai berbeza oleh kedua-dua kumpulan, jadi tidak wajar mereka-reka jurang antara pandangan mereka. 1
MentalHealthBench sendiri ialah alat penilaian, bukan ciri bantuan krisis. Secara berasingan, OpenAI menyatakan bahawa ia telah meluaskan akses kepada talian bantuan krisis, mengalihkan sesetengah perbualan sensitif kepada model yang lebih selamat dan menambah peringatan untuk berehat semasa sesi yang panjang. Langkah-langkah itu tidak menjadikan ChatGPT pengganti terapi, penjagaan profesional atau bantuan daripada orang sebenar ketika kecemasan. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
MentalHealthBench menguji respons AI terhadap 1,215 perbualan rekaan menggunakan kriteria yang dibangunkan bersama lebih 80 pakar kesihatan mental berlesen.
MentalHealthBench menguji respons AI terhadap 1,215 perbualan rekaan menggunakan kriteria yang dibangunkan bersama lebih 80 pakar kesihatan mental berlesen. Ujiannya merangkumi kebimbangan harian hingga kecemasan, tetapi skor yang lebih baik tidak menjamin respons selamat dalam setiap perbualan.