MentalHealthBench menguji respons AI terhadap 1.215 percakapan sintetis menggunakan kriteria yang disusun oleh lebih dari 80 ahli kesehatan mental berlisensi. Situasinya mencakup persoalan sehari hari hingga keadaan darurat.
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Respons yang aman dalam percakapan kesehatan mental tidak selalu cukup dengan menghindari kalimat berbahaya. AI juga perlu memahami konteks, merespons sesuai tingkat risiko, dan memberi bantuan yang tepat untuk situasi yang sedang dihadapi. Itulah yang ingin diuji OpenAI melalui MentalHealthBench, sebuah tolok ukur terbuka berisi 1.215 percakapan sintetis. OpenAI mengembangkannya karena pengujian sebelumnya lebih banyak berfokus pada keadaan darurat dan aturan keselamatan umum. 1
3
Setiap percakapan dirancang sebagai kasus uji, bukan rekaman kejadian nyata. Sebagian memuat konteks dari pesan-pesan sebelumnya untuk melihat apakah model memperhatikannya saat menjawab pesan terakhir. Komposisi kasus tersebut tidak menunjukkan seberapa sering tiap situasi muncul di ChatGPT. 1
Lebih dari 80 ahli kesehatan mental berlisensi dari 22 negara terlibat dalam penyusunannya. Setiap percakapan ditinjau oleh sedikitnya tiga ahli, yang merumuskan kriteria untuk menilai jawaban atas pesan terakhir pengguna. Menurut OpenAI, hanya kriteria yang disetujui seluruh peninjau yang masuk ke versi akhir. 1
4
Hasilnya adalah 5.262 kriteria yang ditulis para ahli. Masing-masing menilai perilaku tertentu dalam jawaban: bobot positif diberikan untuk tindakan yang membantu, sedangkan bobot negatif untuk tindakan yang merugikan. Penilai otomatis kemudian memeriksa jawaban model terhadap kriteria tersebut satu per satu. Jadi, skor mengukur kesesuaian dengan kriteria penilaian, bukan apakah kondisi seseorang benar-benar membaik. 1
4
Kasusnya membentang dari persoalan sehari-hari yang tidak mendesak hingga tekanan psikologis berat dan keadaan darurat. Tokoh dalam skenario mencakup orang dewasa, remaja, pengasuh, dan tenaga klinis, dengan variasi bahasa serta wilayah. Penilaian dapat memeriksa apakah AI meminta konteks yang diperlukan, menghormati pilihan pengguna, menawarkan langkah praktis yang sesuai, dan menanggapi risiko secara proporsional. 1
4
OpenAI melaporkan adanya peningkatan pada sistem AI yang diuji, tetapi juga mencatat kesulitan yang masih muncul: meminta konteks yang tepat dan menentukan seberapa mendesak suatu situasi. Hasil yang tersedia di sini tidak cukup untuk menyusun peringkat model yang andal. Skor lebih tinggi pun bukan jaminan bahwa AI akan aman dalam setiap percakapan. 1
OpenAI juga mempertimbangkan masukan dari pengguna ChatGPT. Sudut pandang pengguna dapat melengkapi penilaian tenaga klinis, tetapi tidak menggantikan kriteria klinis dan keselamatan. Materi yang tersedia tidak menjelaskan secara pasti prioritas mana yang dinilai berbeda oleh kedua kelompok tersebut. 1
MentalHealthBench adalah alat evaluasi respons, bukan fitur bantuan krisis. Secara terpisah, OpenAI menyatakan telah memperluas akses ke saluran bantuan krisis, mengalihkan sebagian percakapan sensitif ke model yang lebih aman, dan menambahkan pengingat untuk beristirahat saat sesi berlangsung lama. Langkah-langkah itu tidak menjadikan ChatGPT pengganti terapi, perawatan profesional, atau bantuan langsung dalam keadaan darurat. 11
15
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
MentalHealthBench menguji respons AI terhadap 1.215 percakapan sintetis menggunakan kriteria yang disusun oleh lebih dari 80 ahli kesehatan mental berlisensi.
MentalHealthBench menguji respons AI terhadap 1.215 percakapan sintetis menggunakan kriteria yang disusun oleh lebih dari 80 ahli kesehatan mental berlisensi. Situasinya mencakup persoalan sehari hari hingga keadaan darurat. Skornya mengukur kesesuaian respons dengan kriteria ahli, bukan dampaknya terhadap kondisi seseorang.