Açık olarak yayımlanan MentalHealthBench, 1.215 kurgusal konuşmayı 80’den fazla ruh sağlığı uzmanının katkısıyla hazırlanan ölçütlerle değerlendiriyor. Test, gündelik kaygılardan acil durumlara uzanıyor; yüksek puan, gerçek hayatta her yanıtın güvenli olacağını veya klinik açıdan iyi sonuç vereceğini göstermiyor.
YayımlayanGPT-6 Sol ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s MentalHealthBench, why was it created, how were its conversations and expert scoring criteria developed and evaluated, what. Article summary: MentalHealthBench is OpenAI’s open benchmark for testing whether AI gives helpful, safe responses across 1,215 realistic mental-health conversations. OpenAI created it because earlier evaluations focused heavily on crise. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Ruh sağlığıyla ilgili bir konuşmada iyi yanıt, yalnızca zararlı bir şey söylememek değildir. Gerektiğinde ek bilgi istemek, kişinin karar verme hakkına saygı göstermek ve durumun aciliyetine uygun karşılık vermek de önemlidir. OpenAI’ın açık olarak yayımladığı MentalHealthBench, yapay zekâ yanıtlarını bu tür konuşmaya özgü ölçütlerle değerlendirmek için geliştirildi. Şirket, önceki değerlendirmelerin ağırlıklı olarak krizlere ve genel güvenlik kurallarına odaklanmasının, insanların destek aradığı daha geniş durum yelpazesinde bir boşluk bıraktığını söylüyor. 1
3
Veri setinde 1.215 kurgusal ruh sağlığı konuşması var. Bazılarında önceki mesajlar da bulunuyor; böylece modelin son mesaja yanıt verirken ilgili bağlamı dikkate alıp almadığı sınanabiliyor. Bunlar test için hazırlanmış örnekler: Konuşma türlerinin ChatGPT’de ne sıklıkla yaşandığını gösteren bir dağılım değiller. 1
22 ülkeden 80’den fazla yetkili ruh sağlığı uzmanı çalışmaya katkıda bulundu. Uzmanlar konuşmaları inceleyip son kullanıcı mesajına verilecek yanıt için ölçütler yazdı. Her konuşma en az üç uzman tarafından değerlendirildi; OpenAI’a göre bir ölçüt ancak inceleyenlerin tamamı üzerinde uzlaşınca nihai sete alındı. 1
4
Yayımlanan sette uzmanlarca yazılmış 5.262 ölçüt bulunuyor. Her biri, yanıtta aranacak belirli bir davranışa odaklanıyor: Yararlı davranışlar artı, zararlı davranışlar eksi ağırlık taşıyor. Otomatik bir puanlayıcı modelin yanıtını bu ölçütlere göre ayrı ayrı değerlendiriyor. Dolayısıyla puan, uzman ölçütlerine uyumu gösteriyor; yanıtı alan bir kişinin klinik açıdan nasıl etkileneceğini doğrudan ölçmüyor. 1
4
Senaryolar gündelik, acil olmayan güçlüklerden ciddi sıkıntı ve acil durumlara kadar uzanıyor. Yetişkinler, ergenler, bakım verenler ve klinisyenlerle ilgili konuşmaların yanı sıra farklı dil ve bölgelerden örnekler de yer alıyor. Ölçütler; gerektiğinde bağlam sormayı, kişinin özerkliğini korumayı, uygun pratik öneriler sunmayı ve riske orantılı yanıt vermeyi değerlendirebiliyor. 1
4
OpenAI, test ettiği yapay zekâ sistemlerinde gelişme bildiriyor. Bununla birlikte, uygun ek bilgiyi istemek ve durumun aciliyetini doğru ayarlamak güçlük yaşanan alanlar olmaya devam ediyor. Sunulan bulgular bu yazıda güvenilir bir model sıralaması çıkarmaya yetmiyor; testte daha iyi performans göstermek de her gerçek konuşmada güvenli davranılacağını garanti etmiyor. 1
Şirket, gerçek ChatGPT kullanıcılarının geri bildirimlerini de dikkate aldı. Kullanıcı bakışı uzman değerlendirmesini tamamlayabilir, ancak klinik ve güvenlik ölçütlerinin yerine geçmez. Mevcut kaynaklar kullanıcılarla klinisyenlerin hangi belirli önceliklerde ayrıştığını ortaya koymadığından, bu konuda kesin bir karşıtlık kurmak doğru olmaz. 1
MentalHealthBench bir ölçme aracı; kriz anında yardım sağlayan bir özellik değil. OpenAI ayrıca kriz destek hatlarına erişimi genişlettiğini, bazı hassas konuşmaları daha güvenli modellere yönlendirdiğini ve uzun oturumlarda mola hatırlatmaları eklediğini söylüyor. Bu önlemler de ChatGPT’yi terapi, profesyonel bakım veya acil durumda gerçek dünyadan alınacak yardımın yerine koymuyor. 11
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Açık olarak yayımlanan MentalHealthBench, 1.215 kurgusal konuşmayı 80’den fazla ruh sağlığı uzmanının katkısıyla hazırlanan ölçütlerle değerlendiriyor.
Açık olarak yayımlanan MentalHealthBench, 1.215 kurgusal konuşmayı 80’den fazla ruh sağlığı uzmanının katkısıyla hazırlanan ölçütlerle değerlendiriyor. Test, gündelik kaygılardan acil durumlara uzanıyor; yüksek puan, gerçek hayatta her yanıtın güvenli olacağını veya klinik açıdan iyi sonuç vereceğini göstermiyor.