Masalahnya, penelitian dan analisis keamanan internal menunjukkan bahwa interaksi bermasalah sering berkembang dalam percakapan panjang, di mana tanda‑tanda bahaya muncul secara tidak langsung dan tersebar di beberapa pesan.
Contohnya, seseorang mungkin awalnya hanya membicarakan kelelahan atau stres. Beberapa pesan kemudian, barulah muncul pengakuan tentang kesedihan mendalam atau keputusasaan. Jika sistem tidak mempertimbangkan pesan sebelumnya, tingkat risiko sebenarnya bisa terlewat.
Pembaruan OpenAI bertujuan membuat ChatGPT mampu melakukan deteksi risiko pada level percakapan, bukan sekadar memoderasi pesan satu per satu.
“Safety summaries” adalah catatan singkat yang dibuat secara otomatis oleh sistem selama percakapan tertentu. Alih‑alih menyimpan seluruh transkrip, sistem hanya mencatat informasi yang relevan untuk penilaian keselamatan.
Ringkasan ini membantu model memahami pesan baru dalam konteks tanda peringatan yang sudah muncul sebelumnya.
Karakteristik utamanya meliputi:
Dengan pendekatan ini, sistem mempertahankan konteks yang cukup untuk evaluasi keamanan tanpa harus menyimpan seluruh riwayat percakapan untuk tujuan tersebut.
Ringkasan ini dibuat ketika sistem mendeteksi sinyal yang menunjukkan kemungkinan risiko meningkat dalam percakapan.
Beberapa situasi yang dapat memicu fitur ini antara lain percakapan yang mengandung tanda‑tanda:
Ketika sinyal tersebut muncul, ChatGPT dapat menggunakan ringkasan keselamatan untuk memahami bagaimana percakapan berkembang dan memilih strategi respons yang lebih aman.
Fokus utama pembaruan ini adalah keselamatan terkait kesehatan mental dan krisis emosional.
Upaya keamanan OpenAI di area ini bertujuan meningkatkan kemampuan ChatGPT untuk:
Pengembangan respons ini dilakukan dengan masukan dari lebih dari 170 pakar kesehatan mental, yang membantu menentukan cara terbaik merespons pengguna yang sedang berada dalam kondisi rentan.
Selain itu, perlindungan ini juga menargetkan risiko lain yang dapat muncul dalam interaksi AI yang panjang, seperti diskusi tentang self‑harm, ketergantungan emosional pada sistem AI, atau percakapan yang bisa berkembang menuju tindakan berbahaya.
Menurut OpenAI, pembaruan pada model default ChatGPT meningkatkan kemampuan sistem untuk mengenali dan merespons percakapan yang melibatkan distress mental dan emosional.
Beberapa laporan menyebutkan bahwa pembaruan model yang dikembangkan bersama para klinisi membantu mengurangi respons yang tidak aman dalam pengujian hingga sekitar 65–80% dibandingkan sebelumnya.
Namun, detail metodologi evaluasi—seperti dataset pengujian atau benchmark lengkap—tidak selalu dipublikasikan secara penuh dalam ringkasan penelitian yang tersedia. Karena itu, skala peningkatan sebenarnya tidak sepenuhnya transparan dalam laporan publik.
Dalam konteks pendidikan, pembaruan ini menjawab masalah praktis: risiko pada siswa jarang muncul dalam satu pesan saja.
Banyak pelajar menggunakan AI dalam percakapan panjang—baik untuk belajar, mencari saran, maupun membicarakan masalah pribadi. Dalam situasi seperti ini, tanda distress bisa muncul perlahan.
Fitur keamanan berbasis percakapan dapat membantu mengidentifikasi:
Kemampuan tersebut berpotensi mengurangi risiko respons AI yang tidak aman dalam interaksi panjang—area yang sebelumnya menjadi kelemahan chatbot.
Meski demikian, perlindungan AI tetap hanya satu lapisan pengamanan. Sistem pendidikan masih memerlukan kebijakan perlindungan yang jelas, staf yang terlatih, dan jalur eskalasi nyata untuk membantu siswa yang sedang mengalami kesulitan.
Peluncuran safety summaries mencerminkan perubahan lebih luas dalam cara sistem keamanan AI dirancang.
Alih‑alih hanya memeriksa satu pesan, pengembang kini semakin fokus pada analisis pola sepanjang percakapan. Pendekatan ini lebih mendekati cara interaksi manusia berlangsung—dan cara risiko benar‑benar muncul.
OpenAI menggambarkan pendekatan keamanannya sebagai proses berkelanjutan yang mencakup pelatihan model, evaluasi sebelum rilis, pemantauan setelah peluncuran, serta peningkatan berulang berdasarkan penggunaan di dunia nyata.
Seiring AI percakapan semakin banyak digunakan di sekolah, tempat kerja, dan kehidupan sehari‑hari, kemampuan untuk mendeteksi pola risiko yang muncul secara bertahap kemungkinan akan menjadi standar penting dalam penerapan AI yang bertanggung jawab.