OpenAI dilaporkan mencopot sejumlah kontraktor yang memakai AI untuk membantu mengevaluasi modelnya. Persoalannya bukan sekadar pekerja di perusahaan AI menggunakan AI. Pekerjaan ini justru dimaksudkan untuk menghasilkan penilaian manusia yang independen atas jawaban ChatGPT. Pemberitaan mengaitkan pencopotan tersebut dengan pekerjaan evaluasi kontraktor OpenAI secara lebih luas, sementara Project Lily disebut sebagai salah satu program yang mengandalkan peninjauan manusia. Belum ada dasar untuk menyimpulkan bahwa semua pekerja yang dicopot bertugas di Project Lily.
16
13
Apa yang dikerjakan penilai di Project Lily?
Menurut laporan, Project Lily melibatkan ratusan kontraktor luar untuk meninjau permintaan nyata yang dikirim pengguna ke ChatGPT dan, dalam sejumlah kasus, percakapan di sekitarnya. Para penilai disebut direkrut melalui Crossing Hurdles dan menerima pembayaran melalui Mercor. Seorang pekerja melaporkan penghasilan lebih dari US$50 per jam, tetapi angka itu bukan tarif yang terverifikasi berlaku bagi semua penilai.
2
20
Penilai merangkum apa yang ingin dicapai pengguna, lalu mengkritik dan memberi skor pada beberapa calon jawaban ChatGPT dalam skala 1–7. Menurut laporan, satu tugas dapat memuat hingga empat calon jawaban. Penilaian mencakup hal-hal seperti nada bicara, bahasa yang terasa kaku atau seperti robot, dan kecenderungan terlalu mengiyakan pengguna. Skor serta kritik tertulis itu dimaksudkan untuk membantu memperbaiki perilaku model berikutnya.
4
11
3
1
Mengapa bantuan AI justru menjadi masalah?
Penilai manusia diharapkan memberi sudut pandang tersendiri: apakah jawaban benar-benar menanggapi kebutuhan pengguna, misalnya, atau malah terlalu berusaha menyenangkan mereka. Bila AI lain yang menyusun kritik atau memilih skor, penilaian itu bisa mencerminkan kecenderungan sebuah model, bukan pertimbangan independen seseorang. Ini adalah risiko terhadap mutu umpan balik, bukan bukti bahwa setiap penilaian yang dibantu AI telah merugikan model.
4
16
Petunjuk kerja yang dilaporkan melarang penggunaan AI untuk meninjau pekerjaan atau menulis umpan balik, termasuk fitur AI pada Grammarly dan alat terjemahan berbasis AI. Penilai yang memeriksa pekerjaan kontraktor lain juga dilarang memakai alat pendeteksi AI, yang dalam petunjuk tersebut dinilai tidak andal.
13
9
Bagaimana dugaan pelanggaran diperiksa?
Alih-alih mengandalkan skor dari alat pendeteksi, pengawas dilaporkan memperhatikan pola seperti pilihan kata yang berulang dan terasa seperti tulisan AI, atau tugas yang selesai sangat cepat. Tanda-tanda itu dapat menjadi alasan untuk memeriksa lebih lanjut, tetapi bukan bukti dengan sendirinya. Laporan yang tersedia juga tidak menunjukkan seberapa sering pengawas tepat menemukan penggunaan AI atau justru luput mendeteksinya.
9
33
Masalah keandalan tidak berhenti pada penggunaan AI. Manusia pun bisa memberi skor buruk dengan sengaja atau bekerja secara ceroboh. Laporan yang tersedia tidak memverifikasi pengakuan spesifik tentang seseorang yang sengaja memilih nilai buruk, sehingga keadaan maupun seberapa sering hal itu terjadi tidak dapat dipastikan. Kesimpulan yang lebih hati-hati: label dinilai manusia menjelaskan siapa yang memberi umpan balik, bukan menjamin setiap penilaiannya tepat. Mutu penilaian itu sendiri tetap perlu diperiksa.
1
4
Bagi pengguna, Project Lily juga menimbulkan pertanyaan terpisah soal privasi. Penilai dapat melihat isi percakapan nyata, sementara penyaring privasi OpenAI yang dilaporkan digunakan sebelum peninjauan mungkin tidak selalu menghapus detail sensitif. Karena itu, cara percakapan ditangani sama pentingnya dengan keandalan proses penilaiannya.
8
12