OpenAI dilaporkan menyingkirkan kontraktor yang menggunakan AI untuk membantu menilai modelnya. Masalahnya bukan semata-mata pekerja syarikat AI menggunakan AI. Tugasan ini sepatutnya menghasilkan pertimbangan manusia yang bebas terhadap jawapan ChatGPT. Laporan mengaitkan penyingkiran itu dengan kerja penilaian kontraktor OpenAI secara lebih luas dan mengenal pasti Project Lily sebagai salah satu program semakan manusia; laporan tersebut tidak membuktikan bahawa setiap pekerja yang disingkirkan bertugas dalam Project Lily.
16
13
Apa yang dilakukan penyemak Project Lily?
Menurut laporan, Project Lily menggunakan ratusan kontraktor luar untuk meneliti pertanyaan sebenar kepada ChatGPT dan, dalam sesetengah kes, perbualan yang mengiringinya. Penyemak dilaporkan diambil melalui Crossing Hurdles dan dibayar melalui Mercor. Seorang pekerja berkata dia memperoleh lebih AS$50 sejam, tetapi itu bukan kadar bayaran yang disahkan untuk semua penyemak.
2
20
Penyemak merumuskan perkara yang cuba dicapai pengguna, kemudian mengulas dan memberi skor kepada jawapan calon ChatGPT pada skala 1 hingga 7. Satu tugasan boleh melibatkan sehingga empat jawapan calon. Antara perkara yang dinilai ialah nada, bahasa yang kedengaran seperti robot dan kecenderungan terlalu bersetuju dengan pengguna. Skor serta ulasan bertulis itu bertujuan membantu menambah baik tingkah laku model pada masa depan.
4
11
3
1
Mengapa bantuan AI menjadi masalah?
Penyemak manusia boleh menilai sendiri sama ada sesuatu jawapan benar-benar memenuhi permintaan pengguna atau sekadar terlalu mahu menyenangkan hati mereka. Jika AI lain menulis ulasan atau memilih skor, maklum balas itu mungkin mencerminkan kecenderungan model, bukannya pertimbangan manusia yang bebas. Ini menjejaskan nilai maklum balas tersebut sebagai semakan bebas, tetapi tidak membuktikan bahawa mana-mana skor tertentu yang dibantu AI telah merosakkan model.
4
16
Arahan yang dilaporkan melarang penyemak menggunakan AI untuk menyemak kerja atau menulis maklum balas, termasuk Grammarly dan ciri terjemahan AI. Penyemak yang mengaudit kerja kontraktor lain juga dilarang menggunakan alat pengesan AI, yang disifatkan tidak boleh dipercayai dalam arahan itu.
13
9
Bagaimana penggunaan AI dikesan?
Penyelia dilaporkan memerhatikan petunjuk seperti ungkapan yang berulang dan kedengaran seperti hasil AI, atau tugasan yang disiapkan luar biasa cepat, tanpa bergantung pada skor alat pengesan. Petunjuk itu boleh mendorong pemeriksaan lanjut, tetapi bukan bukti dengan sendirinya. Laporan yang tersedia tidak menunjukkan berapa kerap penyelia berjaya mengesan penggunaan AI atau terlepas pandang.
9
33
Maklum balas yang ditulis tanpa AI juga tidak semestinya baik: seseorang masih boleh memilih skor yang buruk dengan sengaja atau bekerja secara cuai. Laporan yang diberikan tidak mengesahkan dakwaan khusus bahawa seorang kontraktor mengaku sengaja memilih skor yang buruk, jadi keadaan dan kekerapan perkara itu tidak dapat dipastikan. Pengajarannya lebih terbatas tetapi penting: label dinilai manusia menunjukkan siapa yang memberi maklum balas, bukan menjamin setiap penilaian itu tepat. Kualiti penilaian itu sendiri tetap perlu diperiksa.
1
4
Ada satu lagi isu bagi pengguna. Penyemak Project Lily mungkin melihat teks perbualan sebenar, manakala penapis privasi OpenAI yang dilaporkan mungkin tidak membuang semua butiran sensitif. Justeru, cara perbualan pengguna dikendalikan sama pentingnya dengan integriti proses penilaian.
8
12