Kontraktor dilaporkan dicopot dari Project Lily setelah memakai AI untuk mengerjakan penilaian ChatGPT, padahal program tersebut dirancang untuk mengumpulkan preferensi manusia yang independen. Ratusan peninjau Project Lily dilaporkan membaca percakapan ChatGPT nyata dan memberi skor 1–7; angka lebih dari 10.000 kon...
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, menurut laporan 404 Media, adalah operasi peninjauan oleh manusia: kontraktor menilai jawaban ChatGPT untuk membantu memperbaiki perilaku model pada masa mendatang. Itulah alasan utama mengapa kontraktor yang memakai AI generatif untuk melakukan penilaian tersebut dilaporkan dicopot dari proyek. Nilai datanya seharusnya berasal dari pertimbangan manusia yang independen. Bila sebuah model yang memberikan penilaiannya, proses itu tidak lagi secara bersih mengukur preferensi manusia. 19
20
Dalam alur kerja yang dilaporkan, peninjau menerima prompt ChatGPT nyata dan, pada beberapa kasus, percakapan utuh. Mereka merangkum maksud pengguna, membandingkan jawaban kandidat, lalu memberi skor pada skala 1–7. Satu tugas dapat memuat hingga empat jawaban kandidat. Fokusnya adalah kualitas perilaku—misalnya nada jawaban, sikap terlalu menjilat atau sycophantic, serta klaim yang terlalu menyerupai manusia—bukan sekadar ketepatan fakta. 8
19
Penilaian itu dapat menjadi data preferensi: catatan terstruktur mengenai jawaban mana yang dinilai seseorang lebih baik dalam konteks tertentu. Data semacam ini berguna untuk menyetel perilaku model hanya jika penilaiannya cukup konsisten, memahami pedoman, dan dibuat secara independen.
Project Lily dilaporkan melibatkan ratusan peninjau eksternal. Mereka disebut direkrut melalui Crossing Hurdles dan dibayar melalui Mercor; seorang peninjau melaporkan bayaran di atas US$50 per jam. Secara terpisah, pelaporan mengenai operasi evaluasi OpenAI yang lebih luas menyebut lebih dari 10.000 kontraktor di berbagai jalur pemeringkatan. Angka itu tidak boleh dianggap sebagai jumlah peninjau Project Lily saja. 19
6
AI sebagai penilai memang dapat bekerja cepat dan terkadang berguna untuk pengujian internal. Namun, ia menjawab pertanyaan yang berbeda dari peninjauan preferensi manusia. Model cenderung mengulang pola yang dipelajari selama pelatihan dan bisa lebih menyukai jawaban dengan frasa, gaya, atau asumsi yang sudah akrab baginya.
Jika keluaran dari suatu model—atau model yang sangat berkaitan—berulang kali dipakai untuk memberi ganjaran pada keluaran model berikutnya, sebuah lingkaran umpan balik dapat terbentuk:
Ini bukan berarti setiap penggunaan evaluasi AI pasti memperburuk model. Evaluasi otomatis dapat bermanfaat bila divalidasi terhadap penilaian manusia dan dipakai dengan batas yang jelas. Namun, menggantikannya dalam tugas yang secara khusus ditugaskan sebagai data preferensi manusia akan melemahkan independensi sinyal pelatihan. Itulah tampaknya alasan kebijakan tersebut melarang penggunaannya.
Menurut pelaporan, supervisor diminta untuk tidak mengandalkan detektor tulisan AI seperti GPTZero. Sebaliknya, mereka diminta meninjau pola kerja dan hasil tulisan secara manual, termasuk sinyal seperti frasa yang terlalu seragam, pola tanda baca atau format, serta waktu penyelesaian yang terasa tidak masuk akal cepatnya. 6
Pendekatan ini punya keterbatasan jelas: tidak satu pun sinyal tersebut, jika berdiri sendiri, membuktikan seseorang memakai AI. Penulis yang cepat bisa saja berpengalaman, sementara kemiripan bahasa dapat muncul karena semua orang mengikuti rubrik yang sama. Karena itu, sinyal semacam ini semestinya menjadi alasan untuk menyelidiki, bukan bukti tunggal yang langsung cukup untuk mengeluarkan pekerja dari proyek.
Organisasi umumnya tidak membeberkan aturan anti-kecurangan secara detail karena daftar periksa yang presisi dapat berubah menjadi panduan untuk mengakalinya. Kontraktor bisa mengubah pilihan kata, sengaja memperlambat pengerjaan, atau mengganti format, sambil tetap menyerahkan penilaian kepada model.
Namun, kerahasiaan juga membawa risiko. Ketika pekerja tidak memahami dasar keputusan kualitas, kekeliruan akan lebih sulit digugat. Program integritas yang kuat membutuhkan metode deteksi yang tetap rahasia, tetapi juga aturan yang jelas, keputusan yang terdokumentasi, serta jalur banding atau koreksi yang benar-benar bermakna.
Mercor dilaporkan menyatakan bahwa penggunaan AI untuk melakukan pekerjaan evaluasi tersebut melanggar kebijakan. Untuk kasus yang terkonfirmasi, konsekuensinya adalah pencopotan segera dari proyek terkait. Pelaporan juga menyebut aturan itu melarang bantuan AI secara lebih luas, termasuk alat untuk menulis umpan balik atau komentar. 6
40
Laporan mengenai penilaian buruk yang sengaja diberikan menunjukkan persoalan yang lebih mendasar: “umpan balik manusia” tidak otomatis dapat diandalkan hanya karena dikirim oleh manusia. Peninjau bisa terburu-buru, salah memahami rubrik, mengejar jumlah tugas, bertindak tidak beritikad baik, atau berusaha memainkan sistem kontrol kualitas yang tidak transparan.
Ini adalah persoalan insentif, bukan semata masalah teknis. Pengembang model memerlukan penilaian yang terkalibrasi dan dilakukan dengan itikad baik agar perilaku model di dunia nyata membaik. Sebaliknya, kontraktor mungkin terutama terdorong oleh kecepatan, penyelesaian tugas, atau upaya menghindari penolakan pekerjaan. Saat insentif itu tidak sejalan, data yang dihasilkan dapat menjadi berisik atau bahkan terdistorsi secara sistematis.
Peninjauan manusia tetap penting untuk penilaian yang kontekstual, subjektif, atau sulit diverifikasi secara otomatis. Namun, sistem ini paling efektif bila dibangun sebagai rangkaian pemeriksaan, bukan sekadar aliran skor dari individu. Sejumlah pengamanan praktis mencakup:
Intinya sederhana: pelatihan berbasis preferensi hanya dapat dipercaya sejauh proses yang menghasilkan preferensi tersebut juga dapat dipercaya. Peninjau manusia bukan jaminan ajaib atas kualitas, dan penilaian buatan AI tidak bisa begitu saja menggantikan umpan balik manusia yang independen ketika tujuannya adalah memahami apa yang sungguh-sungguh dihargai manusia.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Kontraktor dilaporkan dicopot dari Project Lily setelah memakai AI untuk mengerjakan penilaian ChatGPT, padahal program tersebut dirancang untuk mengumpulkan preferensi manusia yang independen.
Kontraktor dilaporkan dicopot dari Project Lily setelah memakai AI untuk mengerjakan penilaian ChatGPT, padahal program tersebut dirancang untuk mengumpulkan preferensi manusia yang independen. Ratusan peninjau Project Lily dilaporkan membaca percakapan ChatGPT nyata dan memberi skor 1–7; angka lebih dari 10.000 kontraktor merujuk pada seluruh jalur penilaian terkait OpenAI, bukan Project Lily saja.
Kasus ini menegaskan bahwa umpan balik manusia tidak otomatis berkualitas: sistem tetap memerlukan kalibrasi, audit, penilaian tumpang tindih, serta mekanisme banding dan koreksi.