OpenAI dilaporkan menyingkirkan beberapa kontraktor yang menggunakan AI untuk melakukan kerja penilaian ChatGPT kerana Project Lily bertujuan mengumpul pertimbangan manusia yang bebas, bukannya maklum balas dijana model. Project Lily dilaporkan melibatkan ratusan kontraktor yang membaca serta menilai perbualan seben...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, menurut laporan 404 Media, ialah operasi semakan manusia yang menggunakan kontraktor untuk menilai respons ChatGPT bagi membantu memperbaik tingkah laku model pada masa hadapan. Itulah sebab utama kontraktor yang menggunakan AI generatif untuk membuat penilaian tersebut dilaporkan disingkirkan: nilai data itu sepatutnya datang daripada pertimbangan manusia yang bebas. Jika model yang memberikan pertimbangan, proses itu tidak lagi benar-benar mengukur pilihan manusia. 19
20
Aliran kerja yang dilaporkan memberi penyemak prompt ChatGPT sebenar dan, dalam sesetengah kes, keseluruhan perbualan. Mereka merumuskan niat pengguna, membandingkan respons calon dan memberikan skor pada skala 1 hingga 7. Laporan menyebut sehingga empat jawapan calon bagi satu tugasan, dengan tumpuan pada ciri tingkah laku seperti nada, pujian berlebihan atau sycophancy (terlalu mengampu), serta dakwaan yang terlalu menyerupai manusia — bukan sekadar ketepatan fakta. 8
19
Penilaian itu boleh menjadi data keutamaan: rekod berstruktur tentang respons yang dianggap lebih baik oleh seseorang dalam konteks tertentu. Data sedemikian berguna untuk melaras model ke arah tingkah laku yang dikehendaki hanya jika pertimbangannya cukup konsisten, berasaskan pemahaman dan bebas.
Project Lily dilaporkan melibatkan ratusan penyemak luar. Mereka dikatakan direkrut melalui Crossing Hurdles dan dibayar menerusi Mercor, dengan seorang penyemak melaporkan bayaran melebihi AS$50 sejam. Secara berasingan, laporan mengenai operasi penilaian OpenAI yang lebih luas menyebut lebih daripada 10,000 kontraktor merentas saluran penarafannya; angka itu tidak sepatutnya dianggap sebagai jumlah tenaga kerja Project Lily sahaja. 19
6
AI sebagai penilai mungkin pantas dan kadangkala berguna untuk ujian dalaman, tetapi ia menjawab soalan yang berbeza daripada semakan keutamaan manusia. Model cenderung mengulang corak yang dipelajarinya daripada latihan, dan mungkin memilih respons yang menggunakan frasa, gaya atau andaian yang sudah biasa baginya.
Jika output daripada sebuah model, atau model yang berkait rapat dengannya, berulang kali digunakan untuk memberi ganjaran kepada output model pada masa hadapan, satu gelung maklum balas boleh terbentuk:
Ini tidak membuktikan bahawa setiap penggunaan AI untuk penilaian akan menjadikan model lebih buruk. Penilaian automatik boleh bernilai jika disahkan berbanding pertimbangan manusia dan digunakan dengan had yang jelas. Namun, menggantikannya bagi tugasan yang khusus ditugaskan untuk mengumpul data keutamaan manusia akan melemahkan kebebasan isyarat latihan — dan itulah sebab yang nampaknya mendasari larangan tersebut.
Laporan itu menyatakan penyelia diarahkan supaya tidak bergantung pada pengesan tulisan AI seperti GPTZero. Sebaliknya, mereka perlu meneliti corak kerja dan hasil tulisan secara semakan manusia, termasuk petunjuk seperti frasa yang terlalu seragam, corak tanda baca atau pemformatan, serta tugasan yang disiapkan pada kelajuan yang tidak munasabah. 6
Pendekatan itu mempunyai kelemahan jelas: tiada satu pun petunjuk ini sahaja membuktikan seseorang pekerja menggunakan AI. Penulis pantas mungkin memang berpengalaman, manakala bahasa yang serupa mungkin berpunca daripada rubrik bersama. Oleh itu, penggunaan petunjuk tersebut secara adil bergantung pada proses semakan yang dapat membezakan sebab untuk menyiasat daripada bukti yang cukup kuat untuk menyingkirkan seseorang daripada projek.
Organisasi lazimnya tidak menerbitkan kriteria terperinci bagi mencegah manipulasi kerana senarai semak yang tepat boleh menjadi panduan untuk mengelak pengesanan. Kontraktor boleh mengubah ayat, sengaja melambatkan kerja atau menukar format, tetapi masih menyerahkan pertimbangan kepada model.
Namun, kerahsiaan juga membawa risiko tersendiri. Apabila pekerja tidak tahu bagaimana keputusan kualiti dibuat, kesilapan lebih sukar dicabar. Program integriti yang mampan memerlukan kaedah pengesanan sulit, di samping peraturan jelas, keputusan yang didokumenkan serta proses rayuan atau pembetulan yang bermakna.
Mercor dilaporkan menyatakan bahawa penggunaan AI untuk melaksanakan kerja penilaian ini melanggar dasar, dan kes yang disahkan akan menyebabkan penyingkiran segera daripada projek berkaitan. Laporan juga menyebut peraturan itu melarang bantuan AI dengan lebih meluas, termasuk alat yang digunakan untuk menulis maklum balas atau ulasan. 6
40
Kes penilaian sengaja dibuat buruk yang dilaporkan menunjukkan isu lebih besar: “maklum balas manusia” tidak serta-merta boleh dipercayai hanya kerana seorang manusia menghantarnya. Penyemak mungkin tergesa-gesa, salah faham rubrik, mengutamakan jumlah tugasan siap, bertindak dengan niat buruk atau cuba mempermainkan sistem kualiti yang kabur.
Ini ialah masalah insentif, sama seperti masalah teknikal. Pembangun model memerlukan pertimbangan yang teliti, ikhlas dan diselaraskan dengan tingkah laku yang lebih baik dalam dunia sebenar. Sebaliknya, kontraktor mungkin lebih diberi ganjaran atas kelajuan, penyelesaian tugasan atau mengelakkan penolakan. Apabila insentif ini tidak sehaluan, data yang terhasil boleh menjadi bising atau terpesong secara sistematik.
Semakan manusia kekal penting bagi pertimbangan yang bergantung pada konteks, bersifat subjektif atau sukar disahkan secara automatik. Namun, ia lebih berkesan sebagai sistem semak dan imbang, bukan sekadar aliran skor individu. Antara perlindungan praktikal ialah:
Inti patinya mudah: latihan berasaskan keutamaan hanya boleh dipercayai setakat proses yang menghasilkan keutamaan itu boleh dipercayai. Penyemak manusia bukan jaminan ajaib untuk kualiti, dan penilaian dijana AI tidak boleh begitu sahaja menggantikan maklum balas manusia yang bebas apabila matlamatnya adalah memahami perkara yang benar-benar dihargai oleh manusia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI dilaporkan menyingkirkan beberapa kontraktor yang menggunakan AI untuk melakukan kerja penilaian ChatGPT kerana Project Lily bertujuan mengumpul pertimbangan manusia yang bebas, bukannya maklum balas dijana model.
OpenAI dilaporkan menyingkirkan beberapa kontraktor yang menggunakan AI untuk melakukan kerja penilaian ChatGPT kerana Project Lily bertujuan mengumpul pertimbangan manusia yang bebas, bukannya maklum balas dijana model. Project Lily dilaporkan melibatkan ratusan kontraktor yang membaca serta menilai perbualan sebenar ChatGPT, manakala lebih 10,000 kontraktor merujuk kepada keseluruhan saluran penarafan berkaitan OpenAI.
Kes ini menunjukkan bahawa maklum balas manusia tidak semestinya teliti atau bebas hanya kerana ia dihantar oleh manusia; sistem latihan memerlukan audit dan semakan kualiti yang kukuh.