รายงานระบุว่าผู้รับจ้างหลายรายถูกนำออกจากงานหลังใช้ AI ทำหน้าที่ประเมิน ChatGPT ทั้งที่ Project Lily มีเป้าหมายเพื่อเก็บคำตัดสินอย่างอิสระจากมนุษย์ Project Lily มีผู้รีวิวภายนอกหลายร้อยคน อ่านและให้คะแนนบทสนทนาจริงของ ChatGPT ขณะที่เครือข่ายงานให้คะแนนที่เกี่ยวข้องกับ OpenAI มีผู้รับจ้างมากกว่า 10,000 คน ซึ่งไม่ใช่จ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
รายงานของ 404 Media ระบุว่า Project Lily เป็นกระบวนการให้มนุษย์ตรวจทานคำตอบของ ChatGPT เพื่อช่วยปรับพฤติกรรมของโมเดลในอนาคต นั่นจึงอธิบายได้ว่าเหตุใดผู้รับจ้างที่ใช้ generative AI มาทำการประเมินแทนจึงถูกนำออกจากโครงการตามรายงาน: คุณค่าของข้อมูลชุดนี้อยู่ที่การตัดสินอย่างอิสระของมนุษย์ ไม่ใช่การให้โมเดลสร้างคำตัดสินขึ้นมาเอง 19
20
ขั้นตอนงานที่มีรายงานระบุว่า ผู้รีวิวจะได้รับพรอมป์ต์จริงของผู้ใช้ ChatGPT และในบางกรณีจะเห็นบทสนทนาทั้งชุด จากนั้นสรุปว่าผู้ใช้ต้องการอะไร เปรียบเทียบคำตอบที่เป็นตัวเลือก และให้คะแนนในสเกล 1–7 โดยหนึ่งงานอาจมีคำตอบให้เปรียบเทียบได้สูงสุด 4 แบบ จุดเน้นไม่ได้อยู่ที่ความถูกต้องของข้อเท็จจริงเพียงอย่างเดียว แต่รวมถึงน้ำเสียง การประจบเอาใจเกินควร (sycophancy) และการอ้างตนคล้ายมีความเป็นมนุษย์มากเกินไป 8
19
คะแนนเหล่านี้สามารถกลายเป็นข้อมูล “ความชอบ” หรือ preference data ซึ่งบันทึกอย่างเป็นระบบว่า ในบริบทหนึ่ง ๆ มนุษย์เห็นว่าคำตอบใดดีกว่า ข้อมูลประเภทนี้มีประโยชน์ต่อการปรับโมเดลก็ต่อเมื่อคำตัดสินมีความสม่ำเสมอ เข้าใจโจทย์ และเป็นอิสระจริง
Project Lily มีผู้รีวิวภายนอกหลายร้อยคนตามรายงาน โดยมีการสรรหาผ่าน Crossing Hurdles และจ่ายเงินผ่าน Mercor ผู้รีวิวรายหนึ่งระบุว่าได้รับค่าตอบแทนมากกว่า 50 ดอลลาร์ต่อชั่วโมง ขณะที่รายงานเกี่ยวกับระบบประเมินผลในวงกว้างของ OpenAI กล่าวถึงผู้รับจ้างมากกว่า 10,000 คนในสายงานให้คะแนนทั้งหมด ตัวเลขหลังนี้จึงไม่ควรถูกตีความว่าเป็นขนาดของ Project Lily เพียงโครงการเดียว 19
6
AI ที่ทำหน้าที่ประเมินอาจรวดเร็วและมีประโยชน์ในงานทดสอบภายในบางประเภท แต่คำถามที่มันตอบไม่เหมือนกับการสำรวจความชอบของมนุษย์ โมเดลมักสะท้อนรูปแบบ ภาษา และสมมติฐานที่มันได้เรียนรู้มาก่อน จึงอาจเอนเอียงไปหาคำตอบที่มีสำนวนหรือโครงสร้างคุ้นเคย
หากนำผลจากโมเดล หรือโมเดลที่มีความใกล้ชิดกัน มาให้รางวัลแก่คำตอบของโมเดลรุ่นถัดไปซ้ำ ๆ อาจเกิดวงจรป้อนกลับได้:
ไม่ได้หมายความว่าการใช้ AI ประเมินทุกกรณีจะทำให้โมเดลแย่ลง การประเมินแบบอัตโนมัติอาจมีประโยชน์หากผ่านการตรวจสอบเทียบกับคำตัดสินของมนุษย์และกำหนดขอบเขตใช้งานชัดเจน แต่การใช้แทนงานที่ว่าจ้างมาเพื่อเก็บข้อมูลความชอบจากมนุษย์โดยเฉพาะ ย่อมลดความเป็นอิสระของสัญญาณฝึกโมเดล ซึ่งน่าจะเป็นเหตุผลของข้อห้ามตามรายงาน
แนวทางสำหรับผู้ดูแลงานที่ถูกกล่าวถึงในรายงานคือ ไม่ให้พึ่งพาเครื่องมือตรวจจับข้อความจาก AI อย่าง GPTZero แต่ให้ดูรูปแบบการทำงานและชิ้นงานด้วยมนุษย์ เช่น ถ้อยคำที่เหมือนกันผิดปกติ รูปแบบเครื่องหมายวรรคตอนหรือการจัดรูปแบบ และเวลาทำงานที่เร็วเกินความเป็นไปได้ 6
อย่างไรก็ดี สัญญาณแต่ละข้อไม่ใช่หลักฐานชี้ขาดว่าใครใช้ AI คนที่พิมพ์เร็วอาจมีประสบการณ์สูง และการใช้ภาษาใกล้เคียงกันอาจเกิดจากเกณฑ์ให้คะแนนชุดเดียวกัน ดังนั้น หากจะใช้สัญญาณเหล่านี้อย่างเป็นธรรม กระบวนการต้องแยกให้ได้ระหว่าง “เหตุให้ตรวจสอบเพิ่มเติม” กับหลักฐานที่หนักแน่นพอจะนำคนออกจากโครงการ
องค์กรโดยทั่วไปมักไม่เผยแพร่เกณฑ์ป้องกันการโกงแบบละเอียด เพราะรายการตรวจสอบที่ชัดเจนอาจกลายเป็นคู่มือหลบเลี่ยงได้ ผู้รับจ้างอาจเปลี่ยนสำนวน จงใจเว้นเวลา หรือปรับรูปแบบข้อความ ทั้งที่ยังให้โมเดลทำคำตัดสินแทน
แต่ความลับก็มีความเสี่ยงเช่นกัน หากผู้ทำงานไม่รู้ว่าการตัดสินคุณภาพเกิดขึ้นจากอะไร การโต้แย้งข้อผิดพลาดย่อมทำได้ยาก ระบบคุ้มครองความน่าเชื่อถือที่ยั่งยืนจึงควรมีทั้งวิธีตรวจจับที่เป็นความลับ กติกาที่ชัดเจน บันทึกการตัดสินใจ และช่องทางอุทธรณ์หรือแก้ไขที่มีความหมาย
Mercor ระบุผ่านรายงานว่า การใช้ AI ทำงานประเมินลักษณะนี้เป็นการละเมิดนโยบาย และหากยืนยันการกระทำได้ ผู้รับจ้างจะถูกนำออกจากโครงการที่เกี่ยวข้องทันที รายงานยังระบุด้วยว่ากฎห้ามใช้ความช่วยเหลือจาก AI ในวงกว้าง รวมถึงเครื่องมือที่ใช้เขียนฟีดแบ็กหรือความเห็น 6
40
กรณีที่มีรายงานว่ามีการให้คะแนนแย่อย่างจงใจ สะท้อนประเด็นใหญ่กว่าเดิม: ข้อมูลที่มนุษย์กรอกไม่ได้หมายความว่าจะน่าเชื่อถือโดยอัตโนมัติ ผู้รีวิวอาจรีบทำงาน ตีความเกณฑ์ผิด มุ่งปริมาณงาน ทำงานโดยไม่สุจริต หรือพยายามเล่นกับระบบตรวจคุณภาพที่ไม่โปร่งใส
นี่เป็นปัญหาเรื่องแรงจูงใจพอ ๆ กับปัญหาทางเทคนิค ผู้พัฒนาโมเดลต้องการคำตัดสินที่รอบคอบและเทียบมาตรฐานได้ เพื่อทำนายว่าพฤติกรรมแบบใดดีกว่าสำหรับผู้ใช้จริง แต่ผู้รับจ้างอาจได้รับแรงจูงใจหลักจากความเร็ว การปิดงาน หรือการไม่ถูกคัดออก เมื่อแรงจูงใจสองฝ่ายไม่ตรงกัน ข้อมูลที่ได้อาจมีสัญญาณรบกวนหรือบิดเบือนอย่างเป็นระบบ
การตรวจโดยมนุษย์ยังสำคัญต่อเรื่องที่ขึ้นกับบริบท เป็นอัตวิสัย หรือตรวจสอบอัตโนมัติได้ยาก แต่จะได้ผลที่สุดเมื่อเป็นระบบตรวจสอบหลายชั้น ไม่ใช่เพียงการรวมคะแนนรายคน แนวทางที่ใช้ได้จริง ได้แก่
บทเรียนสำคัญคือ การฝึกโมเดลจากความชอบจะน่าเชื่อถือได้เท่ากับกระบวนการที่สร้างความชอบเหล่านั้น ผู้รีวิวที่เป็นมนุษย์ไม่ใช่หลักประกันคุณภาพโดยตัวมันเอง และคำตัดสินที่ AI สร้างขึ้นก็ไม่อาจใช้แทนฟีดแบ็กอิสระจากมนุษย์ได้ง่าย ๆ เมื่อเป้าหมายคือการเรียนรู้สิ่งที่ผู้คนให้คุณค่าจริง ๆ
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
รายงานระบุว่าผู้รับจ้างหลายรายถูกนำออกจากงานหลังใช้ AI ทำหน้าที่ประเมิน ChatGPT ทั้งที่ Project Lily มีเป้าหมายเพื่อเก็บคำตัดสินอย่างอิสระจากมนุษย์
รายงานระบุว่าผู้รับจ้างหลายรายถูกนำออกจากงานหลังใช้ AI ทำหน้าที่ประเมิน ChatGPT ทั้งที่ Project Lily มีเป้าหมายเพื่อเก็บคำตัดสินอย่างอิสระจากมนุษย์ Project Lily มีผู้รีวิวภายนอกหลายร้อยคน อ่านและให้คะแนนบทสนทนาจริงของ ChatGPT ขณะที่เครือข่ายงานให้คะแนนที่เกี่ยวข้องกับ OpenAI มีผู้รับจ้างมากกว่า 10,000 คน ซึ่งไม่ใช่จำนวนของ Project Lily เพียงโครงการเดียว
กรณีนี้ชี้ว่า “ฟีดแบ็กจากมนุษย์” ไม่ได้เชื่อถือได้โดยอัตโนมัติ ระบบต้องมีการเทียบมาตรฐาน ตรวจสอบคุณภาพ และออกแบบแรงจูงใจให้เหมาะสม