रिपोर्ट के मुताबिक, Project Lily में AI से ChatGPT के मूल्यांकन कराने वाले कई कॉन्ट्रैक्टर हटाए गए, क्योंकि इस परियोजना का उद्देश्य स्वतंत्र मानवीय राय जुटाना है। Project Lily में कथित तौर पर सैकड़ों कॉन्ट्रैक्टर वास्तविक ChatGPT बातचीत पढ़कर जवाबों को 1 से 7 के पैमाने पर रेट करते हैं; OpenAI की व्यापक रेटिंग पाइपला...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
रिपोर्ट के अनुसार, OpenAI के Project Lily में उन कॉन्ट्रैक्टरों को हटाया गया जिन्होंने ChatGPT के जवाबों का मूल्यांकन करने के लिए जनरेटिव AI का इस्तेमाल किया। इसकी मूल वजह सीधी है: इस परियोजना का मकसद भविष्य के मॉडल व्यवहार को बेहतर करने के लिए स्वतंत्र मानवीय निर्णय जुटाना है। यदि वही निर्णय किसी मॉडल से लिया जाए, तो डेटा यह नहीं बताता कि लोग किस जवाब को बेहतर मानते हैं; वह सिर्फ मॉडल की अपनी पसंद का प्रतिबिंब बन सकता है। 19
20
रिपोर्टिंग के मुताबिक, समीक्षकों को वास्तविक ChatGPT प्रॉम्प्ट और कुछ मामलों में पूरी बातचीत दी जाती है। उन्हें उपयोगकर्ता का आशय संक्षेप में बताना, कई संभावित जवाबों की तुलना करना और उन्हें 1 से 7 के पैमाने पर अंक देना होता है। एक कार्य में अधिकतम चार उम्मीदवार जवाब हो सकते हैं। जोर केवल तथ्यात्मक शुद्धता पर नहीं, बल्कि लहजे, जरूरत से ज्यादा खुशामदी रवैये (sycophancy) और अत्यधिक मानवीय होने के दावों जैसी व्यवहारिक खूबियों पर होता है। 8
19
इन अंकों से वरीयता डेटा तैयार हो सकता है—यानी किसी खास संदर्भ में एक व्यक्ति किस जवाब को दूसरे से बेहतर मानता है, उसका संरचित रिकॉर्ड। मॉडल को वांछित व्यवहार की ओर प्रशिक्षित करने के लिए यह डेटा तभी उपयोगी है, जब निर्णय पर्याप्त रूप से सुसंगत, जानकारीपूर्ण और स्वतंत्र हों।
Project Lily में कथित तौर पर सैकड़ों बाहरी समीक्षक शामिल हैं। रिपोर्ट में कहा गया है कि उनकी भर्ती Crossing Hurdles के जरिए और भुगतान Mercor के माध्यम से होता है; एक समीक्षक ने प्रति घंटे 50 डॉलर से अधिक भुगतान मिलने की बात कही। अलग रिपोर्टिंग में OpenAI की व्यापक रेटिंग पाइपलाइनों में 10,000 से अधिक कॉन्ट्रैक्टरों का उल्लेख है। इस संख्या को केवल Project Lily का आकार नहीं समझना चाहिए। 19
6
AI मूल्यांकन तेज हो सकता है और आंतरिक परीक्षण में उपयोगी भी हो सकता है, लेकिन वह मानव-वरीयता समीक्षा से अलग सवाल का जवाब देता है। कोई मॉडल अपने प्रशिक्षण से सीखे भाषा-पैटर्न, शैली और धारणाओं के अनुरूप जवाबों को प्राथमिकता दे सकता है।
यदि किसी मॉडल—या उससे निकट संबंध वाले मॉडल—का आउटपुट बार-बार अगले मॉडल के जवाबों को पुरस्कृत करने के लिए इस्तेमाल हो, तो एक फीडबैक लूप बन सकता है:
इसका अर्थ यह नहीं कि AI मूल्यांकन का हर उपयोग मॉडल को खराब ही कर देगा। यदि स्वचालित मूल्यांकन को मानव निर्णयों के विरुद्ध परखा जाए और स्पष्ट सीमाओं में इस्तेमाल किया जाए, तो वह उपयोगी हो सकता है। लेकिन जिस काम को खास तौर पर मानव-वरीयता डेटा के लिए कराया जा रहा हो, वहां AI को मानव निर्णय का विकल्प बनाना प्रशिक्षण संकेत की स्वतंत्रता कमजोर करता है। रिपोर्ट के आधार पर यही प्रतिबंध का स्पष्ट कारण लगता है।
रिपोर्टिंग कहती है कि पर्यवेक्षकों को GPTZero जैसे AI-लेखन डिटेक्टरों पर निर्भर नहीं रहने को कहा गया था। इसके बजाय उन्हें काम करने के पैटर्न और लिखित आउटपुट की मानव समीक्षा करनी थी—मिसाल के लिए, असामान्य रूप से एक-जैसी भाषा, विराम-चिह्न या फॉर्मेटिंग के पैटर्न, और अविश्वसनीय रूप से तेज कार्य-समापन जैसे संकेत। 6
इस तरीके की सीमा भी स्पष्ट है: इनमें से कोई एक संकेत अपने-आप में AI इस्तेमाल का सबूत नहीं है। तेज लिखने वाला व्यक्ति अनुभवी हो सकता है और मिलती-जुलती भाषा साझा निर्देशों का नतीजा भी हो सकती है। इसलिए ऐसे संकेत जांच शुरू करने का आधार हो सकते हैं, किसी को परियोजना से हटाने का अकेला निर्णायक प्रमाण नहीं।
संस्थाएं आम तौर पर विस्तृत एंटी-गेमिंग मानदंड सार्वजनिक नहीं करतीं, क्योंकि ऐसी सूची नियम तोड़ने से बचने की गाइड बन सकती है। कॉन्ट्रैक्टर शब्दों को बदल सकते हैं, जानबूझकर देर कर सकते हैं या फॉर्मेट बदल सकते हैं, जबकि असल निर्णय फिर भी किसी मॉडल से करवा रहे हों।
मगर गोपनीयता का दूसरा जोखिम भी है। जब कर्मचारियों या कॉन्ट्रैक्टरों को यह न पता हो कि गुणवत्ता संबंधी निर्णय कैसे लिया गया, तो गलत फैसलों को चुनौती देना कठिन हो जाता है। एक मजबूत व्यवस्था में गोपनीय पहचान विधियों के साथ स्पष्ट नियम, दर्ज निर्णय और अर्थपूर्ण अपील या सुधार की प्रक्रिया होनी चाहिए।
रिपोर्ट के अनुसार, Mercor ने कहा कि इस मूल्यांकन कार्य को करने के लिए AI का इस्तेमाल नीति का उल्लंघन है और पुष्टि होने पर संबंधित परियोजना से तत्काल हटाया जाता है। रिपोर्टिंग में यह भी कहा गया है कि नियम AI सहायता को व्यापक रूप से रोकते थे, जिसमें फीडबैक या टिप्पणियां लिखने वाले उपकरण भी शामिल हैं। 6
40
जानबूझकर खराब रेटिंग देने के एक रिपोर्टेड मामले से बड़ा मुद्दा सामने आता है: सिर्फ इसलिए कि रेटिंग किसी इंसान ने दी है, वह अपने-आप विश्वसनीय नहीं हो जाती। समीक्षक जल्दबाजी कर सकता है, निर्देशों को गलत समझ सकता है, अधिक काम निपटाने पर ध्यान दे सकता है, खराब नीयत से काम कर सकता है या अस्पष्ट गुणवत्ता-प्रणाली को मात देने की कोशिश कर सकता है।
यह तकनीकी समस्या के साथ-साथ प्रोत्साहनों की समस्या भी है। मॉडल डेवलपर को ऐसे संतुलित और ईमानदार निर्णय चाहिए जो वास्तविक उपयोगकर्ताओं के लिए बेहतर व्यवहार का संकेत दें। दूसरी ओर, कॉन्ट्रैक्टर को मुख्यतः गति, काम पूरा करने या अस्वीकृति से बचने के लिए पुरस्कृत किया जा सकता है। जब दोनों के प्रोत्साहन अलग हो जाते हैं, तो डेटा में शोर या व्यवस्थित विकृति आ सकती है।
संदर्भ-निर्भर, व्यक्तिपरक या स्वचालित रूप से सत्यापित करना कठिन निर्णयों में मानव समीक्षा महत्वपूर्ण बनी रहती है। लेकिन यह केवल व्यक्तिगत स्कोरों की धारा के बजाय जांच-परख वाली प्रणाली में सबसे अच्छा काम करती है। व्यावहारिक उपायों में शामिल हैं:
मुख्य बात यह है कि वरीयता-आधारित प्रशिक्षण उतना ही भरोसेमंद है जितनी भरोसेमंद वह प्रक्रिया है जो इन वरीयताओं को बनाती है। मानव समीक्षक गुणवत्ता की कोई जादुई गारंटी नहीं हैं, और जब उद्देश्य लोगों की वास्तविक पसंद समझना हो, तो AI-जनित निर्णय स्वतंत्र मानवीय फीडबैक की जगह नहीं ले सकते।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
रिपोर्ट के मुताबिक, Project Lily में AI से ChatGPT के मूल्यांकन कराने वाले कई कॉन्ट्रैक्टर हटाए गए, क्योंकि इस परियोजना का उद्देश्य स्वतंत्र मानवीय राय जुटाना है।
रिपोर्ट के मुताबिक, Project Lily में AI से ChatGPT के मूल्यांकन कराने वाले कई कॉन्ट्रैक्टर हटाए गए, क्योंकि इस परियोजना का उद्देश्य स्वतंत्र मानवीय राय जुटाना है। Project Lily में कथित तौर पर सैकड़ों कॉन्ट्रैक्टर वास्तविक ChatGPT बातचीत पढ़कर जवाबों को 1 से 7 के पैमाने पर रेट करते हैं; OpenAI की व्यापक रेटिंग पाइपलाइनों में 10,000 से अधिक कॉन्ट्रैक्टर होने का उल्लेख है।
मामला दिखाता है कि केवल किसी इंसान द्वारा दी गई रेटिंग पर्याप्त नहीं होती: गुणवत्ता ऑडिट, एक ही काम की स्वतंत्र समीक्षा और स्पष्ट अपील प्रक्रिया भी जरूरी हैं।