OpenAI ने कथित तौर पर उन ठेकेदारों को हटाया जिन्होंने उसके मॉडल के मूल्यांकन में AI की मदद ली। वजह सिर्फ यह नहीं थी कि एक AI कंपनी के लिए काम करने वालों ने AI इस्तेमाल किया। इस काम का मकसद ChatGPT के जवाबों पर स्वतंत्र इंसानी राय जुटाना था। अगर समीक्षा या अंक भी AI तैयार करे, तो उस राय की उपयोगिता पर सवाल उठता है। हटाए जाने की खबर OpenAI के व्यापक ठेकेदार-आधारित मूल्यांकन कार्य से जुड़ी है; यह स्थापित नहीं होता कि हटाया गया हर व्यक्ति Project Lily पर ही काम कर रहा था।
16
13
Project Lily में समीक्षक क्या करते हैं?
रिपोर्टों के अनुसार, Project Lily में सैकड़ों बाहरी ठेकेदार वास्तविक ChatGPT अनुरोध और कुछ मामलों में उनसे जुड़ी पूरी बातचीत देखते हैं। समीक्षकों की भर्ती Crossing Hurdles के जरिए और भुगतान Mercor के जरिए होने की जानकारी है। एक कर्मी ने प्रति घंटे 50 अमेरिकी डॉलर से अधिक मिलने की बात कही थी; इसे सभी समीक्षकों की तय दर नहीं माना जा सकता।
2
20
समीक्षक पहले लिखते हैं कि उपयोगकर्ता क्या हासिल करना चाहता था। फिर वे ChatGPT के संभावित जवाबों की आलोचनात्मक समीक्षा करते हैं और उन्हें 1 से 7 तक अंक देते हैं। एक काम में अधिकतम चार संभावित जवाब हो सकते हैं। समीक्षा में जवाब का लहजा, मशीन जैसा लगने वाला लेखन और उपयोगकर्ता की बात से जरूरत से ज्यादा सहमति जैसे पहलू देखे जाते हैं। लिखित टिप्पणियों और अंकों का उद्देश्य भविष्य में मॉडल के व्यवहार को बेहतर बनाने में मदद करना है।
4
11
3
1
AI की मदद लेना समस्या क्यों है?
इंसानी समीक्षक यह स्वतंत्र रूप से तय कर सकता है कि जवाब उपयोगकर्ता की जरूरत पूरी करता है या सिर्फ उसकी हां में हां मिलाता है। लेकिन अगर आलोचना लिखने या अंक चुनने का काम दूसरे AI को सौंप दिया जाए, तो प्रतिक्रिया में इंसान के बजाय मॉडल की पसंद झलक सकती है। इससे फीडबैक का मूल्य घटने का जोखिम है—यह इस बात का प्रमाण नहीं कि AI की मदद से दी गई किसी खास रेटिंग ने मॉडल को नुकसान पहुंचाया।
4
16
रिपोर्ट किए गए निर्देश समीक्षा करने और फीडबैक लिखने के लिए AI के उपयोग पर रोक लगाते हैं; इनमें Grammarly और AI अनुवाद सुविधाएं भी शामिल हैं। दूसरे ठेकेदारों का काम जांचने वाले समीक्षकों को AI-पहचान उपकरण इस्तेमाल न करने को भी कहा गया है। निर्देशों के मुताबिक, ऐसे उपकरण भरोसेमंद नहीं हैं।
13
9
संदिग्ध इस्तेमाल का पता कैसे लगाया जाता है?
रिपोर्टों में बताया गया है कि पर्यवेक्षक AI-जैसी दोहराव वाली भाषा या असामान्य रूप से जल्दी पूरे हुए काम जैसे पैटर्न देखते हैं, न कि केवल AI-पहचान उपकरण के नतीजों पर भरोसा करते हैं। ऐसे संकेत आगे जांच की वजह बन सकते हैं, लेकिन अपने आप में AI इस्तेमाल का सबूत नहीं हैं। उपलब्ध रिपोर्टिंग यह भी नहीं बताती कि पर्यवेक्षक कितनी बार सही पहचान करते हैं या कितने मामले उनकी नजर से छूट जाते हैं।
9
33
सिर्फ इंसान द्वारा दी गई रेटिंग भी गुणवत्ता की गारंटी नहीं है। कोई व्यक्ति लापरवाही से या जानबूझकर गलत अंक दे सकता है। हालांकि, जानबूझकर खराब रेटिंग चुनने की जिस कथित स्वीकारोक्ति का उल्लेख हुआ है, उसकी पुष्टि उपलब्ध रिपोर्टिंग से नहीं होती; इसलिए उसकी परिस्थितियों या ऐसे मामलों की व्यापकता पर निष्कर्ष नहीं निकाला जा सकता। सीख इतनी है कि ‘इंसानी रेटिंग’ बताती है कि फीडबैक किसने दिया, यह नहीं कि हर फैसला सही था। मूल्यांकन की विश्वसनीयता के लिए फैसलों की गुणवत्ता जांचना भी जरूरी है।
1
4
उपयोगकर्ताओं के लिए एक अलग सवाल निजता का है। Project Lily में समीक्षक वास्तविक बातचीत का पाठ देख सकते हैं, और रिपोर्टों के मुताबिक OpenAI का गोपनीयता फ़िल्टर कुछ संवेदनशील विवरण हटाने से चूक सकता है। इसलिए समीक्षाओं की गुणवत्ता के साथ-साथ उपयोगकर्ताओं की बातचीत को संभालने का तरीका भी मायने रखता है।
8
12