أُبعد متعاقدون، وفق تقارير، بعدما استخدموا الذكاء الاصطناعي في عمل يُفترض أن يقدّم تقييماً بشرياً لردود ChatGPT. في «مشروع ليلي»، يلخّص المراجعون طلب المستخدم ويقيّمون ردوداً محتملة بدرجات من 1 إلى 7؛ وقال أحد العاملين إن أجره تجاوز 50 دولاراً في الساعة.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
أُبعد متعاقدون، وفق تقارير، بعدما استخدموا الذكاء الاصطناعي في عمل يُفترض أن يقدّم تقييماً بشرياً لردود ChatGPT.
في «مشروع ليلي»، يلخّص المراجعون طلب المستخدم ويقيّمون ردوداً محتملة بدرجات من 1 إلى 7؛ وقال أحد العاملين إن أجره تجاوز 50 دولاراً في الساعة.
يراقب المشرفون أنماط العمل المريبة بدلاً من الاعتماد على برامج كشف النصوص المولّدة، لكن الاشتباه لا يثبت المخالفة وحده.
Why did OpenAI remove contractors from Project Lily for using AI tools to evaluate ChatGPT responses, how does the project recruit and pay hAI-generated editorial illustration; it does not depict a Project Lily reviewer or workplace.
موجّه الذكاء الاصطناعي
Create a landscape editorial hero image for this Studio Global article: Why did OpenAI remove contractors from Project Lily for using AI tools to evaluate ChatGPT responses, how does the project recruit and pay h. Article summary: OpenAI reportedly removed contractors because Project Lily pays for independent *human* judgments about ChatGPT replies; using AI to produce those judgments breaks the project’s rules and risks feeding model-generated ju. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
openai.com
قد يبدو غريباً أن تُبعد شركة تعمل في الذكاء الاصطناعي أشخاصاً لاستخدامهم الذكاء الاصطناعي. لكن الفارق هنا هو طبيعة المهمة: فقد أُبعد متعاقدون، وفق تقارير، لاستخدامهم أدوات ذكاء اصطناعي في عمل يُفترض أن يقدّم أحكاماً بشرية مستقلة على ردود ChatGPT. وتربط التقارير هذه الاستبعادات بعمل أوسع لتقييم نماذج OpenAI، وتعرض «مشروع ليلي» مثالاً على المراجعة البشرية؛ لكنها لا تثبت أن كل من أُبعد كان يعمل في المشروع نفسه.1613
ماذا يفعل المراجعون في «مشروع ليلي»؟
بحسب التقارير، يستعين المشروع بمئات المتعاقدين الخارجيين لمراجعة طلبات حقيقية أرسلها مستخدمون إلى ChatGPT، وأحياناً المحادثات المحيطة بها. وتشير التقارير إلى استقطاب المراجعين عبر Crossing Hurdles ودفع أجورهم عبر Mercor. وقال أحد العاملين إن أجره تجاوز 50 دولاراً في الساعة، لكن لا يمكن تعميم هذا الرقم على جميع المراجعين.220
يلخّص المراجع ما يحاول المستخدم إنجازه، ثم ينتقد ردوداً محتملة من ChatGPT ويمنحها درجات على مقياس من 1 إلى 7. وتصف التقارير مهام تضم ما يصل إلى أربعة ردود محتملة، مع الاهتمام بنبرة الرد، والصياغة التي تبدو آلية، والمبالغة في موافقة المستخدم. والمقصود أن تساعد الدرجات والملاحظات المكتوبة على تحسين سلوك النماذج لاحقاً.41131
لماذا لا يصلح أن يكتب الذكاء الاصطناعي التقييم؟
قيمة المراجع البشري أنه يستطيع أن يحكم بصورة مستقلة: هل لبّى الرد طلب المستخدم؟ وهل بدا متملقاً أو آلياً؟ إذا تولّت أداة ذكاء اصطناعي كتابة الملاحظة أو اختيار الدرجة، فقد تعكس النتيجة تفضيلات نموذج آخر بدلاً من تقدير شخص. هذا خطر على قيمة التغذية الراجعة، وليس دليلاً على أن تقييماً بعينه أضرّ بالنموذج.416
وتحظر تعليمات أوردتها التقارير استخدام الذكاء الاصطناعي لمراجعة العمل أو كتابة الملاحظات، بما في ذلك ميزات Grammarly والترجمة المدعومة بالذكاء الاصطناعي. كما تمنع من يدقّقون عمل متعاقدين آخرين من استخدام أدوات كشف النصوص المولّدة آلياً، وتصف تلك الأدوات بأنها غير موثوقة.139
كيف يُرصد الاشتباه، وما حدود الثقة في الدرجات؟
تشير التقارير إلى أن المشرفين ينتبهون إلى أنماط مثل تكرار الصياغات التي تبدو مولّدة آلياً أو إنجاز المهام بسرعة غير معتادة، بدلاً من الاتكال على نتيجة برنامج للكشف. وقد تستدعي هذه المؤشرات مراجعة أقرب، لكنها ليست إثباتاً بمفردها. ولا تُظهر التقارير المتاحة مدى نجاح المشرفين في اكتشاف المخالفات أو عدد الحالات التي قد تفوتهم.933
والتقييم البشري ليس ضمانة تلقائية للجودة أيضاً؛ إذ يمكن لشخص أن يمنح درجة سيئة عن قصد أو يعمل بإهمال. لكن التقارير المتاحة لا تتحقق من واقعة الإقرار المحددة بأن متعاقداً اختار عمداً تقييمات سيئة، ولا تتيح تحديد ظروفها أو مدى انتشارها. لذلك فالخلاصة الأدق هي أن وصف التقييم بأنه «بشري» يبيّن مصدره، لا صحة كل حكم فيه؛ والتحقق من جودة الأحكام يظل ضرورياً.14
وتبرز مسألة أخرى للمستخدمين: قد يرى المراجعون نص محادثات حقيقية، وقد لا يزيل مرشح الخصوصية الذي تستخدمه OpenAI جميع التفاصيل الحساسة، بحسب التقارير. لذا لا تتعلق أهمية هذه العملية بسلامة التقييمات وحدها، بل أيضاً بكيفية التعامل مع محادثات المستخدمين.812
Studio Global AI
مواصلة البحث الخاص بك
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
ما هي الإجابة المختصرة على "لماذا استُبعد مقيّمون استعانوا بالذكاء الاصطناعي لتقييم ChatGPT؟"؟
أُبعد متعاقدون، وفق تقارير، بعدما استخدموا الذكاء الاصطناعي في عمل يُفترض أن يقدّم تقييماً بشرياً لردود ChatGPT.
ما هي النقاط الأساسية التي يجب التحقق منها أولاً؟
أُبعد متعاقدون، وفق تقارير، بعدما استخدموا الذكاء الاصطناعي في عمل يُفترض أن يقدّم تقييماً بشرياً لردود ChatGPT. في «مشروع ليلي»، يلخّص المراجعون طلب المستخدم ويقيّمون ردوداً محتملة بدرجات من 1 إلى 7؛ وقال أحد العاملين إن أجره تجاوز 50 دولاراً في الساعة.
ماذا يجب أن أفعل بعد ذلك في الممارسة العملية؟
يراقب المشرفون أنماط العمل المريبة بدلاً من الاعتماد على برامج كشف النصوص المولّدة، لكن الاشتباه لا يثبت المخالفة وحده.