أُزيل، بحسب التقارير، عدد من المتعاقدين من مهام تقييم ChatGPT بعدما استخدموا الذكاء الاصطناعي في إنجاز التقييم، رغم أن مشروع «ليلي» مصمم لجمع أحكام بشرية مستقلة. يضم مشروع «ليلي» مئات المراجعين الذين يقيّمون محادثات حقيقية مع ChatGPT، فيما يشير رقم يتجاوز 10,000 متعاقد إلى منظومة التقييم الأوسع، لا إلى حجم المشروع و...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
تقول تقارير إن «مشروع ليلي» (Project Lily) هو عملية مراجعة بشرية يُقيّم فيها متعاقدون ردود ChatGPT للمساعدة في تحسين سلوكه مستقبلاً. ومن هنا يأتي سبب إزالة متعاقدين، بحسب ما نشره موقع 404 Media، بعد استخدامهم الذكاء الاصطناعي التوليدي لإجراء التقييم: فالقيمة المقصودة من هذه البيانات هي الحكم البشري المستقل. وعندما يصدر الحكم من نموذج بدلاً من الإنسان، لا تعود المنظومة تقيس بوضوح ما يفضله الناس فعلاً. 19
20
يتلقى المراجعون مطالبات حقيقية أرسلها مستخدمو ChatGPT، وأحياناً محادثات كاملة، ثم يلخّصون مقصد المستخدم ويقارنون بين إجابات مرشحة ويمنحونها درجات من 1 إلى 7. وتشير التقارير إلى وجود ما يصل إلى أربع إجابات مرشحة في المهمة الواحدة، مع تركيز على خصائص سلوكية مثل النبرة، والمبالغة في الإطراء أو التملّق، والادعاءات التي توحي بإنسانية النموذج؛ وليس على الدقة الواقعية وحدها. 8
19
ويمكن أن تتحول هذه الدرجات إلى بيانات تفضيل: سجل منظم يبيّن أي إجابة يراها شخص أفضل في سياق معين. وتفيد هذه البيانات في توجيه النموذج نحو سلوك مرغوب فيه، لكن بشرط أن تكون الأحكام متسقة ومدروسة ومستقلة.
وبحسب التقارير، يعمل في «مشروع ليلي» مئات المراجعين الخارجيين، ويُستقطبون عبر Crossing Hurdles وتُدار مدفوعاتهم عبر Mercor، وقد أفاد أحد المراجعين بتقاضٍ يزيد على 50 دولاراً في الساعة. وفي المقابل، يرد في تقارير عن عمليات التقييم الأوسع المرتبطة بـOpenAI رقم يتجاوز 10,000 متعاقد عبر مسارات التقييم المختلفة؛ ولا ينبغي اعتبار هذا الرقم حجم «مشروع ليلي» وحده. 19
6
قد يكون المقيم الآلي سريعاً ومفيداً أحياناً في الاختبارات الداخلية، لكنه يجيب عن سؤال مختلف عن سؤال «ماذا يفضّل البشر؟». فالنموذج يميل إلى إعادة إنتاج الأنماط والأساليب والافتراضات التي تعلّمها سابقاً.
وعندما يُستخدم ناتج نموذج، أو نموذج قريب منه، مراراً لمكافأة مخرجات نماذج لاحقة، يمكن أن تتشكل حلقة تغذية راجعة:
ولا يعني ذلك أن كل استخدام للذكاء الاصطناعي في التقييم يُضعف النموذج بالضرورة. فقد تكون التقييمات الآلية نافعة حين تُقارن وتُثبت موثوقيتها أمام الحكم البشري وتُستخدم ضمن حدود واضحة. لكن إحلالها محل العمل الذي طُلب أصلاً بوصفه بيانات تفضيل بشرية يضعف استقلالية إشارة التدريب؛ ويبدو أن هذا هو السبب وراء حظرها في السياسة المبلّغ عنها.
تقول التقارير إن المشرفين طُلب منهم عدم الاعتماد على كواشف الكتابة بالذكاء الاصطناعي مثل GPTZero. وبدلاً من ذلك، يُفترض أن يراجعوا أنماط العمل والنصوص بأنفسهم، بحثاً عن مؤشرات مثل الصياغة المتشابهة على نحو غير معتاد، أو أنماط علامات الترقيم والتنسيق، أو إنجاز المهام بسرعة يصعب تصديقها. 6
لكن أياً من هذه المؤشرات لا يثبت، بمفرده، أن العامل استخدم الذكاء الاصطناعي. فقد يكون الكاتب السريع ذا خبرة، وقد تعكس الصياغة المتقاربة دليلاً تعليمياً مشتركاً. لذلك تتوقف عدالة هذا النهج على التمييز بين علامة تستدعي التحقيق ودليل كافٍ لاستبعاد شخص من مشروع.
تميل المؤسسات عادة إلى عدم كشف معايير مكافحة التحايل بالتفصيل، لأن القائمة الدقيقة قد تتحول إلى دليل لتجاوز الضوابط. فمن السهل حينها تغيير الكلمات، أو إبطاء وتيرة التسليم، أو تبديل التنسيق، مع الاستمرار في إسناد الأحكام إلى نموذج.
لكن للسرية ثمن أيضاً: فعندما لا يعرف العامل كيف اتُخذ قرار الجودة، يصعب الاعتراض على الأخطاء. لذا يحتاج برنامج النزاهة المتماسك إلى وسائل رصد سرية، إلى جانب قواعد واضحة وقرارات موثقة ومسار فعّال للطعن أو التصحيح.
ذكرت التقارير أن Mercor قالت إن استخدام الذكاء الاصطناعي لإنجاز أعمال التقييم هذه يخالف السياسة، وإن الحالات المؤكدة تؤدي إلى الإزالة الفورية من المشروع المعني. كما أفادت التقارير بأن القواعد تحظر المساعدة بالذكاء الاصطناعي على نطاق أوسع، بما في ذلك الأدوات المستخدمة لصياغة الملاحظات أو التعليقات. 6
40
توضح واقعة أُبلغ عنها عن تعمد منح تقييمات سيئة أن «التغذية الراجعة البشرية» ليست موثوقة تلقائياً لمجرد أن إنساناً أدخلها. فقد يتعجل المراجع، أو يسيء فهم الدليل، أو يركز على عدد المهام المنجزة، أو يتصرف بسوء نية، أو يحاول التحايل على أنظمة جودة غير شفافة.
وهذه مشكلة حوافز بقدر ما هي مشكلة تقنية. فمطور النموذج يحتاج إلى أحكام دقيقة وحسنة النية تقود إلى سلوك أفضل للمستخدمين في الواقع. أما المتعاقد فقد يُكافأ أساساً على السرعة أو إتمام المهام أو تجنب الرفض. وعندما تتباعد هذه الحوافز، تصبح البيانات الناتجة مشوشة أو منحازة بصورة منهجية.
تظل المراجعة البشرية مهمة للأحكام السياقية والذاتية أو التي يصعب التحقق منها آلياً، لكنها تكون أفضل حين تعمل ضمن منظومة تدقيق لا كسيل بسيط من الدرجات الفردية. ومن الضمانات العملية:
الخلاصة بسيطة: موثوقية تدريب النماذج على التفضيلات لا تتجاوز موثوقية العملية التي تنتج تلك التفضيلات. فالمراجع البشري ليس ضماناً سحرياً للجودة، كما أن الأحكام المولدة بالذكاء الاصطناعي لا تصلح بديلاً مباشراً عن تغذية راجعة بشرية مستقلة عندما يكون الهدف هو معرفة ما يقدّره الناس بالفعل.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أُزيل، بحسب التقارير، عدد من المتعاقدين من مهام تقييم ChatGPT بعدما استخدموا الذكاء الاصطناعي في إنجاز التقييم، رغم أن مشروع «ليلي» مصمم لجمع أحكام بشرية مستقلة.
أُزيل، بحسب التقارير، عدد من المتعاقدين من مهام تقييم ChatGPT بعدما استخدموا الذكاء الاصطناعي في إنجاز التقييم، رغم أن مشروع «ليلي» مصمم لجمع أحكام بشرية مستقلة. يضم مشروع «ليلي» مئات المراجعين الذين يقيّمون محادثات حقيقية مع ChatGPT، فيما يشير رقم يتجاوز 10,000 متعاقد إلى منظومة التقييم الأوسع، لا إلى حجم المشروع وحده.
تكشف الواقعة أن إدخال تقييم بشري لا يضمن وحده جودة البيانات؛ إذ تتطلب أنظمة مواءمة الذكاء الاصطناعي تدقيقاً ومعايرة وحوافز لا تكافئ السرعة على حساب الدقة.