לפי דיווחים, קבלנים הוסרו מעבודת ההערכה לאחר שהשתמשו ב AI, משום שפרויקט Lily נועד להפיק שיפוטים אנושיים עצמאיים ולא משוב שנכתב בידי מודל. בפרויקט Lily מאות קבלנים קוראים שיחות אמיתיות עם ChatGPT, מסכמים את כוונת המשתמש ומדרגים עד ארבע תשובות בסולם של 1–7; הדיווחים על יותר מ 10,000 קבלנים מתייחסים למערכי הדירוג הרחבי...
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
לפי דיווחי 404 Media, פרויקט Lily הוא מערך של ביקורת אנושית שבו קבלנים מעריכים תשובות של ChatGPT כדי לסייע בשיפור התנהגות המודל בעתיד. זה גם מסביר מדוע, לפי הדיווחים, קבלנים שהשתמשו בבינה מלאכותית יוצרת לצורך ההערכה הוסרו מהפרויקט: הערך של הנתונים אמור לנבוע משיפוט אנושי עצמאי. אם המודל הוא שמספק את השיפוט, המערכת כבר אינה מודדת באופן נקי את העדפותיהם של בני אדם. 19
20
הבודקים מקבלים הנחיות אמיתיות שנשלחו ל-ChatGPT, ובחלק מהמקרים גם שיחות מלאות. הם מסכמים את כוונת המשתמש, משווים בין תשובות מועמדות ומעניקים ציונים בסולם של 1–7. לפי הדיווחים, בכל משימה עשויות להופיע עד ארבע תשובות; המיקוד הוא בתכונות התנהגותיות כמו טון, חנופה מוגזמת או נטייה לרצות את המשתמש, וטענות אנושיות מדי מצד הצ'אטבוט — ולא רק בדיוק עובדתי. 8
19
ציונים כאלה יכולים להפוך לנתוני העדפה: תיעוד מובנה של התשובה שאדם רואה כטובה יותר בהקשר מסוים. הנתונים מועילים לכוונון התנהגות המודל רק כאשר השיפוטים עקביים, מבוססים ועצמאיים במידה מספקת.
לפי הדיווחים, בפרויקט Lily מעורבים מאות בודקים חיצוניים. הם מגויסים באמצעות Crossing Hurdles ומקבלים תשלום דרך Mercor; בודק אחד מסר כי השתכר יותר מ-50 דולר לשעה. בנפרד, דיווחים על מערך ההערכה הרחב יותר של OpenAI מזכירים יותר מ-10,000 קבלנים בצינורות דירוג שונים. אין לפרש את המספר הזה כגודלו של Project Lily בלבד. 19
6
מעריך מבוסס AI יכול להיות מהיר ולעיתים שימושי בבדיקות פנימיות, אך הוא עונה על שאלה אחרת מזו של בדיקת העדפות אנושית. מודל נוטה לשחזר דפוסים שלמד באימון שלו, ועשוי להעדיף ניסוחים, סגנון או הנחות שמוכרים לו.
כאשר פלט של מודל — או של מודל קרוב אליו — משמש שוב ושוב לתגמול פלטים של דורות עתידיים, עלולה להיווצר לולאת משוב:
אין בכך הוכחה שכל שימוש ב-AI לצורכי הערכה בהכרח מחמיר מודל. הערכה אוטומטית יכולה להיות שימושית כאשר היא מאומתת מול שיפוט אנושי ומשמשת במסגרת מגבלות ברורה. אבל החלפת משוב אנושי במשוב מודלי במשימה שהוזמנה במיוחד כדי לאסוף העדפות אנושיות מחלישה את העצמאות של אות האימון — וזו, ככל הנראה, הסיבה לאיסור המדווח.
לפי הדיווח, למפקחים הונחו שלא להסתמך על גלאי כתיבה מבוססי AI כגון GPTZero. במקום זאת, הם התבקשו לבחון דפוסי עבודה ואת הטקסטים עצמם בבדיקה אנושית: למשל ניסוח אחיד באופן חריג, דפוסי פיסוק או עיצוב, וקצב השלמה שנראה בלתי סביר. 6
לגישה זו יש מגבלה ברורה: אף אחד מהסימנים הללו, כשלעצמו, אינו מוכיח שעובד השתמש ב-AI. כותב מהיר עשוי להיות מנוסה, ודמיון בניסוחים עשוי לנבוע מהנחיות דירוג משותפות. לכן, שימוש הוגן בסימנים כאלה מחייב להבחין בין עילה לבדיקה נוספת לבין ראיה מספקת להרחקת אדם מהפרויקט.
ארגונים נוטים שלא לפרסם כללי איתור מפורטים נגד מניפולציה, משום שרשימת בדיקה מדויקת עלולה להפוך למדריך לעקיפת הבקרה. קבלנים יכולים לשנות ניסוחים, להוסיף השהיות או לעצב את הטקסט אחרת — ובכל זאת להעביר את השיפוט למודל.
אלא שסודיות יוצרת גם סיכון משלה. כשעובדים אינם יודעים כיצד התקבלה החלטת איכות, קשה יותר לערער על טעויות. מערך אמינות יציב זקוק לשיטות איתור חסויות, אך גם לכללים ברורים, לתיעוד החלטות ולמסלול ערעור או תיקון בעל משמעות.
לפי הדיווחים, Mercor מסרה כי שימוש ב-AI לביצוע עבודת ההערכה מפר את המדיניות, וכי מקרים מאומתים מובילים להסרה מיידית מהפרויקט הרלוונטי. עוד דווח שהכללים אסרו שימוש רחב יותר בסיוע של AI, לרבות כלים לכתיבת משוב או הערות. 6
40
המקרה המדווח של דירוגים גרועים שניתנו במכוון ממחיש את הנקודה הרחבה יותר: "משוב אנושי" אינו אמין אוטומטית רק משום שאדם הזין אותו. בודק עלול למהר, לא להבין את כללי ההערכה, לנסות למקסם תפוקה, לפעול בחוסר תום לב או לנסות לשחק מול מערכת בקרת איכות לא שקופה. 20
זו בעיית תמריצים לא פחות משהיא בעיה טכנית. מפתח המודל זקוק לשיפוטים מכוילים ובתום לב, שינבאו התנהגות טובה יותר בעולם האמיתי. קבלן, לעומת זאת, עשוי להיות מתוגמל בעיקר על מהירות, השלמת משימות או הימנעות מדחייה. כאשר התמריצים האלה מתנגשים, הנתונים עלולים להיות רועשים או מוטים באופן שיטתי.
ביקורת אנושית עדיין חיונית לשיפוטים תלויי הקשר, סובייקטיביים או כאלה שקשה לאמת אוטומטית. אבל היא עובדת טוב יותר כמערכת של איזונים ובקרות, ולא כזרם פשוט של ציונים אישיים. אמצעי הגנה מעשיים כוללים:
המסקנה פשוטה: אימון על העדפות אמין רק במידה שהתהליך שיוצר אותן אמין. בודקים אנושיים אינם ערובה קסומה לאיכות, ושיפוטים שנוצרו ב-AI אינם יכולים להחליף בקלות משוב אנושי עצמאי כאשר המטרה היא להבין מה אנשים באמת מעריכים.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
לפי דיווחים, קבלנים הוסרו מעבודת ההערכה לאחר שהשתמשו ב AI, משום שפרויקט Lily נועד להפיק שיפוטים אנושיים עצמאיים ולא משוב שנכתב בידי מודל.
לפי דיווחים, קבלנים הוסרו מעבודת ההערכה לאחר שהשתמשו ב AI, משום שפרויקט Lily נועד להפיק שיפוטים אנושיים עצמאיים ולא משוב שנכתב בידי מודל. בפרויקט Lily מאות קבלנים קוראים שיחות אמיתיות עם ChatGPT, מסכמים את כוונת המשתמש ומדרגים עד ארבע תשובות בסולם של 1–7; הדיווחים על יותר מ 10,000 קבלנים מתייחסים למערכי הדירוג הרחבים יותר של OpenAI, ולא לפרויקט Lily לבדו.
הפרשה מדגישה שמשוב אנושי אינו אמין מעצם היותו אנושי: יש צורך בכיול, בדיקות איכות, ביקורות חופפות ותהליכי ערעור.